ClawBench: gli agenti AI sanno fare la spesa online? Il benchmark sui siti veri dice di rado

Centocinquantatré commissioni quotidiane, dall'ordine a domicilio alla candidatura di lavoro, eseguite su 144 siti in produzione con l'ultimo clic intercettato prima che arrivi al server. Il migliore degli otto modelli provati ne porta a termine un terzo. Come funziona la gabbia di sicurezza, che cosa dicono i numeri e dove si fermano gli agenti: spesso a un passo dal tasto «Conferma».

Chi ha provato a insegnare a un genitore a prenotare una visita online conosce la scena. La parte difficile non è capire che cosa fare: è il banner dei cookie che copre il pulsante, il codice che arriva via SMS, il campo della data che vuole le barre e non i trattini, la casella «non sono un robot» che non si convince. E alla fine, con tutto compilato, l’esitazione davanti a «Conferma prenotazione»: e se sbaglio? La commissione si inceppa spesso negli ultimi metri, non nei primi.

È esattamente il tratto di strada che misura ClawBench: Can AI Agents Complete Everyday Online Tasks?, uscito su arXiv il 9 aprile 2026 (2604.08523), rivisto il 20 luglio e segnalato in questi giorni fra i paper in tendenza su Papers with Code. Lo firmano ventotto autori fra University of British Columbia, University of Waterloo, Vector Institute, Carnegie Mellon, Lehigh, Manchester, HKUST, Tsinghua, Fudan e altri atenei e aziende, con Yuxuan Zhang, Wendong Xu e Ping Nie a guidare il progetto e Wenhu Chen e Kelsey R. Allen fra i supervisori. La domanda è quella del titolo, e la risposta è sgradevole per chi vende agenti come assistenti personali: il miglior modello provato, Claude Sonnet 4.6, completa il 33,3% dei compiti. GPT-5.4 si ferma al 6,5%.

Che cosa mancava

Di benchmark per agenti che usano il browser ce ne sono molti, e molti sono ormai vicini alla saturazione. Il paper li divide in tre famiglie. Quelli su tracce registrate, come Mind2Web, chiedono all’agente di prevedere l’azione giusta su pagine congelate: misurano la mira, non la commissione. Quelli in sandbox, come WebArena, VisualWebArena o OSWorld, fanno girare siti ricostruiti in casa: controllabili e riproducibili, ma senza i popup, i controlli anti-bot e il JavaScript capriccioso dei siti veri. Quelli sul web reale, come WebVoyager o Online-Mind2Web, portano l’agente su siti in produzione ma gli chiedono quasi solo di leggere: trovare un prezzo, estrarre una risposta.

Il pezzo che manca è la scrittura: comprare, prenotare, candidarsi, aggiornare un profilo, compilare un modulo lungo con i dati giusti. Sono le cose che una persona vorrebbe davvero delegare, ed è anche per questo che nessuno le misurava: un agente che sbaglia su un sito vero ordina davvero dieci pizze.

Come è fatto un agente (il ciclo osserva, ragiona, agisce) e perché valutarlo è più difficile che valutare un modello che risponde a una domanda: le architetture e i criteri di valutazione degli agenti sono spiegati nel libro.

Leggi «Architetture e valutazione» nel libro →

L’ultimo clic, intercettato

La soluzione di ClawBench è un’idea semplice eseguita con cura. Per ognuno dei 153 compiti un annotatore umano esegue la commissione per intero e individua la richiesta HTTP finale, quella che renderebbe l’azione irreversibile: l’invio dell’ordine, della prenotazione, della candidatura. Ne annota l’indirizzo, il metodo e i campi che deve contenere. Quando poi tocca all’agente, un’estensione di Chrome registra le azioni nel browser e un server che parla con il browser attraverso il Chrome DevTools Protocol sorveglia il traffico in uscita: tutto passa (caricamenti, ricerche, login, script, analitiche) tranne quella richiesta, che viene catturata con il suo contenuto e bloccata prima di arrivare al server.

È come lasciare che qualcuno faccia tutta la fila alla posta, compili il bollettino e lo porga allo sportello, e fermargli la mano un attimo prima che il timbro scenda. Il resto del mondo reale resta intatto: il sito cambia layout, chiede i cookie, fa partire un CAPTCHA, esattamente come farebbe con un cliente.

ClawBench: il sito è vero, l’ultimo clic no Agente modello + harness OpenClaw Chromium filtro CDP + estensione Sito in produzione 144 piattaforme pagine, ricerche login, campi passano «Conferma ordine» fermata e registrata cinque livelli di traccia video screenshot traffico HTTP messaggi azioni + traccia umana di riferimento + richiesta intercettata giudice passa / non passa

La gabbia, gli autori lo scrivono con onestà, vale per il singolo compito e non per la navigazione in generale. Per questo hanno escluso le commissioni i cui effetti non si possono fermare con una richiesta sola: modifiche incontrollate alle impostazioni dell’account, pagamenti reali o abbonamenti senza un punto sicuro in cui interrompere, codici OTP obbligatori via telefono, verifiche con documento d’identità, scritture irreversibili a metà percorso. Sulle 153 esecuzioni umane di riferimento il filtro ha bloccato ogni richiesta finale annotata che il riferimento raggiungeva, senza fermare per errore nulla della navigazione. Fra le 177.687 richieste di scrittura non finali (POST, PUT, PATCH, DELETE) registrate nelle esecuzioni degli agenti, il 57,1% era tracciamento pubblicitario, il 41,5% sfide dei CDN e letture GraphQL inviate come POST; le 464 che contenevano parole come «submit» o «checkout», controllate a mano, erano anteprime e inizializzazioni, nessuna capace di chiudere un ordine.

Chi giudica

Ogni esecuzione viene registrata su cinque livelli: video della sessione, screenshot a ogni passo, traffico HTTP, messaggi dell’agente, azioni a basso livello del browser. A decidere se il compito è riuscito non è un controllo sull’URL finale ma un altro agente, un Agent-as-Judge basato su Claude Sonnet 4.6 con un prompt fisso, che confronta la traccia dell’agente con quella umana e con il contenuto della richiesta intercettata. Il verdetto è binario: per un compito $t$, con istruzione $q^{(t)}$, traccia dell’agente $T_a^{(t)}$ e traccia umana $T_h^{(t)}$,

$$\mathrm{Score}(t) = A\big(q^{(t)}, T_a^{(t)}, T_h^{(t)}\big) \in \{0, 1\}, \qquad \mathrm{SR} = \frac{1}{|\mathcal{T}|}\sum_{t \in \mathcal{T}} \mathrm{Score}(t).$$

Il percorso non deve coincidere con quello umano: conta che si arrivi allo stesso stato finale con gli stessi valori nei campi. C’è un conflitto di interessi evidente, e gli autori lo affrontano: il giudice appartiene alla stessa famiglia del modello che vince. Su tutti i 153 compiti, rivisti anche da un revisore umano, gli autori misurano quanto spesso giudice e umano concordano. In entrambi i casi, sul totale, il giudice promuove un po’ meno compiti dell’umano, non di più.

Il giudice e il revisore umano tracce dell’agente, 153 compiti · successi secondo l’uno e l’altro
Agente valutato Accordo Giudice Umano
Claude Sonnet 4.6 93,46% 33,33% 34,64%
GPT-5.4 84,97% 6,54% 8,50%

I numeri

Otto modelli, tutti dentro lo stesso harness, OpenClaw, che dà al modello un Chromium in un container isolato e un insieme fisso di azioni: navigare, cliccare, scrivere, scorrere, osservare la pagina. Trenta minuti di tempo per compito. Nessuno arriva a metà dei compiti.

La classifica di ClawBench tasso di successo · più alto è meglio
Modello Successo
Claude Sonnet 4.6 33,3%
Qwen 3.5 26,1%
GLM-5 24,2%
Gemini 3 Flash 19,0%
Claude Haiku 4.5 18,3%
Gemini 3.1 Pro 9,8%
GPT-5.4 6,5%
Gemini 3.1 Flash Lite 3,3%

Per confronto, lo stesso Sonnet 4.6 ottiene il 72,5% su OSWorld-Verified e il 66,4% su WebArena-Verified secondo la figura d’apertura del paper.

La difficoltà non è concentrata in pochi compiti impossibili. Sessantotto compiti su 153, il 44,4%, non li risolve nessun modello; uno solo lo risolvono sette modelli su otto; nessuno tutti e otto. E la classifica cambia con il dominio: Sonnet guida sulla vita quotidiana, sull’accademia e sui social, GLM-5 sul lavoro, Haiku 4.5 sullo sviluppo software.

Anche i costi dicono qualcosa. Sonnet 4.6 spende in media 7,51 dollari e 5,47 milioni di token per compito; GLM-5 si ferma a 0,64 dollari per il 24,2%, cioè circa un dodicesimo del costo per nove punti in meno. Qwen 3.5 arriva al 26,1% con 2,52 milioni di token e 42 chiamate agli strumenti in media. GPT-5.4 ne fa solo 13: non è efficienza, è resa anticipata.

Dove si fermano

La parte più interessante del paper è l’analisi delle tracce, perché dice che i fallimenti non sono soprattutto errori di ragionamento. Le esecuzioni fallite usano più azioni di quelle riuscite: per Sonnet 4.6 la mediana è di 64 chiamate sui successi e 120 sui fallimenti, con una coda che arriva a 354. Non è esplorazione insufficiente, sono giri a vuoto: tentativi ripetuti contro un muro anti-bot, pagine rifotografate, assalti ostinati a un modulo che non si chiude.

Il muro anti-bot è il primo ostacolo. In un caso raccontato per esteso, GLM-5 deve candidarsi per un affitto su Zillow, trova la pagina bloccata da una verifica anti-bot «tieni premuto per confermare di essere umano», tenta la pressione prolungata, poi la riconosce («la verifica non è qualcosa che posso aggirare facilmente con interazioni automatiche»), eppure inietta eventi di tocco e di mouse sintetici, poi abbandona Zillow per un sito concorrente senza protezioni, violando il compito e senza completarlo nemmeno lì. Riconoscere l’ostacolo non basta ad avere un piano per superarlo. Non aiuta che gli agenti si muovano in un modo che nessun essere umano avrebbe: fra un tasto e l’altro passano 3-16 millisecondi contro i 191-271 di una persona, il mouse non traccia nessuna traiettoria continua, lo scorrimento procede a scatti grossolani.

Il secondo ostacolo è l’ultimo miglio. Sei modelli su otto concentrano molti fallimenti al penultimo stadio: arrivano alla pagina di conferma e non inviano. Sonnet 4.6, su un negozio di cosmetici, aggiunge i due prodotti giusti al carrello, compila email e nome, e la traccia si interrompe a metà dell’indirizzo. Su DoorDash dichiara «entrambi gli articoli sono corretti» dopo aver scelto una confezione di McNuggets diversa da quella del riferimento umano, e la richiesta finale parte senza un campo obbligatorio, l’identificativo del carrello: nessun ordine sarebbe arrivato. La percezione interna di aver finito non coincide con lo stato del server. E c’è un rischio che il punteggio binario non vede: in un compito giudicato riuscito, l’agente ha inventato un numero di telefono che nei dati dell’utente non c’era.

I limiti

Riproducibilità in cambio di realismo. I siti cambiano layout, fanno test A/B, rispondono diversamente per regione: lo stesso compito rieseguito domani può essere un altro compito. Le tracce registrate rendono ogni esito verificabile, ma non ripetibile. Ed essendo costose, gli autori riportano poche ripetizioni e poche ablazioni.

Si misura l’agente, non il modello. Tutti i punteggi valgono dentro OpenClaw, con quel prompt e quelle azioni. Un harness diverso potrebbe riordinare la classifica, e GPT-5.4, che in 85 esecuzioni su 153 chiude la sessione da sé, è il caso in cui il dubbio pesa di più.

Copertura larga, non profonda. Un compito o poco più per piattaforma, e il paper stesso segnala che mancano i flussi solo da mobile, quelli non in inglese e quelli che dipendono dall’accessibilità. Sono sottorappresentati, dice il paper, non esclusi; ma per un lettore italiano vuol dire che i siti con cui si prenota una visita al CUP o si paga un bollettino non sono ciò che è stato misurato.

Perché conta adesso

Gli assistenti che «fanno le cose per te» vengono presentati ogni mese come prossimi a sostituire la nostra mezz’ora di commissioni online. ClawBench non dice che non funzionano: dice che su siti veri, con commissioni che lasciano un segno, funzionano una volta su tre nel caso migliore, e che il problema si sposta. Non è più capire che cosa chiede l’utente, ma reggere l’attrito di un web costruito per tenere fuori i bot, e decidere di premere il tasto che rende tutto definitivo, con i dati giusti e senza inventarne. La gabbia dell’ultima richiesta, che il paper rilascia con compiti, strumenti e tracce, è anche una lezione per chi questi agenti li mette in produzione: se un ordine non si può fermare prima dell’invio, forse un agente non dovrebbe ancora inviarlo da solo.

I commenti sono riservati agli iscritti.

Accedi per commentare