In un cantiere il direttore dei lavori non posa i mattoni. Non passa nemmeno a firmare ogni carriola di sabbia: se lo facesse, i muratori passerebbero la giornata ad aspettarlo e lui firmerebbe cose che non ha tempo di guardare. Passa in pochi momenti precisi, quando si tracciano le fondamenta e quando si fa il collaudo. Un errore nel primo momento non lo ripara nessuno dopo; un errore nel secondo arriva dritto a chi ci andrà ad abitare.
È, trasferita ai laboratori automatici, la conclusione più interessante di AutoResearchClaw: Self-Reinforcing Autonomous Research with Human-AI Collaboration, uscito su arXiv il 19 maggio 2026 (2605.20025, la versione 2 è del 23 maggio). Lo firmano trentasei autori, con Jiaqi Liu e Shi Qiu a pari merito e Huaxiu Yao in chiusura: diciassette della University of North Carolina a Chapel Hill, gli altri da undici istituzioni fra cui Stanford, Berkeley, Meta e Google. Il sistema è open source, su github.com/aiming-lab/AutoResearchClaw.
Che cosa non funziona nei sistemi di oggi
Da AI Scientist in poi, gli agenti che promettono di fare ricerca da soli seguono spesso una linea retta: idea, esperimento, articolo. Gli autori rimproverano loro tre cose. Lo stesso modello propone un’ipotesi e la giudica, e quindi non ha alcun motivo di smontarla. Al primo errore di esecuzione il giro si ferma e quel che era stato calcolato si butta, come fa AIDE-ML. E ogni tentativo riparte da zero, senza ricordare gli sbagli dei precedenti: è il caso di Agent Laboratory, dove gli agenti collaborano dentro un giro ma non fra un giro e l’altro.
La tesi del paper è che i tre difetti vanno curati insieme, perché si alimentano a vicenda: ipotesi migliori chiedono meno revisioni, un’esecuzione robusta conserva risultati parziali utili all’analisi, la memoria dei giri passati migliora ipotesi ed esperimenti.
Ventitré tappe, cinque meccanismi
AutoResearchClaw è una pipeline di 23 tappe divise in tre fasi: scoperta (delimitazione del problema, ricerca bibliografica, ipotesi), sperimentazione (codice, esecuzione, analisi dei risultati), scrittura (bozza, revisione, controllo delle citazioni). Ogni tappa dichiara un contratto formale di ingresso e uscita e si può riprendere da un punto di salvataggio. Sopra la struttura lavorano cinque meccanismi.
Il dibattito. In due momenti la decisione non la prende un agente solo ma un collegio di tre, con ruoli diversi. Sulle ipotesi discutono un Innovatore, che propone idee rischiose, un Pragmatico, che guarda al tempo e all’hardware disponibili, e un Contrario, che cerca punti deboli e fattori confondenti; un sintetizzatore ne ricava da due a quattro ipotesi falsificabili. Sui risultati, a esperimenti finiti, discutono un Ottimista, uno Scettico che contesta la significatività statistica e un Metodologo che controlla riproducibilità e contaminazione dei dati. In appendice gli autori provano anche collegi da due e da cinque: con due il confronto si riduce a pro e contro e la varietà delle ipotesi cala del 23%; con cinque i token crescono del 67% per l’8% di varietà in più.
Perché un collegio di agenti con ruoli diversi può correggere gli errori di un agente solo, e quando invece si riduce a un’eco di voci uguali: lo spiega il capitolo sul consenso fra agenti.
L’esecuzione che si ripara. Il codice gira in container Docker con la rete staccata durante l’esperimento, così non può né spedire fuori i risultati né scaricarne di già pronti, e le metriche passano da un modulo di valutazione in sola lettura che il codice generato non può riscrivere. Quando un esperimento fallisce o dà risultati degeneri, un ciclo di riparazione ne diagnostica la causa, e il sistema sceglie fra tre strade: Proceed se le prove reggono l’ipotesi, Refine se i risultati sono deboli ma la direzione è buona, Pivot se l’impostazione è sbagliata, e allora si torna alle ipotesi con il fallimento registrato come dato.
I numeri verificabili. Durante l’esecuzione si costruisce un registro di tutti i valori prodotti davvero: medie, deviazioni standard, misure per seme. Le tabelle dell’articolo si compilano solo da lì, e dopo la stesura un verificatore riestrae ogni numero e lo confronta col registro. Un valore senza riscontro nell’abstract, negli esperimenti o nei risultati fa respingere il documento; altrove viene sostituito da un segnaposto visibile. L’agente che scrive può leggere il registro, non modificarlo. Le citazioni passano invece per quattro controlli in cascata (CrossRef, OpenAlex, arXiv, Semantic Scholar), e quelle giudicate inventate vengono tolte.
L’umano a scelta. Sette modalità vanno dall’autonomia completa (Full-Auto) all’approvazione di ogni tappa (Step-by-Step). In mezzo: Gate-Only, tre soste fisse; Thorough, una sosta a ogni confine di fase; CoPilot, sei punti di decisione scelti, dal disegno delle ipotesi alla stesura; e due varianti che spezzano CoPilot nella metà prima degli esperimenti e in quella dopo. Un meccanismo chiamato SmartPause ferma la pipeline quando l’incertezza stimata supera una soglia che si adatta a quanto spesso il ricercatore ha corretto il sistema in passato.
La memoria degli errori. A fine giro il sistema estrae lezioni strutturate (categoria, gravità, rimedio) e le reinserisce nei prompt dei giri successivi, senza riaddestrare niente. Ogni lezione pesa meno col passare del tempo:
$$w(l) = s(l)\cdot \exp\!\left(-\ln 2 \cdot \frac{\Delta t}{T_{1/2}}\right),$$
dove $s(l)$ è la gravità e $T_{1/2}$ il tempo di dimezzamento, trenta giorni di default. Con sette giorni, riportano gli autori, lezioni ancora utili scadono troppo presto; senza decadimento, dopo una quindicina di giri si accumulano consigli contraddittori.
I numeri
Il confronto principale si fa su ARC-Bench, un banco di 25 argomenti di machine learning introdotto dagli autori stessi, dalla calibrazione del dropout alla scoperta causale. Per rendere paragonabili sistemi che non sanno tutti arrivare fino al paper, si giudica la fase sperimentale: sviluppo del codice (CD), esecuzione (CE) e analisi dei risultati (RA), con l’analisi che pesa il doppio,
$$S = 0{,}25\,\mathrm{CD} + 0{,}25\,\mathrm{CE} + 0{,}5\,\mathrm{RA}.$$
Tutti i sistemi usano lo stesso modello, GPT-5.3-codex, e lo stesso ambiente. A dare i voti sono due agenti revisori, uno su Claude Opus 4.7 e uno su GPT-5.4, con un esperto umano su un sottoinsieme di controllo. AutoResearchClaw in modalità CoPilot è in testa, e il «+54,7%» dell’abstract viene da questo confronto. Sul codice AutoResearchClaw e AIDE-ML quasi si equivalgono (0,968 contro 0,958); la distanza si apre sull’esecuzione e soprattutto sull’analisi, dove AutoResearchClaw fa 0,523 contro 0,261 di AI Scientist v2. È lì, secondo gli autori, che lavorano il collegio sui risultati e il registro dei numeri.
| Sistema | S |
|---|---|
| AutoResearchClaw, CoPilot | 0,648 |
| AutoResearchClaw, senza intervento umano | 0,596 |
| AIDE-ML | 0,511 |
| AI Scientist v2 | 0,419 |
La parte che vale la lettura è l’esperimento sull’intervento umano: dieci argomenti portati fino al paper, sette modalità, un voto da 1 a 10 con la sufficienza a 5.
CoPilot ottiene un voto medio di 7,27 e l’87,5% di paper sufficienti. Step-by-Step, che interviene su tutte le 23 tappe, si ferma a un voto di 5,19, con il 50% di sufficienze; Full-Auto a 4,03, con il 25%. Le quote sono calcolate sui soli giri arrivati a un paper valido: l’87,5% di CoPilot sono sette paper su otto. Più controllo non vuol dire più qualità: secondo gli autori, le approvazioni sulle tappe secondarie aggiungono rumore, non informazione. Le due metà di CoPilot spiegano il perché. L’intervento solo prima degli esperimenti rende il disegno fattibile (in un caso riduce un piano fattoriale di 240 celle a 60) ma alza poco la qualità, 37,5% di sufficienze; quello solo dopo tiene le conclusioni aderenti alle misure, ma è valido su sei argomenti su dieci, perché a valle non si può creare un’evidenza che manca. Gate-Only, con tre soli interventi, raddoppia le sufficienze di Full-Auto ed è valido su tutti e dieci gli argomenti.
L’ablazione, in autonomia completa e tenendo il migliore di tre tentativi, attribuisce a ogni meccanismo un mestiere. Senza dibattito il voto medio scende da 5,62 a 4,25; senza riparazione i paper completati passano da 10 a 6 su 10. Il dato più istruttivo riguarda la verifica: toglierla fa salire i paper sufficienti da 3 a 5 su 10, ma a un controllo manuale tre di quei cinque contengono valori che non compaiono in nessuna misura. Senza dibattito e riparazione insieme solo quattro paper arrivano in fondo, e nessuno alla sufficienza.
Che cosa non dice
La riserva più grossa la dichiarano gli autori stessi, in appendice: negli esperimenti sull’intervento umano non ci sono persone. Gli interventi sono scritti in anticipo e iniettati alle tappe previste; uno studio con ricercatori veri, precisano, richiederebbe l’approvazione di un comitato etico. La curva di CoPilot misura quindi dove conviene mettere un buon consiglio già scritto, non come si comporta un ricercatore reale stanco, distratto o in disaccordo con la macchina.
Il resto va aggiunto leggendo. Il banco è degli autori, e gli argomenti di machine learning sono scelti perché girino su una CPU in meno di dieci minuti: esperimenti piccoli, lontani da quelli di un laboratorio vero. Il voto da 1 a 10 del test sull’intervento umano non ha un giudice esterno ben descritto; nel caso di studio coincide con quello del cancello di qualità interno alla pipeline. I campioni sono minuscoli, dieci argomenti per modalità, e solo per il dibattito compare un test di significatività ($p = 0{,}003$). Tabella e testo non sempre coincidono: 6 interventi contro 19 per CoPilot, 23 contro 29 per Step-by-Step, e il testo chiama Gate-Only l’unica modalità valida su tutti gli argomenti, quando in tabella lo è anche Step-by-Step. E l’estensione ad altre discipline, dove su fisica e biologia i due concorrenti prendono zero, dice soprattutto che i loro ambienti non avevano i programmi di dominio, come ammettono gli autori, non che ragionino peggio.
Infine la verifica ha un confine, e il paper lo mostra bene. In un caso di studio la versione autonoma produce un articolo completo in cui otto strategie di validazione incrociata danno tutte lo stesso risultato, distorsione e varianza nulle: numeri veri, registrati, che passano il controllo. Solo che non rispondono alla domanda. Il registro garantisce che un numero sia stato misurato, non che l’esperimento abbia senso. Anche la scrittura ha i suoi difetti: in un controllo su venti articoli prodotti, tutti e venti hanno l’abstract prima del titolo nel sorgente LaTeX, e in sedici una figura compare due volte.
Perché conta adesso
Un giro costa, secondo gli autori, fra 3 e 15 dollari di chiamate al modello. A quel prezzo il rischio non è che una macchina faccia ricerca, ma che faccia articoli: tanti, plausibili, con numeri e citazioni dall’aria vera. Gli autori lo nominano e sconsigliano di usare il sistema per invii in serie. Due scelte di AutoResearchClaw vanno nella direzione giusta, e servono anche fuori da questo sistema: un registro dei numeri che chi scrive non può toccare, e l’idea che l’umano vada messo dove una decisione non si recupera più, non ovunque. Il paper sostiene la seconda solo con interventi simulati. Per crederci davvero serve lo studio con persone vere che gli autori stessi indicano come passo successivo.

I commenti sono riservati agli iscritti.
Accedi per commentare