In un cantiere italiano c’è un documento che nessuno ama compilare: il giornale dei lavori. Il direttore annota giorno per giorno che cosa si è gettato, con quale calcestruzzo, quale prova ha superato. Al collaudo non basta che l’edificio stia in piedi. Se il progetto prometteva isolatori sismici alla base, il collaudatore vuole sapere che ci sono, dove sono e che cosa ha dimostrato di reggere proprio grazie a loro. Una casa che sta in piedi per altre ragioni non è la casa che era stata progettata.
Gli «AI scientist», i sistemi che dall’idea arrivano all’esperimento e al rapporto senza mani umane, oggi rischiano di costruire case che stanno in piedi per altre ragioni. È la tesi di Externalizing Research Synthesis and Validation in AI Scientists through a Research Harness, depositato su arXiv a giugno 2026 (numero 2606.18874, rivisto fino alla terza versione a luglio), con il codice pubblico. Lo firmano venti autori, quasi tutti dell’X-LANCE Lab della Shanghai Jiao Tong University, con Lu Chen come autore di riferimento. Il sistema si chiama Xcientist, e per gli autori la difficoltà di un AI scientist non è solo l’autonomia: è l’attribuzione.
La deriva del claim
Gli autori partono da un esperimento diagnostico. Prendono AI-Scientist-v2, il sistema di Sakana che nel 2025 ha fatto parlare di paper da workshop scritti in automatico, lo configurano con lo stesso modello usato da Xcientist e lo fanno girare su tre problemi. In tutti e tre i casi il risultato è rispettabile: una proposta plausibile, codice non banale che si esegue. E in tutti e tre le prove conservate non bastano ad attribuire il risultato al meccanismo che la proposta dichiarava.
Nel caso della memoria per agenti, la proposta parlava di revisione controfattuale dei ricordi con operatori espliciti; gli operatori esistevano, ma per lo più come aggiornamenti temporali o testuali superficiali, e le migliaia di revisioni registrate non erano collegate a prove di supporto, a cambiamenti nel recupero né ad ablazioni per operatore. Nel caso delle previsioni di traffico, la proposta era un modulo da innestare su backbone forti come Graph WaveNet; il codice era invece un modello nuovo e autonomo, e il risultato salvato conteneva una sola variante e un solo seed, senza i controlli necessari. Nel caso delle PINN, un punteggio promettente non si poteva attribuire né al gating di scala né al bilanciamento spettrale dichiarati, perché mancavano i controlli.
Il paper chiama questo fenomeno deriva del claim (claim drift) e ne distingue tre forme: semantica, quando un’operazione viene realizzata solo in superficie; sperimentale, quando l’esperimento non testa più l’intervento dichiarato; meccanicistica, quando un guadagno numerico non si può imputare al componente che si dice responsabile. La conclusione è netta: un’automazione che gira non è ancora un’automazione scientifica.
Xcientist è un sistema multi-agente attorno a un modello linguistico: si dà per noto che cosa sia un agente, con il suo ciclo di ragionamento, strumenti e osservazione. Il libro lo costruisce da capo.
Portare il ragionamento fuori dal modello
La risposta di Xcientist è togliere al modello linguistico il monopolio delle due capacità su cui, secondo gli autori, poggia il giudizio scientifico: che cosa si sa già (la sintesi) e che cosa si è davvero dimostrato (la validazione). Entrambe diventano strutture esterne, salvate su disco, ispezionabili.
La sintesi poggia su un grafo dell’evoluzione dei metodi, costruito da circa 50.000 paper di informatica indicizzati da Semantic Scholar. Ogni paper viene letto per intero, non dall’abstract, perché componenti, baseline, dataset e limiti negli abstract spesso mancano; ne escono schede con problemi, contributi, componenti, innovazioni e limitazioni, ancorate a citazioni del testo sorgente. Il risultato conta circa 72.000 nodi di metodo, 250.000 nodi baseline, 63.000 nodi dataset e 1,15 milioni di archi tipizzati. Su questo grafo lavorano gli agenti di rassegna e di ideazione: le idee partono da lacune che il grafo documenta, e la novità di ogni componente si controlla contro quelli già esistenti.
L’ideazione è una ricerca, non un brainstorming. Ogni idea è una struttura con problema, meccanismo, componenti, vantaggi attesi, rischi e piano di validazione; una Monte Carlo Tree Search la modifica aggiungendo, togliendo, sostituendo o ricollegando componenti, e la esplora sotto cinque «gusti» diversi: dall’inventore visionario all’ingegnere prudente, dal costruttore di ponti fra campi a chi mette le prove al primo posto. Il voto a ogni candidato lo dà un modello, su novità, fattibilità, rischio e altri sei criteri. I migliori candidati si fondono sotto una tesi dominante: i componenti degli altri sopravvivono solo se la rafforzano.
La ricerca ad albero che Xcientist usa sulle idee è la stessa che ha portato AlphaGo a scegliere le mosse: selezione, espansione, simulazione, aggiornamento. Il libro la spiega sul caso in cui è nata.
La validazione è la parte più originale. Ogni esperimento vive in uno spazio di lavoro isolato e procede per fasi (preparazione, implementazione, esperimento standard, ablazioni), ciascuna con un contratto: input richiesti, operazioni permesse, file da consegnare, criteri di accettazione. Un validatore indipendente deve firmare prima che si passi alla fase dopo, e ogni tentativo di riparazione resta negli archivi. L’implementazione deve esporre un interruttore di ablazione per ogni componente dichiarato, e il sistema dichiara convergenza solo quando ogni componente ha la sua prova. Perfino il rapporto finale passa da un audit: ogni nome di funzione, valore di parametro e percorso di file citato deve corrispondere al codice reale.
Tre casi, numeri anche quando non conviene
La valutazione è per casi di studio, e gli autori lo dichiarano: l’oggetto non è il punteggio finale ma la traiettoria che ci arriva.
Memoria per agenti. Partendo dall’implementazione di A-Mem, Xcientist converge in quattro versioni principali su un design sobrio: note atomiche immutabili, arricchimento leggero, recupero deterministico a slot. Su un sottoinsieme di LoCoMo, con lo stesso modello di embedding e lo stesso generatore di risposte (gpt-4o-mini) per entrambe le condizioni, l’F1 testuale sale da 0,306 a 0,391, un +27,8% relativo, mentre i token medi per domanda scendono da 2.844 a 1.017, il 64,2% in meno. Il confronto però è con la stessa pipeline a componenti spenti, non con altri sistemi di memoria. E c’è un dettaglio che il paper presenta come virtù: i file di ablazione per componente non erano compatibili con la tabella finale, e il sistema non li ha promossi a risultato. Il claim resta limitato al confronto fra sistema completo e base: proprio qui, dunque, manca l’attribuzione ai singoli componenti.
Previsione del traffico. Su PEMS-BAY, partendo da Graph WaveNet, il caso più istruttivo è un fallimento. L’iterazione 3 (la numerazione parte da zero), battezzata DORA-GWNet, aveva ottenuto il punteggio più alto dalla ricerca ad albero grazie a una proiezione ortogonale che costringeva un ramo di correzione a lavorare solo su ciò che la diffusione del grafo non spiegava. L’ablazione ha mostrato che il meccanismo era inerte: toglierlo spostava l’errore medio assoluto sui dati completi di meno dello 0,12%. L’iterazione 4 lo sostituisce: il ramo propone liberamente una correzione $a$, e se ne tiene solo la parte che spiega il residuo della diffusione $e = h – d$, con
$$\alpha = \frac{\langle a, e \rangle}{\langle a, a \rangle + \lambda}, \qquad r = \alpha \, a,$$
dove $\lambda$ è un termine di regolarizzazione (ridge) che stabilizza la divisione. Stavolta l’ablazione dà ragione al meccanismo: rimuoverlo peggiora l’errore sui dati completi e la tenuta con il 40% dei dati mascherati a blocchi. L’errore medio, versione dopo versione, scende da 1,723 a 1,677 e poi a 1,574; risale a 1,644 con l’iterazione «migliore sulla carta»; chiude a 1,556.
Il terzo caso lavora con reti che imparano rispettando un’equazione differenziale: la loss contiene la fisica oltre ai dati. Il libro spiega come si costruiscono e dove falliscono.
PINN multiscala. Sull’equazione del calore, Xcientist separa una soluzione «grossa» stabilizzata e poi congelata da rami residui che possono aggiungere solo dettagli fini. In sei versioni il rango medio passa da 6,33 a 2,33, e la finale ottiene il miglior errore relativo $L_2$ medio su heat1d_multiscale (0,0672) e sul caso di calore di PINNacle (0,4307). Ma su heat2d_multiscale resta dietro: MMPINN arriva a 0,00661 e MultiscalePINNs a 0,0261, mentre la versione finale, stando alla figura di sintesi (il testo non dà il numero), si ferma attorno a 0,15. La sconfitta il paper la dichiara nel testo principale, ed è il punto: un AI scientist utile sa dire dove il proprio metodo vince e dove no.
Che cosa non dimostra
Gli autori dichiarano tre limiti: la qualità della sintesi dipende dalla copertura e dalla fedeltà del grafo, cioè dal parsing e dall’estrazione; la valutazione è per casi, e non stabilisce una capacità generale di scoperta; l’harness ha bisogno di repository che girano, dataset disponibili e protocolli sensati. Come lavoro futuro indicano metriche di processo come il tasso di deriva e la completezza dell’attribuzione, e prove in contesti meno curati.
Ed è qui il limite più grosso. Il paper introduce la deriva del claim e non la misura: il confronto con AI-Scientist-v2 si regge su tre esecuzioni descritte a parole, e Xcientist non viene fatto girare in parallelo per contare quante volte deriva a sua volta. In nessun punto del paper, appendici comprese, si dice quale modello linguistico guidi il sistema, dettaglio che pesa quando si confrontano due harness. Ogni caso è una sola traiettoria, e per memoria e traffico non si riportano ripetizioni con seed diversi. Resta anche una domanda interna: la ricerca ad albero valuta le idee con un modello, e nel caso del traffico il punteggio più alto è andato proprio al meccanismo inerte. L’ablazione l’ha scoperto; ma dice molto su quanto valgano i voti che un modello dà alle idee.
Perché conta adesso
Negli ultimi due anni gli AI scientist si sono moltiplicati (AI-Scientist, EvoScientist, InternAgent, ARIS, AlphaEvolve) e la gara si misura spesso in quanto lontano arrivano da soli. Xcientist sposta la domanda su che cosa si può controllare dopo. È la stessa richiesta del collaudatore: non basta che la casa stia in piedi, bisogna poter dimostrare perché. Un sistema che produce paper plausibili senza un giornale dei lavori scala la quantità di risultati, non la loro affidabilità. Questo paper non chiude il problema, ma gli dà un nome, una prima architettura e un criterio con cui giudicare i prossimi: chiedere a un AI scientist non solo che cosa ha trovato, ma se sa dimostrare che l’ha trovato con il meccanismo che dice.

I commenti sono riservati agli iscritti.
Accedi per commentare