Chi ha fatto una tesi sperimentale conosce il momento in cui i dati non dicono quello che ci si aspettava. Le strade sono due. La prima è onesta e scomoda: si torna dal relatore, si ammette che l’ipotesi non regge, si scrive un capitolo su che cosa non ha funzionato. La seconda è più comoda: si cambia la metrica, si toglie il dataset che rovina la media, si riscrive l’introduzione in modo che il risultato sembri quello cercato fin dall’inizio. La seconda non richiede malafede: basta decidere che cosa misurare dopo aver visto i numeri.
Un sistema che scrive paper da solo si trova davanti allo stesso bivio, con in più la tentazione di un modello linguistico: se un numero manca, può sempre scriverne uno plausibile. È il problema su cui è costruito Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill, depositato su arXiv il 12 agosto 2026 (2608.11924). Lo firmano nove autori del Vast Intelligence Lab e della University of Technology Sydney, con Zhuoyang Qian, Biao Wu, Yiran Wang e Chris D. Yan primi autori a pari merito e Wenhao Wang come autore di riferimento.
Non una piattaforma, una cartella di skill
Gli «scienziati automatici» degli ultimi due anni, da AI Scientist ad Agent Laboratory, da Kosmos ad AutoResearchClaw, sono applicazioni a sé: di solito un codice dedicato con un proprio server di orchestrazione, in qualche caso un database a grafo o uno scheduler di cluster. La domanda del paper è più pratica: se gli assistenti di programmazione sanno già leggere file, eseguire codice e usare strumenti, serve davvero un’altra piattaforma?
La risposta degli autori sono tredici skill, cioè istruzioni riutilizzabili che dicono che cosa un compito deve ottenere, con quali vincoli, con quali strumenti e che cosa deve lasciare sul disco, senza fissare ogni passo del ragionamento. Girano dentro Claude Code con un modello della famiglia Claude (il paper non dice quale versione) e comunicano solo attraverso i file di una cartella di progetto condivisa: il piano scrive blueprint.json, la ricerca bibliografica refs.bib, la scrittura le sezioni in LaTeX, e i dati misurati, quando ci sono, finiscono in results.facts.json. Un orchestratore leggero, ts-paper, decide soltanto l’ordine delle fasi; come svolgere ciascuna lo decide l’assistente guardando lo stato del progetto.
Qui si dà per noto che cosa sia un agente: un modello che ragiona, chiama uno strumento, osserva il risultato e ricomincia. Il ciclo, gli strumenti e la memoria su file sono costruiti da capo nel libro.
Il principio che regge tutto è una divisione del lavoro: il modello giudica, il codice esegue. Decidere come organizzare un argomento, quale letteratura conta, se un risultato sostiene una tesi: questo spetta al modello. Controllare la struttura del manoscritto, risolvere un DOI, compilare il LaTeX, disegnare un grafico dai dati misurati: questo lo fanno script deterministici, che danno sempre la stessa risposta e si possono verificare.
Le tabelle prima dei numeri
La pipeline parte da un bivio. Se l’utente porta solo un’idea o una proposta, il sistema lavora in Proposal Mode: può progettare esperimenti e preparare le tabelle, ma le celle dei risultati devono restare vuote. Se ci sono dati misurati, passa in Data-Aware Mode, e ogni affermazione quantitativa deve poggiare su quei dati. Seguono sette fasi fisse: piano, citazioni, scrittura, rifinitura, revisione, figure, assemblaggio. Dopo ognuna scatta un controllo deterministico, e la fase successiva parte solo se passa. Poi, se codice e dati lo permettono, un’ottava fase esegue davvero gli esperimenti e riscrive il manoscritto con i risultati.
Il dettaglio che distingue il sistema è l’ordine delle operazioni. Dataset, baseline, metriche, ablazioni e forma delle tabelle vengono fissati nel piano, prima di vedere un solo risultato. Gli autori lo chiamano una forma leggera di preregistrazione: la fase sperimentale eredita quel disegno e non può sostituirlo con un esperimento più facile o con dati sintetici. Un numero entra nel paper solo se si può risalire al dataset, alla configurazione, al seme casuale, alla metrica e al file di output da cui viene; se una risorsa manca, la cella resta vuota e la mancanza viene annotata.
Dopo gli esperimenti, ogni affermazione principale del manoscritto riceve un’etichetta fra cinque: sostenuta, parzialmente sostenuta, non sostenuta, contraddetta, da confermare. Da quella dipende l’azione: tenerla con parole adeguate alla prova, restringerla, lanciare l’esperimento mancante, toglierla o spostarla fra i limiti, restituirla all’autore umano. La correzione si propaga all’abstract, all’introduzione e alle conclusioni, e l’abstract si riscrive per ultimo. I risultati nulli o negativi restano nel testo.
Il ciclo dell’autosmentita
Gli autori danno un nome a un difetto, Self-Refutation Loop: il sistema formula un’ipotesi, lancia gli esperimenti, giudica che la prova non basta, corregge il metodo, rilancia, e giudica di nuovo che non basta. Non è un miglioramento iterativo, che a ogni giro chiude un problema concreto: è girare in tondo attorno a un’idea che forse semplicemente non funziona.
La cura è un tetto. I giri di esperimento, critica e revisione sono al massimo sette; se l’obiettivo non è ancora sostenuto, la traiettoria si chiude e diventa un rapporto di fallimento, con l’idea di partenza, i metodi tentati, i risultati osservati e il motivo per cui non bastavano. Non viene riscritta in un paper che sembri riuscito: il sistema riparte da un’idea diversa, e solo le traiettorie che reggono diventano un manoscritto. È, in piccolo, la prima delle due strade del tesista.
Accanto al tetto lavorano due forme di critica affidate al modello. La Self-Review controlla ogni modifica contro il testo che la circonda. L’Adversarial Review lancia più passaggi di revisione isolati (solidità teorica, disegno sperimentale, validità di sistema), e ogni rilievo deve citare il passo che contesta. Poi ogni obiezione viene messa alla prova da tre lati: il problema c’è davvero? È già risolto altrove nel testo? Esce dal perimetro dichiarato del lavoro? Quelle che sopravvivono tornano alla rifinitura, e si continua finché un giro non produce obiezioni nuove che reggano.
I numeri
La valutazione controllata usa otto argomenti di ricerca scelti in anticipo, con protocollo registrato con marca temporale esterna. La prima misura è quanti riferimenti bibliografici esistono davvero. La verifica è fatta a valle, con servizi bibliografici esterni e non con i controlli interni della pipeline, e Spark-to-Paper sta sopra anche ai preprint scritti da persone.
| Chi scrive | Riferimenti esistenti |
|---|---|
| Spark-to-Paper | 99,5% su 384 riferimenti |
| Otto preprint scritti da persone | 97,8% su 320 riferimenti |
| Articoli di AI Scientist, AI Scientist-v2 e Agent Laboratory | 91–96% |
| Bozza in un solo passaggio, stesso modello | 81% |
Il numero più istruttivo viene dall’ablazione. Gli autori iniettano nel materiale di partenza 36 affermazioni non sostenute, di dieci tipi diversi, e contano quante il sistema ne scopre:
$$\text{rilevamento} = \frac{\text{affermazioni scoperte}}{\text{affermazioni iniettate}}, \qquad \frac{5}{36} \approx 14\% \;\longrightarrow\; \frac{33}{36} \approx 92\%.$$
Il salto maggiore lo fanno i controlli, prima di qualunque revisione (deterministici e, precisa il testo, in parte basati sul modello). Self-Review e revisione avversaria aggiungono il resto.
| Fase | Scoperte |
|---|---|
| Punto di partenza | 14% |
| Più i controlli | 69% |
| Più la Self-Review | 81% |
| Più la revisione avversaria | 92% |
Delle obiezioni sollevate dai revisori e giudicate alla cieca, 42 su 57 erano problemi verificabili: una precisione del 74%. Il 96,4% degli elementi delle figure resta modificabile, escluse le figure lasciate raster di proposito: gli schemi esplicativi il sistema li fa disegnare a un generatore di immagini e poi li ricostruisce in HTML e li esporta in PDF vettoriale; i grafici dei risultati invece nascono direttamente dai dati, con codice di plotting.
Il prezzo: in media 11,9 milioni di token, 8,1 dollari e 3,2 ore per manoscritto. La bozza in un passaggio costa 0,66 dollari e 16 minuti. La quota più grossa del costo aggiuntivo, circa sette decimi, la portano i controlli: +8,1 milioni di token e +5,3 dollari sul sottoinsieme di tre argomenti usato per l’ablazione.
La fase delle citazioni è un caso di recupero seguito da verifica. Come funziona la generazione aumentata dal recupero, e perché riduce le invenzioni senza eliminarle, è spiegato nel libro.
Che cosa non misura
Il paper non ha una sezione dedicata ai limiti, e alcuni vanno detti. Il primo è il più importante: tutte le metriche di qualità riguardano l’integrità dell’artefatto, nessuna la sua qualità scientifica. Che una citazione esista non dice se sostiene la frase a cui è attaccata (la colonna della tabella principale si intitola, onestamente, «Citation exist.»); che le figure siano modificabili non dice se il metodo proposto sia nuovo o utile. Il paper non riporta nessuna valutazione umana del contributo dei manoscritti generati.
Il secondo riguarda la scala. Otto argomenti per il sistema completo, tre soltanto per il confronto appaiato con la bozza in un passaggio; gli intervalli riportati sono larghi (il 92% di rilevamento va da 78 a 97 nell’intervallo di Wilson). I sistemi concorrenti non sono stati rieseguiti: sono stati valutati gli articoli che avevano pubblicato, con modelli, argomenti e prezzi diversi. E sulla modificabilità delle figure il confronto è poco eloquente, perché nessuno degli altri sistemi dichiara di produrre vettoriali modificabili: anche i preprint umani si fermano al 58%.
Il terzo riguarda le parti che restano affidate al giudizio del modello. Le cinque etichette sulle affermazioni sono assegnate dal modello, non da un programma, come gli autori stessi dichiarano; i controlli deterministici garantiscono che un numero abbia una fonte, non che l’interpretazione sia giusta. Del ciclo dell’autosmentita il paper non dice quante volte sia scattato né quanti rapporti di fallimento abbia prodotto. La robustezza fra template di conferenze diverse compare fra le metriche dichiarate ma non ha un numero nei risultati. E i conteggi di pagine, riferimenti e figure dei sette paper della vetrina del progetto sono, come precisa la didascalia, dichiarati dai manutentori, non una misura indipendente.
Due dettagli minori. Due dei primi autori firmano anche Idea2Story, uno dei sistemi messi a confronto, che qui è una delle skill opzionali della fase 0. E nel caso di studio sulle previsioni la proposta chiede di portare al carico elettrico un metodo nato sulle polveri sottili, mentre l’introduzione generata e il commento degli autori parlano di previsioni del PM2.5: una piccola incoerenza nella figura, proprio nel paper che fa della coerenza il suo argomento.
Perché conta adesso
Il paper mostra fin dove si può spingere la forma della skill: una pipeline lunga ore, con esperimenti veri, senza un solo server in più da gestire. Ma la lezione che resta è un’altra. L’onestà di un sistema automatico si progetta: decidere le tabelle prima dei numeri, rifiutare il numero senza fonte, mettere un tetto ai tentativi e dare a un fallimento la dignità di un risultato. Sono le stesse regole che si chiedono a un dottorando. Resta aperta la domanda che il paper non affronta: che cosa succede alle riviste e ai revisori quando un manoscritto formalmente in ordine costa otto dollari e tre ore.
Il codice è su github.com/Spark-To-Paper-Skills/spark-to-paper-skills.

I commenti sono riservati agli iscritti.
Accedi per commentare