Chi ha fatto un trasloco conosce il momento in cui la casa sembra pronta. I mobili sono al loro posto, gli scatoloni quasi tutti aperti, la luce funziona. Poi si scopre che manca la chiave della cantina e che il frigorifero non entra nella nicchia. Il novanta per cento è fatto, ma basta una cosa mancante perché la casa non sia abitabile.
Su questa differenza, fra quasi finito e finito, è costruito FrontierChallenge: Evaluating Scientific Workflow Completion, uscito su arXiv il 25 agosto 2026 (2608.24979, la versione 2 è del 9 settembre). Lo firma l’Apodex Team: diciassette contributori elencati in appendice, con Liangcai Su, Zhaopeng Feng, Zhuo Chen e Zhen Zhang a pari merito e Xinyu Wang come responsabile del progetto. La domanda che pone è stretta di proposito: dato un compito scientifico già specificato e dati fissi, un agente sa portare a termine da solo l’intero flusso di lavoro, dall’elaborazione degli input fino alle consegne finali, rispettando il contratto per intero?
Che cosa manca ai benchmark di oggi
Nei benchmark per agenti l’unità di valutazione è spesso una risposta finale, una traccia d’interazione, un singolo programma o un flusso di lavoro di una sola disciplina. Humanity’s Last Exam controlla risposte a domande difficili; SWE-bench la risoluzione di issue reali su GitHub; PaperBench e CORE-Bench la replica di un lavoro pubblicato; BioAgent Bench e BiomniBench restano nella biologia. Un lavoro scientifico reale, però, riesce solo se ogni passaggio regge: bisogna leggere input eterogenei, scegliere ed eseguire un’analisi, validare i risultati intermedi e consegnare codice, tabelle, figure e testo coerenti fra loro. Una conclusione plausibile non basta.
Il paper tiene anche a dire che cosa non misura. Non è un test di scienza autonoma: l’agente non sceglie il problema né l’agenda di ricerca. Si misura soltanto l’affidabilità nell’esecuzione, la parte meno spettacolare e quella su cui si regge qualsiasi passaggio di mano fra un agente e chi deve usare il suo lavoro.
Qui si dà per noto che cosa sia un agente: un modello che ragiona, chiama strumenti, osserva il risultato e ripete. Il ciclo, gli strumenti e la memoria sono costruiti da capo nel libro.
Il benchmark: trecento flussi, novantasette pubblicati
La raccolta completa conta 300 flussi di lavoro scientifici, presi da pratiche reali di analisi, calcolo e simulazione, non da domande allungate. Sono stati selezionati perché fossero fedeli alla pratica professionale, non risolvibili con un solo comando, vari e verificabili in modo automatico. Da questa raccolta gli autori hanno estratto a caso 97 compiti, fra quelli che non richiedono una GPU per la valutazione, e li hanno pubblicati; gli altri 203 restano un insieme riservato che nel paper non viene usato.
I 97 compiti, 74 difficili e 23 di media difficoltà, sono divisi in sei domini: chimica quantistica (20), dinamica molecolare (16), caratterizzazione dei materiali (22), chimica analitica (23), scienze della vita (10) ed elettrochimica e ambiente (6), per 21 famiglie di flussi. Fra i compiti tipici ci sono quelli che richiedono software di settore come ORCA, CP2K, LAMMPS, AmberTools e PLUMED. Ogni compito è un pacchetto con cinque elementi allineati: l’obiettivo scientifico, gli input fissi, gli strumenti disponibili nell’ambiente, un contratto di consegna che elenca i prodotti richiesti e una procedura di valutazione eseguibile.
Gli esempi in appendice danno la misura. In uno l’agente riceve 18 immagini al microscopio di un saggio di migrazione cellulare (due gruppi, tre tempi, tre repliche) e deve segmentare le aree, calcolare i tassi di migrazione a 12 e 24 ore rispetto all’immagine iniziale, fare i test statistici fra gruppi e consegnare uno script riproducibile, due tabelle, due grafici e una relazione sul metodo. In un altro deve leggere una lastra di cromatografia su strato sottile con la linea di deposizione e il fronte del solvente volutamente storti, ricostruire l’andamento di una reazione di Suzuki e indicare quando fermarla secondo una regola data.
Come si misura: il pacchetto intero, o niente
Ogni compito ha un proprio valutatore (il Grader) che controlla file richiesti, valori numerici, formati, figure, esecuzione del codice e coerenza fra i prodotti, e restituisce un punteggio $s_{mi}$ fra 0 e 100 per la configurazione $m$ sul compito $i$. Quando un criterio è semantico, lo giudica GPT-5.6 Sol, tre volte, con i voti mediati. Il punteggio medio (Avg. Score) è la media degli $s_{mi}$ sui $N = 97$ compiti e misura il progresso parziale. La metrica principale è il Pass Rate, la quota di compiti consegnati per intero:
$$\text{PassRate}_m = \frac{1}{N}\sum_{i=1}^{N} \mathbb{1}\left[s_{mi} \ge 99{,}9\right].$$
La soglia a 99,9 invece di 100 serve solo ad assorbire le piccole oscillazioni della media dei tre giudizi, precisano gli autori; non ammorbidisce nessun requisito. Una consegna da 95 punti a cui manca una tabella non passa.
I numeri
Sono state provate tredici configurazioni: dodici modelli di frontiera dentro tre impalcature di agente. Codex ha girato con GPT-5.6 Sol e GPT-5.6 Terra (max); Claude Code ha fatto da impalcatura comune per dieci modelli, fra cui Claude Opus 5, Grok 4.6, Kimi K3 e due versioni di DeepSeek V4; Frontier Agent, l’impalcatura di Apodex, con il loro modello Apodex 1.1 in configurazione a squadra.
Il Pass Rate va dal 3,1 al 20,6 per cento, mentre il punteggio medio va da 67,5 a 87,9. In testa ci sono in coppia Codex con GPT-5.6 Sol, che ha anche il punteggio medio più alto, e Claude Code con Grok 4.6: entrambi consegnano per intero 20 compiti su 97.
| Modello e impalcatura | Pass Rate |
|---|---|
| GPT-5.6 Sol, in Codex | 20,6% punteggio medio 87,9 |
| Grok 4.6, in Claude Code | 20,6% punteggio medio 86,6 |
| Kimi K3, in Claude Code | 17,5% |
| Claude Opus 5, in Claude Code | 17,5% |
| GPT-5.6 Terra (max), in Codex | 15,5% |
| Qwen 3.8 Max | 15,5% |
Otto configurazioni superano 80 di punteggio medio. Sui compiti difficili il migliore arriva al 14,9 per cento.
È per dominio che lo scarto diventa evidente. In chimica quantistica Grok 4.6 chiude il 60 per cento dei compiti, e in dinamica molecolare tre configurazioni arrivano al 38. Ma nella caratterizzazione dei materiali, con punteggi medi fino a 88,1, nessuno va oltre il 9 per cento. In chimica analitica il punteggio medio arriva a 87,6 e un solo sistema, DeepSeek V4 Pro, chiude un compito (4 per cento). In elettrochimica e ambiente si arriva a 94,9 di punteggio medio e zero consegne complete, per tutte le configurazioni. Anche le classifiche cambiano da un dominio all’altro: GPT-5.6 Terra resta 16 punti di punteggio medio sotto Sol in chimica quantistica, ma lo supera in dinamica molecolare (93,7 contro 88,9). Una classifica aggregata non dice quale agente usare per un laboratorio preciso.
Anche il consumo di risorse diverge. I token di input dichiarati vanno da 2,18 milioni per compito (Grok 4.6) a 13,73 milioni (Apodex 1.1 in Claude Code); il tempo medio di esecuzione va da 21,8 minuti (Terra) a 112,8 (Frontier Agent a squadra).
«Ho finito», anche quando non è vero
Il risultato più istruttivo è nell’analisi degli errori, fatta sulle 970 traiettorie di Claude Code, l’unica impalcatura con un formato di eventi comune a tutti i modelli. Delle 849 esecuzioni non riuscite, 641, il 75,5 per cento, terminano con un messaggio che contiene espressioni di lavoro completato (il conteggio è lessicale); solo 13 (l’1,5 per cento) ammettono che qualcosa è ancora in corso o in attesa. Sopra i 50 punti la quota di annunci di completamento supera il 78 per cento in ogni fascia di chi non passa, e fra chi passa davvero è del 90,1. In pratica il messaggio finale ha quasi lo stesso tono che il lavoro sia finito o no.
Gli errori degli strumenti, a loro volta, non predicono il fallimento: compaiono almeno una volta nell’80,7 per cento delle esecuzioni fallite e nel 94,2 di quelle riuscite. Chi riesce inciampa quanto gli altri, o di più, e si rialza. Nei domini più ostili a cedere è soprattutto la qualità di un prodotto, secondo il giudice semantico: un artefatto giudicato insufficiente compare nel 97 per cento delle consegne non riuscite nei materiali, nel 95 in chimica analitica, contro il 43 in chimica quantistica. Gli autori avvertono che il contrasto riflette in parte contratti e valutatori diversi, non cause intrinseche dei domini.
A completare il quadro c’è una valutazione del processo che gli autori stessi chiamano esplorativa. Si chiama HDS6, viene da un lavoro precedente dell’ecosistema Apodex e misura sei capacità (coerenza, aderenza alle evidenze, gestione delle alternative, ragionamento sui limiti, uso degli strumenti, autocorrezione) su 1.164 traiettorie congelate di 12 configurazioni, esclusa Frontier Agent. Sulle dodici configurazioni il punteggio di processo correla con gli esiti (Pearson 0,874 con il punteggio medio, 0,828 con il Pass Rate), e la dimensione più debole per tutti è il ragionamento sui limiti: controllare i confini di validità e ragionare sui fallimenti. Qui il primo è Claude Opus 5, con 3,768 su una scala di base da 1 a 4.
Che cosa non dice
Gli autori elencano da soli i limiti principali: una sola esecuzione per configurazione, quindi nessuna misura della varianza; l’analisi degli errori ristretta a Claude Code; consumi di token non confrontabili fra fornitori. I sei domini sono fette descrittive del campione pubblicato, non campioni rappresentativi delle discipline, e l’elettrochimica conta sei compiti: uno zero su sei è un segnale, non una legge. Va aggiunto che il giudice semantico è GPT-5.6 Sol, cioè uno dei modelli in gara e quello che ottiene il punteggio medio più alto; il paper non discute questo possibile favore. Lo stesso vale per HDS6, dove Claude Opus 5, primo in classifica, siede nel collegio dei valutatori come arbitro. E il benchmark viene dallo stesso gruppo che costruisce Apodex 1.1 e Frontier Agent e che ha ideato HDS6: qui Apodex non vince, il che rassicura, ma il quadro metodologico resta tutto interno. Infine, i 203 compiti riservati, quelli che potrebbero dire se il benchmark resiste alla contaminazione, per ora non sono stati usati, e non sono un gemello dei 97: contengono anche i compiti che richiedono una GPU.
Perché conta adesso
Di agenti che «fanno scienza» si parla ogni settimana, spesso a partire da una dimostrazione riuscita o da un punteggio medio. FrontierChallenge sposta la domanda su un piano più scomodo e più utile: non quanto lavoro l’agente sa fare, ma se il lavoro è consegnabile. La risposta di oggi è che i migliori sistemi arrivano molto vicino al traguardo e lo superano una volta su cinque, e che, almeno nelle traiettorie di Claude Code analizzate, il messaggio finale non aiuta a capire quale delle cinque sia. Per chi mette un agente dentro un laboratorio o una pipeline di analisi la lezione è pratica: il controllo del contratto va fatto fuori dall’agente, artefatto per artefatto, e la frase «ho completato l’analisi» non è una verifica.
Dati, codice di valutazione e classifica sono annunciati su Hugging Face, GitHub e sul sito del progetto.

I commenti sono riservati agli iscritti.
Accedi per commentare