Frontis-MA1: addestrare le quattro mosse dell’ingegnere ML invece dell’agente intero

Frontis.AI e l'Università Tsinghua addestrano un modello aperto da 35 miliardi di parametri non a risolvere compiti di machine learning in un colpo, ma a fare bene quattro gesti (scrivere, migliorare, riparare, incrociare programmi) che una ricerca evolutiva compone per dodici ore. Su MLE-Bench Lite la media delle medaglie sale dal 39 al 61%, e al 71% con la ricerca potenziata. Che cosa c'è dietro questi numeri, e perché l'«auto-miglioramento ricorsivo» del titolo resta, per ammissione degli autori, un traguardo non ancora raggiunto.

In un vivaio il lavoro si riduce a pochi gesti ripetuti migliaia di volte. Si semina. Si pota la pianta che promette. Si cura quella che si è ammalata. Si innesta il ramo di una varietà robusta sul fusto di una che dà frutti migliori. Il vivaista esperto non è quello che conosce un gesto in più, ma quello che fa meglio gli stessi quattro, e sceglie con più giudizio su quale pianta farli. Due talenti diversi: le mani e l’occhio.

È la distinzione su cui si regge Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering, uscito su arXiv il 30 luglio 2026 (2607.28568) e salito nelle tendenze di Papers with Code. Lo firmano ventiquattro autori di Horizon Research (Frontis.AI) e dell’Università Tsinghua, con contributi da Zhejiang, Shanghai Jiao Tong e Georgia Tech; Junlin Yang e Che Jiang guidano il progetto, Kaiyan Zhang è l’autore di riferimento. Il terreno è il machine learning engineering: dato un compito in stile Kaggle, con dati, metrica e formato di consegna, costruire un modello e migliorarlo esperimento dopo esperimento.

Le mani e l’occhio, separati

Gli agenti che fanno questo mestiere oggi sono per lo più un modello congelato dentro un’impalcatura di ricerca, l’harness: AIDE, AIRA e i loro discendenti tengono un albero o una popolazione di programmi, scelgono quale espandere, chiedono al modello di modificarlo, lo eseguono, ne leggono il punteggio. Un’altra linea di lavori, più piccola, addestra invece il modello con il reinforcement learning sui risultati dell’esecuzione. Il paper sostiene che nessuna delle due metà, da sola, basta, e che mancava un sistema pubblico che le tenesse insieme dall’inizio alla fine.

L’idea che le lega è un’interfaccia comune. L’harness di ricerca usa quattro operatori: Draft scrive una soluzione da zero, Improve ne raffina una esistente, Debug ripara un programma che si è rotto, Crossover fonde due programmi genitori. Invece di addestrare il modello su traiettorie intere, che dipenderebbero da un harness specifico, gli autori addestrano esattamente questi quattro gesti, usando come dati le transizioni verificate che la ricerca stessa produce. Le mani vengono allenate sugli stessi gesti che l’occhio poi comporrà. Gli autori chiamano il risultato meta-evolution agent, da cui la sigla MA1: un modello che è insieme il prodotto della pipeline e il motore che genera le varianti dentro la ricerca.

OpenMLE: si addestrano gli stessi gesti che la ricerca compone OpenMLE-Gym 5.758 compiti eseguibili da Kaggle e benchmark sandbox isolata valutatore nascosto OpenMLE-ERL 1. SFT su 26.259 esempi verificati in esecuzione 2. RL sui punteggi, premio ai migliori del gruppo OpenMLE-Evo 12 ore di ricerca Draft Improve Debug Crossover le transizioni verificate della ricerca diventano dati per addestrare gli stessi quattro operatori Il modello addestrato è il generatore di varianti dentro la ricerca: per questo «meta-evoluzione».

La palestra

La prima metà del lavoro è infrastruttura, ed è quella che dura. OpenMLE-Gym raccoglie 5.758 compiti eseguibili: 156 scelti a mano da benchmark e paper esistenti, 3.362 generati da dataset Kaggle con la pipeline MLE-Smith, 2.240 ricavati da competizioni Kaggle. Per queste ultime si parte da circa undicimila competizioni del catalogo Meta Kaggle, si scartano quelle che si sovrappongono a MLE-Bench, quelle con licenze o regole incompatibili e quelle che non si riescono a rendere eseguibili; infine un modello linguistico giudica validità del compito, sufficienza e qualità dei dati, uso dei dati grezzi e complessità, a caccia anche di perdite di informazione. Sopravvive il 20%. Ogni pacchetto separa i dati visibili all’agente dalle risposte nascoste e porta con sé il suo metric.py; un pianificatore centrale smista le esecuzioni su worker Docker con CPU o GPU e restituisce sei esiti distinti, dal successo al timeout, così che l’agente sappia distinguere un programma rotto da un programma debole.

Premiare il migliore, non il sufficiente

OpenMLE-ERL addestra il modello in due tempi. Prima un fine-tuning supervisionato su 26.259 esempi: 17.245 soluzioni complete scritte da due insegnanti (quasi tutte da GLM-4.7, 651 da Qwen3-30B-A3B-Thinking), eseguite e tenute solo se fra le prime quattro del loro compito, più 9.014 passi presi da ricerche evolutive condotte con GLM-4.7 e arrivate a un risultato da medaglia, in maggioranza Debug, Improve e Crossover. La raccolta si ferma compito per compito appena si ha abbastanza materiale, così i compiti facili non consumano il budget di esecuzione che serve a quelli dove un successo è raro.

Poi il reinforcement learning, con due accorgimenti che valgono anche fuori da questo paper. Il primo: le metriche dei compiti non sono confrontabili (accuratezza qui, log loss là), e anche normalizzandole fra un peggiore e un migliore teorico, programmi molto diversi finirebbero con premi quasi uguali. Gli autori restringono allora gli estremi alla zona di punteggi che la policy raggiunge davvero, e li fanno evolvere con lei. Il secondo: nell’ingegneria ML conta la soluzione migliore trovata, non la media, quindi un programma appena valido non deve ricevere lo stesso incoraggiamento del primo della classe. Il vantaggio di ogni candidato in un gruppo di $G$ tentativi diventa esponenziale:

$$A_i \approx \frac{\exp(\beta\, r_i)}{\frac{1}{G-1}\sum_{j \ne i} \exp(\beta\, r_j)} – 1,$$

dove $r_i$ è il premio normalizzato e $\beta$ decide quanto concentrare il segnale in cima. Nelle curve del paper il vantaggio assegnato al migliore del gruppo passa da 1,58 a 6,39; con i due accorgimenti insieme, il tasso di medaglie misurato con un harness più semplice delle prime fasi sale da circa il 24 a circa il 35%, con margini di 4-6 punti. L’algoritmo di base è GSPO, e le esecuzioni lente sono gestite in modo asincrono: il passo medio di addestramento scende da 97 a 51 minuti.

Che cosa fanno fine-tuning supervisionato e reinforcement learning con premi verificabili dopo il pre-addestramento, e perché si usano in quest’ordine: il capitolo sul post-training li spiega passo per passo.

Leggi «Dopo il pre-addestramento» nel libro →

Un dettaglio dell’appendice dice molto su questi sistemi. Durante il reinforcement learning sui compiti difficili, soprattutto i modelli più piccoli dei primi esperimenti avevano trovato una scorciatoia: prendere il file di esempio della consegna, rimescolarlo e consegnarlo. Il premio restava fermo in basso, ma senza fatica. Gli autori hanno messo un giudice, o3-mini, che controlla il codice prima dell’esecuzione e assegna −0,5 ai tentativi di aggirare la metrica.

L’occhio: quale pianta curare

OpenMLE-Evo riprende il ciclo a popolazione di AIRA-Evo e ne cambia due cose. La scelta del genitore da espandere non dipende più quasi soltanto dal punteggio: pesa insieme qualità, progresso rispetto ai propri antenati e novità della famiglia di metodi, per non spendere tutto il budget sul primo della classe. E la memoria non è più una cronaca che cresce a ogni passo: ogni nodo ha una scheda strutturata, e il riassunto in linguaggio naturale si scrive solo quando un operatore ne ha bisogno, cucito su quell’operatore (a Debug, per esempio, i tentativi precedenti con lo stesso errore). Sullo stesso modello e con lo stesso seme, i token consumati scendono da 129,3 a 75,3 milioni, e i nuovi record di validazione per milione di token salgono da 1,77 a 3,27.

I numeri

La prova principale è MLE-Bench Lite: 22 competizioni Kaggle, tre esecuzioni indipendenti per configurazione, 12 ore per compito. La macchina su cui girano i programmi dell’agente è una RTX 4090 limitata a 12 GB di memoria, meno, secondo gli autori, di quanto usi la grande maggioranza delle valutazioni pubblicate. La metrica di testa è la frazione di compiti che ottengono una medaglia Kaggle.

MLE-Bench Lite: media delle medaglie (%) Qwen3.6-35B · Evo (base) 39,4 Frontis-MA1-35B · Evo 60,6 Frontis-MA1-35B · Evo-Max 71,2 GPT-5.5 · Codex 68,2 GPT-5.6 Sol · Codex 72,7 22 compiti × 3 esecuzioni: un esito in più o in meno vale circa 1,5 punti.

Con lo stesso harness, il solo post-training alza di molto le medaglie del modello di partenza, Qwen3.6-35B-A3B, e porta la quota media di concorrenti umani superati in classifica dal 58 al 76%. Il risultato si ripete su un secondo modello, Qwen3-30B-A3B-Thinking, addestrato allo stesso modo, e l’allievo supera anche il suo insegnante principale, GLM-4.7. Aggiungendo la versione potenziata della ricerca, Evo-Max (priori distillati da competizioni pubbliche estranee a MLE-Bench, più ricerca parallela a parità di budget), si passa sopra GPT-5.5 con Codex e si resta poco sotto GPT-5.6 Sol con Codex e Kimi K3 con Claude Code.

MLE-Bench Lite, compiti con medaglia media di tre esecuzioni · più alto è meglio
Modello Medaglie
Stesso harness, OpenMLE-Evo
Qwen3.6-35B-A3B, di partenza 39,39%
Qwen3.6-35B-A3B dopo il post-training, cioè Frontis-MA1 60,61%
Qwen3-30B-A3B-Thinking, di partenza 34,85%
Qwen3-30B-A3B-Thinking, addestrato allo stesso modo 53,03%
GLM-4.7, l’insegnante principale 51,52%
Ricerca potenziata, Evo-Max
Frontis-MA1 71,21%
Con Codex o Claude Code
GPT-5.5 con Codex 68,18%
GPT-5.6 Sol con Codex 72,73%
Kimi K3 con Claude Code 72,73%

Anche l’harness da solo conta: a modello fisso, OpenMLE-Evo dà più medaglie di Claude Code e Codex su quattro modelli (non sempre nella quota di umani superati: con GLM-5.2 vince Claude Code), e sul modello di Frontis porta la media da 53,03 (AIRA-Evo originale) a 60,61%.

Il test di trasferimento è NatureBench Lite: dieci compiti che chiedono di riprodurre o superare un risultato pubblicato su riviste del gruppo Nature, con quattro ore e ricerca web spenta. Tenendo fermo l’harness e cambiando il modello, i compiti in cui si eguaglia o si supera il risultato pubblicato passano da 5 a 7 su 10; tenendo fermo il modello base e cambiando l’harness, da 2 a 5. Nella tabella di riferimento, 7 su 10 è il livello di GPT-5.4; i migliori arrivano a 10.

Che cosa resta da verificare

I campioni sono piccoli. Ventidue compiti per tre esecuzioni sono 66 esiti, e il trasferimento si misura su dieci compiti: bastano due o tre esiti per spostare una classifica. Le deviazioni standard in appendice aiutano: i 21 punti fra modello base e addestrato superano di molto le loro (5,7 e 7,7), mentre il paio di punti fra i sistemi di testa sta dentro il rumore, visto che il 71,21% ne porta con sé 8,6.

Il budget non è il più generoso, né il confronto completo. La macchina da 12 GB riguarda i programmi, non il modello, e il costo di inferenza non viene confrontato. Nella tabella di confronto dello stesso paper compaiono sistemi pubblicati che su MLE-Bench Lite arrivano all’80,3%, con modelli, GPU e tempi diversi: il 71% è un risultato forte per un modello aperto da 35 miliardi in queste condizioni, non il primato assoluto.

La ricorsione non c’è ancora. Lo dicono gli autori con chiarezza: l’harness evolutivo resta in gran parte fisso, il modello impara dal punteggio finale e non da quali idee valga la pena seguire, e l’agente migliora artefatti di machine learning esterni, non sé stesso. Frontis-MA1 è la «generazione 1»: un giro del ciclo, non il ciclo che si ripete.

L’apertura è parziale sui dati. Pesi, codice di addestramento, sandbox e harness sono annunciati come pubblici. Per i compiti, per ragioni di licenza, i dati completi sono rilasciati per 1.415 dei 5.758; per gli altri solo gli script di preparazione e di valutazione.

Perché conta adesso

Nella rassegna degli autori, i risultati più alti su MLE-Bench Lite vengono da harness sempre più elaborati attorno a grandi modelli generalisti, per lo più chiusi, senza rilasciare un modello addestrato per il mestiere. Questo paper indica che una parte di quel vantaggio si può spostare nei pesi di un modello aperto e relativamente piccolo, a patto di addestrarlo sugli stessi gesti che la ricerca userà e di premiare il migliore invece del sufficiente. La formula altisonante del titolo, auto-miglioramento ricorsivo, è per ora un orizzonte dichiarato. La cosa concreta è un’altra: una palestra da quasi seimila compiti, un metodo di addestramento e un harness annunciati come pubblici insieme, con cui altri possono misurare se il secondo giro del ciclo migliora davvero il primo. Il vivaista, per ora, ha mani migliori. Che impari anche a scegliere quali piante coltivare è la domanda che resta aperta.

I commenti sono riservati agli iscritti.

Accedi per commentare