Chi ha provato a confrontare due motori sa che non basta leggere le schede tecniche. Uno è stato misurato su un’utilitaria in pianura, l’altro su una sportiva in salita. Per dire quale spinga di più bisogna smontarli e montarli sullo stesso telaio, sulla stessa pista, con lo stesso cronometro. È quello che fa un banco prova motori, ed è noioso: nessuno vince premi per averlo costruito. Ma senza, ogni confronto è un’opinione.
È il problema che affronta StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing, uscito su arXiv il 6 aprile 2026 (2604.05014) e in tendenza su Papers with Code. Lo firmano quindici autori del nucleo del progetto, con Jinhui Ye e Ning Gao in testa e Yilun Chen, Shu Liu e Jiaya Jia come autori di riferimento (Jia per il Von Neumann Institute della HKUST), più una lista di contributori della comunità. Non presenta un modello nuovo ma un codice, pubblico su GitHub, con un rapporto che gli autori promettono di aggiornare mentre il progetto cresce.
Una torre di Babele
I modelli visione-linguaggio-azione (VLA) sono il modo in cui oggi si costruiscono politiche per robot che obbediscono a istruzioni scritte: guardano le telecamere, leggono «prendi il cubo rosso», producono i comandi per i motori. Sotto l’etichetta convivono però famiglie diverse. Alcune riusano un modello visione-linguaggio (VLM) e ne piegano le rappresentazioni a produrre azioni; altre partono da un world model, un modello generativo che impara a prevedere i fotogrammi futuri. E anche dentro la stessa famiglia le azioni si estraggono in modi diversi: token discreti uno alla volta, regressione diretta, denoising iterativo.
Il guaio, scrivono gli autori, è che ogni metodo esce con il suo codice, la sua pipeline di dati e il suo sottoinsieme di benchmark, valutato con protocolli propri. Il risultato lo chiamano una «torre di Babele»: le idee si confrontano, si riproducono e si ricombinano a fatica. I codici esistenti, come Isaac-GR00T e quello di $\pi_0$, sono in gran parte legati al proprio metodo; nella tabella di confronto compilata dagli autori nessuno dei cinque sistemi citati (OpenPI, Isaac-GR00T, OpenVLA-OFT, Dexbotic, X-VLA) permette di cambiare testa d’azione a parità del resto.
Spina dorsale più testa, e un contratto in mezzo
La mossa di StarVLA è una scomposizione. Ogni VLA diventa due pezzi: una spina dorsale visione-linguaggio, che legge immagini e istruzione e produce stati nascosti, e una testa d’azione che li trasforma in comandi. Fra i due c’è un contratto fisso su che cosa si passa, e un altro contratto fisso verso l’esterno: in addestramento e in inferenza il modello riceve le osservazioni grezze, le stesse che il robot vede in servizio, e non tensori già preparati da un dataloader su misura. Lo scarto fra ciò che il modello vede in addestramento e in servizio è, scrivono gli autori, una causa frequente di peggioramenti silenziosi.
Sul piano formale il paper descrive ogni VLA come una politica che, dalla storia delle osservazioni $x_{\le t}$ e dall’istruzione $\ell$, produce un blocco di $k$ azioni future ed eventualmente qualche uscita ausiliaria:
$$\pi\big(a_{t:t+k},\, y_{\text{aux}} \mid x_{\le t},\, \ell\big), \qquad \mathcal{L} = \mathcal{L}_{\text{action}} + \mathcal{L}_{\text{aux}}.$$
La tesi è che le famiglie differiscano soprattutto nel secondo termine. Una politica diretta pone $\mathcal{L}_{\text{aux}} = 0$; un VLA basato su VLM aggiunge obiettivi in linguaggio, come piani o localizzazione di oggetti; uno basato su world model aggiunge la previsione di immagini o video futuri. Gli autori la chiamano «prospettiva VLA generalizzata» e la presentano come qualcosa che emerge dall’aver messo tutto nello stesso codice, più che come un teorema.
Nel codice le teste d’azione sono quattro, ciascuna ricalcata su un metodo noto. StarVLA-FAST trasforma le azioni in token discreti e li fa generare al modello linguistico uno alla volta. StarVLA-OFT, la più semplice, attacca un piccolo percettrone multistrato che legge gli stati nascosti di alcuni token riservati alle azioni e restituisce tutte le azioni in parallelo. StarVLA-π segue $\pi_0$: un esperto d’azione basato su un Transformer di diffusione che produce comandi continui per denoising iterativo, con il flow matching. StarVLA-GR00T segue GR00T N1.5: la spina dorsale fa da «sistema lento» che ragiona, un modulo di flow matching da «sistema veloce» che agisce. Spine dorsali e teste si scelgono in un file YAML; aggiungere un nuovo paradigma significa, dicono gli autori, implementare e registrare una nuova testa, senza toccare il resto.
Due delle quattro teste generano le azioni con il flow matching: come funziona, e perché ha preso il posto della diffusione classica in molti generatori, è spiegato nel libro.
Poi c’è l’impalcatura che fa del codice un banco di prova. Il modello gira come server WebSocket; il valutatore ufficiale di ogni benchmark, che può restare in un ambiente separato con le sue dipendenze e il suo simulatore, gli parla attraverso un piccolo adattatore che traduce osservazioni e azioni. Lo stesso schema vale per il robot vero: il controllore del robot diventa semplicemente un altro client. Tre modi di addestramento valgono per tutte le teste invece di essere accessori di un metodo: apprendimento supervisionato sulle dimostrazioni, co-addestramento con dati visione-linguaggio dal web, miscele di dataset da robot diversi. Il fine-tuning con rinforzo è annunciato, in collaborazione con il progetto RLinf, ma al momento della stesura il codice pubblico non lo contiene.
I numeri delle ricette di base
Gli esperimenti non cercano il record ma il punto di riferimento: ogni modello parte dai pesi pubblici della spina dorsale, viene addestrato solo sulle dimostrazioni ufficiali di un benchmark, senza pre-addestramento robotico, senza aumento dei dati, senza raffinamenti online.
LIBERO. Una sola politica per le quattro serie di compiti, 30.000 passi su 8 A100, circa 9,5 epoche. StarVLA-OFT con Qwen3-VL-4B resta mezzo punto sotto OpenVLA-OFT, che però si è addestrato per 175.000 passi e 223 epoche: sei volte i passi di StarVLA e circa ventitré volte le sue epoche. Sostituendo il VLM con Cosmos-Predict2-2B, un world model, le tre teste provate restano poco sotto. Gli altri modelli della tabella stanno più indietro.
| Modello | Successo |
|---|---|
| StarVLA-OFT, Qwen3-VL-4B | 96,6% |
| StarVLA su Cosmos-Predict2-2B, tre teste | 95,2–95,8% |
| OpenVLA-OFT | 97,1% |
| $\pi_0$ | 94,1% |
| $\pi_0$+FAST | 85,5% |
| GR00T-N1.5 | 86,5% |
SimplerEnv. Sul braccio WidowX la variante migliore, GR00T con Qwen3-VL, fa 65,3% di successi, media di cinque ripetizioni complete della valutazione. Con Cosmos si arriva a 61,6%. GR00T N1.5 riporta 61,9%. Sul Google Robot StarVLA-OFT fa 76,0% nell’impostazione visual matching, appena sopra SpatialVLA (75,1%) e CogACT (74,8%), e 70,2% in variant aggregation, appena sotto SpatialVLA (70,7%). Per SpatialVLA però la tabella non riporta il quarto compito, quello in cui quasi tutti i modelli vanno peggio.
RoboCasa-GR1, 24 compiti di manipolazione da tavolo in ambiente domestico per un robot umanoide, è più difficile di LIBERO e SimplerEnv, e qui la scelta della testa pesa: FAST, che genera token discreti, resta sotto le teste continue, fra le quali la migliore è OFT. Su RoboTwin 2.0, cinquanta compiti a due braccia, le tre teste continue stanno tutte intorno all’88% sia nelle scene pulite sia in quelle randomizzate, alla pari con LingBot-VLA e sopra $\pi_{0.5}$.
| Modello | RoboCasa-GR1 | RoboTwin, scene pulite | RoboTwin, scene randomizzate |
|---|---|---|---|
| StarVLA, teste continue | 43,9–48,8% 48,8% con OFT | circa 88% | circa 88% |
| StarVLA-FAST | 39,0% | 72,5% | 83,2% |
| GR00T-N1.6 | 47,6% | ||
| LingBot-VLA | 88,6% | 86,7% | |
| $\pi_{0.5}$ | 37,0% | 82,7% | 76,8% |
Due esperimenti vanno oltre il singolo benchmark. Il primo, ripreso da un lavoro compagno costruito su StarVLA (ST4VLA), mostra che cosa succede a un VLM addestrato solo sulle azioni: la sua capacità di localizzare oggetti descritti a parole, misurata su RefCOCO-g, crolla quasi al livello del caso entro 20.000 passi. Il co-addestramento con dati di localizzazione la preserva in parte, e la versione più elaborata, con pre-addestramento spaziale, ne conserva circa il 70%; intanto migliora la manipolazione, su WidowX da 54,7% a 61,1% con il co-addestramento semplice e a 73,2% con quella versione. Il secondo è un modello unico addestrato su LIBERO, SimplerEnv, RoboTwin e RoboCasa insieme, con le azioni di tutti i robot allungate per riempimento fino a un vettore comune di 32 dimensioni: resta competitivo sulla maggior parte dei benchmark e su RoboCasa sale al 57,3%.
Infine il costo. Con GR00T su Qwen3-VL-4B, da 8 a 256 A100 il throughput passa da 87 a 2200 campioni al secondo, con un’efficienza di scala che si stabilizza intorno al 79–80% oltre le 32 GPU. Il singolo passo invece rallenta, da 0,74 a 0,93 secondi: cresce il lotto, non la velocità.
Le crepe
È il rapporto di chi mantiene il codice. Solo la tabella del Google Robot dichiara che i numeri altrui sono quelli riportati nei lavori originali, con un’unica reimplementazione degli autori (GR00T N1.5); le altre non dicono da dove vengano. Se sono i numeri pubblicati, vengono da altre pipeline: proprio il tipo di confronto che il paper denuncia come inaffidabile.
La scelta del checkpoint guarda il test. Su LIBERO e RoboTwin gli autori valutano ogni 10.000 passi e riportano il primo checkpoint con la media migliore sul benchmark stesso; su SimplerEnv le varianti con Qwen3-VL compaiono ciascuna a un numero di passi diverso, da 15.000 a 65.000, senza che il criterio sia spiegato. Scegliere sul test tende a gonfiare i numeri rispetto a un checkpoint fissato prima.
Le tabelle non sempre concordano. Il testo dice che il modello generalista porta RoboCasa-GR1 «dal miglior specialista, 48,8%, al 57,3%»; la tabella del confronto generalista-specialista attribuisce però agli specialisti 53,8% (OFT) e 52,8% (GR00T), su LIBERO dà a StarVLA-π una media del 98,1% contro il 95,7% della tabella dedicata, e per RoboTwin riporta due colonne «clean», con le varianti StarVLA intorno al 50% nell’una e all’88% nell’altra, segnata da un asterisco mai spiegato. Probabilmente sono configurazioni diverse, ma il paper non lo spiega.
Più promesse che misure in alcuni punti. BEHAVIOR-1K, CALVIN e LIBERO-Plus sono descritti fra i benchmark integrati ma senza risultati; il robot reale compare come architettura di servizio, senza un solo numero; il rinforzo è un lavoro in corso. E la «prospettiva generalizzata» resta un’osservazione: nessun esperimento la mette alla prova, e l’unico che aggiunge un obiettivo ausiliario è quello sul co-addestramento ripreso da ST4VLA.
Perché conta adesso
La robotica con i VLA è ancora nella fase in cui ogni gruppo ha il suo codice e ogni articolo la sua tabella, e il lettore si chiede se un punto in più venga dall’idea o dalla pipeline. StarVLA non risolve la domanda scientifica su quale famiglia sia migliore; offre il posto dove farsela a parità di condizioni, e i primi risultati dicono già qualcosa: che su LIBERO la testa conta poco, su RoboTwin conta poco fra le teste continue e sui compiti umanoidi di più, e che almeno su LIBERO e SimplerEnv un world model come spina dorsale regge il confronto con un VLM. Il valore di un banco prova si misura nel tempo, da quanti lo usano e da quanto le misure fatte sopra restano confrontabili. Come quello dei motori, non vincerà premi. Ma è il posto dove un giorno si capirà quale motore spinge davvero.

I commenti sono riservati agli iscritti.
Accedi per commentare