Chi ha fatto scuola guida ricorda la frase che l’istruttore ripete fino alla noia: guarda lontano, non il cofano. Chi fissa il metro di asfalto davanti alle ruote reagisce sempre in ritardo; chi guarda la curva cento metri più in là ha già deciso quando frenare. E chi ha imparato su un’utilitaria sa che il primo giorno al volante di un furgone non è uguale agli altri: stessi pedali, stesso volante, ma un corpo diverso da portare in giro.
Sono, trasportati in robotica, i due problemi da cui parte From Foundation to Application: Improving VLA Models in Practice, uscito su arXiv il 7 luglio 2026 (2607.06403). Lo firmano ventiquattro autori, con Wei Wu e Fangjing Wang primi a pari merito e Kecheng Zheng come responsabile del progetto; sito, codice e pesi sono pubblicati sotto il nome Robbyant. Presenta LingBot-VLA 2.0, seconda versione di un modello visione-linguaggio-azione (VLA): un modello che guarda le telecamere del robot, legge un’istruzione come «sistema i fiori nel vaso» e produce i comandi per i motori.
Il divario fra il banco di prova e la cucina
I VLA sono diventati negli ultimi anni una delle strade più battute per costruire politiche «generaliste» per robot: si parte da un modello visione-linguaggio già addestrato, che sa riconoscere oggetti e capire frasi, e gli si insegna a tradurre quella comprensione in movimento. Gli autori constatano però una distanza ostinata fra i risultati in laboratorio e l’uso reale, e la scompongono in tre voci. I robot veri sono tanti e diversi, e i dati di uno non valgono automaticamente per l’altro. Molti hanno più gradi di libertà dei due bracci su cui si fanno i benchmark: una testa che si orienta, un busto che si piega, una base su ruote, mani a più dita. E nel mondo le cose si muovono: servirebbe prevedere come cambierà la scena, non solo reagire a quella di adesso.
Come un Transformer mette nello stesso spazio pixel e parole: la multimodalità è spiegata nel libro.
La tesi è dichiaratamente pragmatica: non basta scalare modello e dati, bisogna allinearli a ciò che serve sul campo, su tutti e tre i fronti insieme.
Prima mossa: meno dati, ma buoni
Il corpus di pre-addestramento conta circa 60.000 ore. Cinquantamila sono traiettorie di robot, da 20 configurazioni diverse: bracci singoli come Franka, coppie di bracci, semi-umanoidi, umanoidi, alcuni dei quali con mani articolate. Le altre diecimila sono video di persone riprese in prima persona mentre manipolano oggetti.
Il numero più interessante è quello che manca. Le ore di robot raccolte erano circa 90.000, i video umani circa 20.000: quasi metà del materiale è stata scartata. Per i robot la pulizia è in parte automatica (si buttano gli episodi con strappi eccessivi nei movimenti, misurati sulla derivata terza della traiettoria, e quelli in cui il robot resta fermo per oltre il 95% del tempo) e in parte manuale: si riproietta il modello del robot sull’immagine e degli annotatori controllano che coincida con il video, oltre a scartare riprese mosse, coperte o con fotogrammi persi. Per i video umani un modello visione-linguaggio fa da primo filtro, poi la posa della mano viene ricostruita in 3D e si scartano le clip con meno del 20% di fotogrammi utili o con traiettorie fisiologicamente impossibili.
Anche le didascalie sono automatiche: Qwen3.6-27B divide ogni video in sotto-compiti e assegna a ciascuno una di 18 etichette chiuse (15 azioni come versare, piegare, tagliare, più tre ausiliarie come «spostamento a vuoto»). La distribuzione è eloquente: «sposta» e «spostamento a vuoto» coprono insieme quasi nove sotto-compiti su dieci, mentre tagliare, piegare e mescolare sono rari.
Seconda mossa: un solo vocabolario per venti corpi
Per addestrare un unico modello su corpi così diversi serve una lingua comune dei movimenti. La soluzione è un vettore canonico di 55 dimensioni, usato sia per lo stato sia per l’azione: 14 per le articolazioni dei due bracci, 14 per la posa delle due pinze nello spazio (posizione più quaternione), 2 per le pinze, 12 per le mani, 4 per il busto, 2 per la testa, 3 per lo spostamento della base, 4 di riserva. Un braccio singolo riempie solo le sue caselle, le altre vengono riempite con valori di comodo (il padding). È la mossa che permette a un umanoide con le mani e a un braccio industriale di stare nello stesso batch.
Dentro il modello, la parte che genera le azioni diventa una mixture of experts: ogni strato ha un esperto condiviso sempre acceso e un gruppo di esperti specializzati, di cui un router ne sceglie pochi per ogni token. Gli autori riprendono da DeepSeek-V3 il trucco per bilanciare il carico senza aggiungere una penalità alla funzione di perdita: ogni esperto ha un piccolo bias che influenza solo la scelta, e che viene aggiornato con $b_j \leftarrow b_j – \gamma \cdot \mathrm{sign}(n_j – \bar n)$, abbassato per chi riceve più token della media e alzato per chi ne riceve meno. Il confronto a parità di parametri attivi (un modello da 1,6 miliardi di cui 0,6 attivi, contro uno denso da 0,6) mostra perdita di addestramento ed errore di validazione più bassi per la versione a esperti. È una curva, non ancora un robot che riesce di più.
Router, top-K, esperti condivisi e il problema del bilanciamento del carico: la mixture of experts è spiegata da capo nel libro, qui si dà per nota.
Terza mossa: guardare avanti
La parte più interessante è il modo di insegnare al modello a guardare lontano, con uno schema che riprende un lavoro precedente di alcuni degli stessi autori. Accanto ai token di immagine e di testo si aggiungono due query apprese: $Q_t$ riguarda la scena di adesso, $Q_{t+T}$ quella di fra $T$ passi, dove $T$ è la lunghezza del blocco di azioni che il modello produce in un colpo. Le due query non devono ricostruire l’immagine futura pixel per pixel: devono avvicinarsi alle rappresentazioni che due modelli «maestri» ricavano dai fotogrammi veri. Il primo, LingBot-Depth, stima la profondità e porta la geometria. Il secondo, DINO-Video, è una versione di DINOv3 estesa al tempo con attenzione causale, addestrata dagli autori su 5 milioni di clip, e porta il movimento. Per il maestro video l’obiettivo è
$$\mathcal{L}_{\text{video}} = \mathbb{E}\Big[\,\lVert \mathrm{Proj}(Q_t) – Z_t \rVert_F^2 + \lVert \mathrm{Proj}(Q_{t+T}) – Z_{t+T} \rVert_F^2\,\Big],$$
dove $Z$ sono le feature del maestro; per la profondità la forma è la stessa con la norma L1. Il futuro, insomma, entra come compito ausiliario: il robot non deve disegnarlo, deve saperlo riassumere abbastanza bene da condizionarci sopra le azioni.
L’idea di prevedere il futuro in uno spazio di rappresentazioni invece che di pixel ha una storia e un dibattito, da JEPA ai simulatori: i world model hanno un capitolo del libro.
I numeri
Sul benchmark GM-100, nove compiti a due bracci addestrati tutti insieme con una sola politica per robot, LingBot-VLA 2.0 è in testa sia su Agilex Cobot Magic sia sul Galaxea R1 Pro, più difficile per tutti.
| Modello | Avanzamento | Successo |
|---|---|---|
| Agilex Cobot Magic | ||
| LingBot-VLA 2.0 | 66,2 | 34,4% |
| LingBot-VLA 1.0 | 58,2 | 30,0% |
| π0.5 | 59,1 | 32,2% |
| GR00T N1.7 | 36,3 | 17,8% |
| Galaxea R1 Pro | ||
| LingBot-VLA 2.0 | 34,6 | 15,6% |
| π0.5 | 27,4 | 8,9% |
Secondo gli autori i salti più netti sono sui compiti in cui bisogna individuare bene l’oggetto: recuperare un portachiavi da un cassetto passa da 60 a 100% di successo su Agilex.
Nei due compiti lunghi con base mobile (riporre frutta e una bottiglia in frigorifero con un Astribot S1, pulire un fornello con un Cobot Magic-ARX X5), 15 prove per condizione, il vantaggio su π0.5 regge anche fuori distribuzione.
| Modello | Avanzamento | Successo |
|---|---|---|
| Frigorifero, partenza spostata fino a 10 centimetri e oggetti mai visti | ||
| LingBot-VLA 2.0 | 37,0 | 13,3% |
| π0.5 | 30,3 | 6,7% |
| Fornello | ||
| LingBot-VLA 2.0 | 67,5 | 40,0% |
| π0.5 | 62,5 | 33,3% |
Le ablazioni, su quattro compiti GM-100, sono forse la parte più utile per chi addestra robot. Si confrontano per prima cosa azioni relative alla posizione attuale e posizioni assolute: con le prime la deviazione standard dei bersagli scende da circa 0,80 a 0,28, e il modello regredisce piccole correzioni invece di intere configurazioni. La normalizzazione per media e deviazione standard batte min-max, la perdita L2 batte la L1.
| Scelta | Opzione | Alternativa |
|---|---|---|
| Azioni | 55,0% relative | 33,7% assolute |
| Normalizzazione | 55,0% media e deviazione standard | 47,5% min-max |
| Perdita | 55,0% L2 | 46,4% L1 |
| Spazio delle azioni | 55,0% giunti | 56,0% posa della pinza |
Fra giunti e posa della pinza il pareggio è quasi perfetto, ma nasconde scelte opposte compito per compito: spremere il ketchup va molto meglio in coordinate cartesiane, scansionare un codice a barre con le articolazioni.
Che cosa non dice
Il limite più grosso è che le tre mosse non vengono mai misurate separatamente in termini di successo. Il paper confronta la 2.0 con la 1.0, ma nel frattempo, lo scrivono gli autori stessi, è cambiato anche il modello visione-linguaggio di partenza, «più forte» e più bravo ad agganciare le parole agli oggetti nell’immagine. Quanto del guadagno venga dai dati, quanto dal corpo intero, quanto dalle query sul futuro, quanto dagli esperti e quanto dalla nuova spina dorsale non si può dire. Lo stesso vale per le diecimila ore di video umani: non c’è un esperimento con e senza.
I miglioramenti, poi, non sono uniformi. Sul Galaxea R1 Pro il successo medio della 2.0 è identico a quello della 1.0 (15,6%), e togliere una ciotola dal microonde crolla dal 100 al 30%. Su Agilex l’ordinamento dei blocchi scende da 10 a 0%, e compito per compito π0.5 ha un successo più alto in cinque casi su nove: senza il portachiavi e la ciotola nel microonde, il vantaggio medio di 2,2 punti diventerebbe uno svantaggio. I tassi di successo di GM-100 vanno a scatti di dieci punti, segno di pochi tentativi per compito (il paper non ne dà il numero), e nei compiti lunghi 13,3% contro 6,7% significa due riuscite contro una su quindici. Il confronto sui compiti mobili, infine, è solo con π0.5, e i risultati percettivi delle query (profondità e feature previste) sono mostrati come immagini, senza una misura.
Perché conta adesso
Il titolo promette il passaggio dalla fondazione all’applicazione, e il paper lo mantiene più come manuale di ingegneria che come dimostrazione. Dice con franchezza dove si vince oggi con i robot: buttando quasi metà dei dati raccolti, scegliendo con cura come rappresentare e normalizzare un’azione, dando a busto, testa e ruote un posto nello stesso vocabolario delle mani. Sono dettagli che nei paper di architettura spariscono e che qui, su quattro compiti, valgono fino a venti punti di successo. L’idea di far guardare lontano il modello è promettente, ma il paper non consente ancora di dire quanto pesi davvero. Per saperlo servirà un’ablazione che tolga un pezzo alla volta; codice e pesi pubblici, almeno, la rendono possibile a chiunque.

I commenti sono riservati agli iscritti.
Accedi per commentare