LingBot-VLA 2.0: sessantamila ore di dati, un corpo intero e uno sguardo avanti per portare i VLA fuori dal laboratorio

Il team Robbyant presenta la seconda versione del suo modello visione-linguaggio-azione per robot, e punta tutto su tre mosse pratiche: dati puliti da venti robot diversi e da diecimila ore di video in prima persona, un vettore d'azione unico che comprende testa, busto, base mobile e mani, e due query apprese, una sul presente e una sul futuro. I numeri contro π0.5, le scelte di ingegneria che il paper misura e le tre mosse che invece non isola.

Chi ha fatto scuola guida ricorda la frase che l’istruttore ripete fino alla noia: guarda lontano, non il cofano. Chi fissa il metro di asfalto davanti alle ruote reagisce sempre in ritardo; chi guarda la curva cento metri più in là ha già deciso quando frenare. E chi ha imparato su un’utilitaria sa che il primo giorno al volante di un furgone non è uguale agli altri: stessi pedali, stesso volante, ma un corpo diverso da portare in giro.

Sono, trasportati in robotica, i due problemi da cui parte From Foundation to Application: Improving VLA Models in Practice, uscito su arXiv il 7 luglio 2026 (2607.06403). Lo firmano ventiquattro autori, con Wei Wu e Fangjing Wang primi a pari merito e Kecheng Zheng come responsabile del progetto; sito, codice e pesi sono pubblicati sotto il nome Robbyant. Presenta LingBot-VLA 2.0, seconda versione di un modello visione-linguaggio-azione (VLA): un modello che guarda le telecamere del robot, legge un’istruzione come «sistema i fiori nel vaso» e produce i comandi per i motori.

Il divario fra il banco di prova e la cucina

I VLA sono diventati negli ultimi anni una delle strade più battute per costruire politiche «generaliste» per robot: si parte da un modello visione-linguaggio già addestrato, che sa riconoscere oggetti e capire frasi, e gli si insegna a tradurre quella comprensione in movimento. Gli autori constatano però una distanza ostinata fra i risultati in laboratorio e l’uso reale, e la scompongono in tre voci. I robot veri sono tanti e diversi, e i dati di uno non valgono automaticamente per l’altro. Molti hanno più gradi di libertà dei due bracci su cui si fanno i benchmark: una testa che si orienta, un busto che si piega, una base su ruote, mani a più dita. E nel mondo le cose si muovono: servirebbe prevedere come cambierà la scena, non solo reagire a quella di adesso.

Come un Transformer mette nello stesso spazio pixel e parole: la multimodalità è spiegata nel libro.

Leggi «Multimodalità» nel libro →

La tesi è dichiaratamente pragmatica: non basta scalare modello e dati, bisogna allinearli a ciò che serve sul campo, su tutti e tre i fronti insieme.

Prima mossa: meno dati, ma buoni

Il corpus di pre-addestramento conta circa 60.000 ore. Cinquantamila sono traiettorie di robot, da 20 configurazioni diverse: bracci singoli come Franka, coppie di bracci, semi-umanoidi, umanoidi, alcuni dei quali con mani articolate. Le altre diecimila sono video di persone riprese in prima persona mentre manipolano oggetti.

Il numero più interessante è quello che manca. Le ore di robot raccolte erano circa 90.000, i video umani circa 20.000: quasi metà del materiale è stata scartata. Per i robot la pulizia è in parte automatica (si buttano gli episodi con strappi eccessivi nei movimenti, misurati sulla derivata terza della traiettoria, e quelli in cui il robot resta fermo per oltre il 95% del tempo) e in parte manuale: si riproietta il modello del robot sull’immagine e degli annotatori controllano che coincida con il video, oltre a scartare riprese mosse, coperte o con fotogrammi persi. Per i video umani un modello visione-linguaggio fa da primo filtro, poi la posa della mano viene ricostruita in 3D e si scartano le clip con meno del 20% di fotogrammi utili o con traiettorie fisiologicamente impossibili.

Anche le didascalie sono automatiche: Qwen3.6-27B divide ogni video in sotto-compiti e assegna a ciascuno una di 18 etichette chiuse (15 azioni come versare, piegare, tagliare, più tre ausiliarie come «spostamento a vuoto»). La distribuzione è eloquente: «sposta» e «spostamento a vuoto» coprono insieme quasi nove sotto-compiti su dieci, mentre tagliare, piegare e mescolare sono rari.

Seconda mossa: un solo vocabolario per venti corpi

Per addestrare un unico modello su corpi così diversi serve una lingua comune dei movimenti. La soluzione è un vettore canonico di 55 dimensioni, usato sia per lo stato sia per l’azione: 14 per le articolazioni dei due bracci, 14 per la posa delle due pinze nello spazio (posizione più quaternione), 2 per le pinze, 12 per le mani, 4 per il busto, 2 per la testa, 3 per lo spostamento della base, 4 di riserva. Un braccio singolo riempie solo le sue caselle, le altre vengono riempite con valori di comodo (il padding). È la mossa che permette a un umanoide con le mani e a un braccio industriale di stare nello stesso batch.

LingBot-VLA 2.0: tre interventi insieme 1. Dati filtrati robot raccolti: ~90.000 h tenuti: ~50.000 h video umani: ~20.000 h ~10.000 h 20 configurazioni di robot scarti: strappi, fermi, video mossi, pose impossibili 2. Un vettore da 55 bracci · 14 pose pinze · 14 pinze · 2 mani · 12 busto · 4 testa · 2 base · 3 riserva · 4 in terracotta: il corpo intero, oltre ai due bracci 3. Guardare avanti domanda sul presente istante t domanda sul futuro istante t + T imitano due maestri profondità geometria video movimento T = lunghezza del blocco di azioni prodotto Numeri dal paper; le altezze dei blocchi del vettore seguono all’incirca il numero di dimensioni.

Dentro il modello, la parte che genera le azioni diventa una mixture of experts: ogni strato ha un esperto condiviso sempre acceso e un gruppo di esperti specializzati, di cui un router ne sceglie pochi per ogni token. Gli autori riprendono da DeepSeek-V3 il trucco per bilanciare il carico senza aggiungere una penalità alla funzione di perdita: ogni esperto ha un piccolo bias che influenza solo la scelta, e che viene aggiornato con $b_j \leftarrow b_j – \gamma \cdot \mathrm{sign}(n_j – \bar n)$, abbassato per chi riceve più token della media e alzato per chi ne riceve meno. Il confronto a parità di parametri attivi (un modello da 1,6 miliardi di cui 0,6 attivi, contro uno denso da 0,6) mostra perdita di addestramento ed errore di validazione più bassi per la versione a esperti. È una curva, non ancora un robot che riesce di più.

Router, top-K, esperti condivisi e il problema del bilanciamento del carico: la mixture of experts è spiegata da capo nel libro, qui si dà per nota.

Leggi «Mixture of Experts» nel libro →

Terza mossa: guardare avanti

La parte più interessante è il modo di insegnare al modello a guardare lontano, con uno schema che riprende un lavoro precedente di alcuni degli stessi autori. Accanto ai token di immagine e di testo si aggiungono due query apprese: $Q_t$ riguarda la scena di adesso, $Q_{t+T}$ quella di fra $T$ passi, dove $T$ è la lunghezza del blocco di azioni che il modello produce in un colpo. Le due query non devono ricostruire l’immagine futura pixel per pixel: devono avvicinarsi alle rappresentazioni che due modelli «maestri» ricavano dai fotogrammi veri. Il primo, LingBot-Depth, stima la profondità e porta la geometria. Il secondo, DINO-Video, è una versione di DINOv3 estesa al tempo con attenzione causale, addestrata dagli autori su 5 milioni di clip, e porta il movimento. Per il maestro video l’obiettivo è

$$\mathcal{L}_{\text{video}} = \mathbb{E}\Big[\,\lVert \mathrm{Proj}(Q_t) – Z_t \rVert_F^2 + \lVert \mathrm{Proj}(Q_{t+T}) – Z_{t+T} \rVert_F^2\,\Big],$$

dove $Z$ sono le feature del maestro; per la profondità la forma è la stessa con la norma L1. Il futuro, insomma, entra come compito ausiliario: il robot non deve disegnarlo, deve saperlo riassumere abbastanza bene da condizionarci sopra le azioni.

L’idea di prevedere il futuro in uno spazio di rappresentazioni invece che di pixel ha una storia e un dibattito, da JEPA ai simulatori: i world model hanno un capitolo del libro.

Leggi «Simulare il mondo» nel libro →

I numeri

Sul benchmark GM-100, nove compiti a due bracci addestrati tutti insieme con una sola politica per robot, LingBot-VLA 2.0 è in testa sia su Agilex Cobot Magic sia sul Galaxea R1 Pro, più difficile per tutti.

GM-100, una sola politica per robot punteggio di avanzamento e tasso di successo · più alto è meglio
Modello Avanzamento Successo
Agilex Cobot Magic
LingBot-VLA 2.0 66,2 34,4%
LingBot-VLA 1.0 58,2 30,0%
π0.5 59,1 32,2%
GR00T N1.7 36,3 17,8%
Galaxea R1 Pro
LingBot-VLA 2.0 34,6 15,6%
π0.5 27,4 8,9%

Secondo gli autori i salti più netti sono sui compiti in cui bisogna individuare bene l’oggetto: recuperare un portachiavi da un cassetto passa da 60 a 100% di successo su Agilex.

Nei due compiti lunghi con base mobile (riporre frutta e una bottiglia in frigorifero con un Astribot S1, pulire un fornello con un Cobot Magic-ARX X5), 15 prove per condizione, il vantaggio su π0.5 regge anche fuori distribuzione.

Compiti lunghi con base mobile 15 prove per condizione · più alto è meglio
Modello Avanzamento Successo
Frigorifero, partenza spostata fino a 10 centimetri e oggetti mai visti
LingBot-VLA 2.0 37,0 13,3%
π0.5 30,3 6,7%
Fornello
LingBot-VLA 2.0 67,5 40,0%
π0.5 62,5 33,3%

Le ablazioni, su quattro compiti GM-100, sono forse la parte più utile per chi addestra robot. Si confrontano per prima cosa azioni relative alla posizione attuale e posizioni assolute: con le prime la deviazione standard dei bersagli scende da circa 0,80 a 0,28, e il modello regredisce piccole correzioni invece di intere configurazioni. La normalizzazione per media e deviazione standard batte min-max, la perdita L2 batte la L1.

Quattro scelte di ingegneria successo medio su quattro compiti GM-100 · più alto è meglio
Scelta Opzione Alternativa
Azioni 55,0% relative 33,7% assolute
Normalizzazione 55,0% media e deviazione standard 47,5% min-max
Perdita 55,0% L2 46,4% L1
Spazio delle azioni 55,0% giunti 56,0% posa della pinza

Fra giunti e posa della pinza il pareggio è quasi perfetto, ma nasconde scelte opposte compito per compito: spremere il ketchup va molto meglio in coordinate cartesiane, scansionare un codice a barre con le articolazioni.

Che cosa non dice

Il limite più grosso è che le tre mosse non vengono mai misurate separatamente in termini di successo. Il paper confronta la 2.0 con la 1.0, ma nel frattempo, lo scrivono gli autori stessi, è cambiato anche il modello visione-linguaggio di partenza, «più forte» e più bravo ad agganciare le parole agli oggetti nell’immagine. Quanto del guadagno venga dai dati, quanto dal corpo intero, quanto dalle query sul futuro, quanto dagli esperti e quanto dalla nuova spina dorsale non si può dire. Lo stesso vale per le diecimila ore di video umani: non c’è un esperimento con e senza.

I miglioramenti, poi, non sono uniformi. Sul Galaxea R1 Pro il successo medio della 2.0 è identico a quello della 1.0 (15,6%), e togliere una ciotola dal microonde crolla dal 100 al 30%. Su Agilex l’ordinamento dei blocchi scende da 10 a 0%, e compito per compito π0.5 ha un successo più alto in cinque casi su nove: senza il portachiavi e la ciotola nel microonde, il vantaggio medio di 2,2 punti diventerebbe uno svantaggio. I tassi di successo di GM-100 vanno a scatti di dieci punti, segno di pochi tentativi per compito (il paper non ne dà il numero), e nei compiti lunghi 13,3% contro 6,7% significa due riuscite contro una su quindici. Il confronto sui compiti mobili, infine, è solo con π0.5, e i risultati percettivi delle query (profondità e feature previste) sono mostrati come immagini, senza una misura.

Perché conta adesso

Il titolo promette il passaggio dalla fondazione all’applicazione, e il paper lo mantiene più come manuale di ingegneria che come dimostrazione. Dice con franchezza dove si vince oggi con i robot: buttando quasi metà dei dati raccolti, scegliendo con cura come rappresentare e normalizzare un’azione, dando a busto, testa e ruote un posto nello stesso vocabolario delle mani. Sono dettagli che nei paper di architettura spariscono e che qui, su quattro compiti, valgono fino a venti punti di successo. L’idea di far guardare lontano il modello è promettente, ma il paper non consente ancora di dire quanto pesi davvero. Per saperlo servirà un’ablazione che tolga un pezzo alla volta; codice e pesi pubblici, almeno, la rendono possibile a chiunque.

I commenti sono riservati agli iscritti.

Accedi per commentare