RoboDojo, l’esame comune per i robot generalisti: il migliore, in simulazione, riesce in meno di una prova su dieci

Un gruppo di 44 ricercatori, coordinato da MMLab dell'Università di Hong Kong e dall'Università di Pechino, propone un banco di prova unico per le politiche di manipolazione robotica: 42 compiti in simulazione divisi per capacità, 18 su robot veri con un tavolo standardizzato e usabile da remoto, trenta modelli messi alla prova con le stesse regole. Il risultato è una classifica impietosa, e il paper è onesto nel dirlo. Che cosa misura davvero, i numeri, e che cosa quei numeri non dicono.

Chi ha seguito una gara di pattinaggio artistico sa che il punteggio finale serve a poco. Due atleti possono chiudere con lo stesso totale per ragioni opposte: uno salta benissimo e cade nelle trottole, l’altro non sbaglia niente ma non rischia mai un triplo. Per questo le giurie separano elementi tecnici e componenti del programma, e per questo gli esercizi si svolgono sulla stessa pista, con lo stesso ghiaccio, davanti agli stessi giudici. Un voto che mescola tutto e cambia palazzetto a ogni gara non dice chi è più bravo.

La robotica di manipolazione, oggi, gareggia in palazzetti diversi. Ogni gruppo che presenta un nuovo modello «generalista» sceglie i propri compiti, il proprio simulatore o il proprio tavolo di laboratorio, e riporta un tasso di successo difficile da confrontare con quello degli altri. RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies, uscito su arXiv a inizio luglio 2026 (2607.04434), prova a costruire la pista comune. Lo firmano 44 ricercatori, con Tianxing Chen (MMLab dell’Università di Hong Kong) e Yue Chen (Università di Pechino) a coordinare il progetto, e fra gli autori corrispondenti Ping Luo, Mingyu Ding, Masayoshi Tomizuka e Wenbo Ding; partecipano fra gli altri Tsinghua, UC Berkeley, Stanford e MIT.

Qui si dà per noto che cosa sia una politica robotica «generalista»: un modello che guarda le telecamere, legge un’istruzione e produce comandi per i motori, spesso costruito sopra un modello visione-linguaggio. Da dove viene e che cosa promette la robotica con l’AI è raccontato nel libro.

Leggi «Robotica e AI» nel libro →

Due difetti dei banchi di prova attuali

Gli autori ne individuano due. Il primo è la varietà apparente: molti benchmark cambiano gli oggetti, la disposizione o la frase dell’istruzione, ma lo schema del gesto richiesto resta spesso simile, tipicamente un prendi e appoggia. Si misura la robustezza a un cambio di scenografia, non la presenza di capacità diverse come ricordare, essere precisi, concatenare molti passaggi.

Il secondo è la separazione fra simulazione e mondo reale. La simulazione è veloce e riproducibile, ma non cattura del tutto i contatti veri, gli errori degli attuatori, il rumore dei sensori. Il test fisico dà la prova diretta, ma costa, richiede ore di persone che rimettono a posto la scena, e un risultato ottenuto in un laboratorio con una certa luce e una certa posizione del braccio non si ripete facilmente in un altro.

Com’è fatta la pista

RoboDojo ha tre pezzi. Il primo è un benchmark in simulazione su NVIDIA Isaac Sim, con 42 compiti per un robot a due braccia ARX X5, raggruppati in cinque dimensioni: generalizzazione (12 compiti, con sfondi, luci, oggetti e fino a 25 oggetti di disturbo sul tavolo, contro i 10 al massimo di RoboTwin 2.0), memoria (6: per esempio ricordare la categoria di un oggetto sparito su un nastro trasportatore e poi prenderne uno uguale), lungo orizzonte (8), precisione (8: infilare tubi in fori stretti, inserire una chiave) e apertura (8: istruzioni nuove che ricombinano abilità viste altrove). Per l’addestramento ci sono 100 dimostrazioni per compito, 3.500 traiettorie e 20,66 ore in tutto; la dimensione «aperta» è esclusa di proposito dai dati.

Ogni compito si valuta su 50 episodi, e per la generalizzazione metà sono nella scena standard e metà in quella randomizzata. Il punteggio complessivo non è la media sui 42 compiti ma quella sulle cinque dimensioni,

$$\text{Totale} = \frac{1}{5}\sum_{d=1}^{5} \bar{s}_d,$$

così la generalizzazione, che ha più compiti, non pesa più delle altre. Accanto al successo binario il paper riporta un punteggio parziale, che dà credito ai passaggi intermedi completati.

Il secondo pezzo è RoboDojo-RealEval, un banco fisico standardizzato: 18 compiti, sei per ciascuno di tre robot a due braccia (ARX X5, Piper, Piper X), su una piattaforma di un metro e mezzo per lato in cui bracci, telecamere e luci stanno in posizioni fisse, con supporti stampati in 3D. Prima di ogni prova la disposizione degli oggetti si ripristina sovrapponendo in trasparenza l’immagine di riferimento alla ripresa dal vivo. Ogni politica fa 10 prove per compito; ogni prova è giudicata da tre valutatori in doppio cieco, i video vengono pubblicati e c’è un meccanismo di ricorso. Il banco si può usare da remoto.

Il terzo pezzo è XPolicyLab, uno strato comune che standardizza conversione dei dati, addestramento e interfaccia di deployment: una politica si integra una volta e gira sia in simulazione sia sul tavolo vero. Gli autori ci hanno portato dentro trenta modelli.

C’è anche una parte di governance che vale la pena riportare. La classifica è gestita da AI MMLab Club, che il paper descrive come fondazione senza scopo di lucro; gli autori dichiarano che nessuna azienda partecipa al processo ufficiale, né come sponsor né come finanziatore. Per entrare nella classifica verificata servono tre seed in simulazione, tutti e tre i robot nel reale, il superamento di disposizioni nascoste che i partecipanti non hanno visto, e la pubblicazione di checkpoint, codice e video. È una risposta all’accusa classica ai benchmark, ottimizzare sulle disposizioni pubbliche fino a imparare il test, ma parziale: le disposizioni nascoste fanno da controllo di coerenza, e la classifica principale si calcola ancora su quelle pubbliche.

Le disposizioni nascoste servono per la stessa ragione per cui si tiene da parte un insieme di test: un modello, o un gruppo di ricerca, che vede sempre le stesse prove finisce per adattarsi a loro. Il meccanismo è spiegato nel libro.

Leggi «Overfitting e validazione» nel libro →

La classifica

I numeri sono bassi, e il paper non li addolcisce. In simulazione la politica migliore, Hy-Embodied-0.5-VLA, ha un tasso di successo medio dell’8,80% e un punteggio di 13,07. Tre teleoperatori esperti, con oltre mille ore di esperienza ciascuno e alle stesse condizioni, arrivano al 76,03%. Nessun modello supera il 15% di successo in nessuna dimensione.

Tasso di successo: la migliore politica contro l’operatore umano migliore politica nella dimensione teleoperatore esperto SIMULAZIONE · 42 compiti Generalizzazione 9,3% 87,8% Precisione 12,0% 64,0% Lungo orizzonte 14,9% 74,3% Memoria 12,1% 74,3% Apertura 1,7% 79,8% MONDO REALE · 18 compiti, 3 robot Media reale 12,8% 100% Migliore politica: Spatial Forcing, X-VLA, Hy-Embodied-0.5-VLA (×2), π0.5; nel reale π0.5

La scomposizione per dimensione è la parte più istruttiva. Ogni modello primeggia in un posto diverso: Spatial Forcing sulla generalizzazione, X-VLA sulla precisione (12,00%), Hy-Embodied su lungo orizzonte e memoria, π0.5 sulle istruzioni nuove. Ma nessuno di questi vantaggi si estende in modo coerente al resto della tabella. Sulle istruzioni aperte il migliore arriva all’1,67%: con compiti che non erano nei dati, i modelli, per ora, non riescono a ricombinare quello che hanno imparato.

La generalizzazione racconta il crollo in modo quasi didascalico. Hy-Embodied ha il punteggio più alto nella scena standard, 21,98, e scende a 1,57 quando cambiano luci, sfondo e disordine sul tavolo: un calo relativo del 92,9%, calcolato come $(s_{\text{std}} – s_{\text{rand}})/s_{\text{std}}$. Spatial Forcing, che aggiunge a π0.5 un allineamento esplicito con la geometria 3D della scena, tiene meglio: 6,98 contro 5,82 del modello di partenza, un calo del 67,2% invece del 72,2%. Un miglioramento vero, ma su numeri piccoli.

Le osservazioni qualitative sono forse più utili delle percentuali. Nel compito di inserire una chiave molte politiche, dopo aver mancato il passaggio fra le due braccia o l’allineamento, eseguono comunque il movimento di inserimento: seguono una sequenza imparata senza controllare se la condizione per il passo successivo è soddisfatta. Gli autori vedono anche tremolii nelle azioni di diverse politiche, con entrambe le rappresentazioni, nello spazio della pinza e in quello dei giunti. E nei compiti lunghi il punteggio parziale è sistematicamente più alto del successo: i modelli cominciano, raramente finiscono.

Sul banco reale sono state provate dieci politiche, e la prima è π0.5.

Il banco reale, le prime tre politiche 18 compiti su tre robot · tasso di successo, più alto è meglio
Politica Successo
π0.5 12,8% punteggio 22,9
InternVLA-A1 7,2%
GalaxeaVLA 4,4%
Riferimento umano
Teleoperatori esperti 100% ovunque

L’ordine ricalca quello della simulazione solo in parte: InternVLA-A1 e GalaxeaVLA vanno meglio sul tavolo vero di quanto la simulazione facesse prevedere. E il reale mostra un tipo di errore che la simulazione non punisce: DM0, a zero su tutti i 18 compiti, produce spesso comandi instabili, con movimenti erratici che richiedono di sorvegliare il robot da vicino o di intervenire per sicurezza. In simulazione un’azione scomposta abbassa un voto; su un braccio vero può rompere qualcosa.

Il banco regge?

Un benchmark vale quanto la sua ripetibilità, e il paper la misura. La simulazione eterogenea, in cui ambienti paralleli contengono scene diverse invece di copie della stessa, fa 77,4 interazioni al secondo contro 40,0 della versione omogenea su otto RTX 4090, misurate con azioni nulle (1,94 volte); con l’inferenza di π0.5 nel giro il vantaggio scende a 1,63 volte. Ripetendo la valutazione di tre politiche su tre GPU diverse, la deviazione standard del successo resta entro 1,1 punti percentuali in ogni dimensione. Nel reale l’intera batteria di 180 prove, misurata con π0.5, richiede 202 minuti, e tre ripetizioni complete con tre politiche danno un successo medio stabile entro 1,3 punti percentuali. Compito per compito, però, la deviazione standard del successo arriva a 23 punti.

Che cosa i numeri non dicono

Il primo limite è di interpretazione, e cambia il senso della classifica. Tutti i modelli, tranne ACT che è addestrato da zero, partono da un checkpoint pre-addestrato e vengono rifiniti sui dati di RoboDojo, con 100 dimostrazioni per compito: quello che si misura è quanto un modello pre-addestrato impara da cento esempi per compito su questo robot, non quanto sa fare «da solo». E le ricette sono molto diverse: fra i modelli rifiniti si va da 15.000 passi di addestramento per LingBot-VLA a 300.000 per GigaWorld-Policy e LDA-1B, con batch da 32 a 768. Una parte delle distanze in classifica può venire dalla ricetta più che dal modello, e il paper non la separa.

Il secondo riguarda la risoluzione del reale. Con 10 prove per compito ogni successo sposta il risultato di dieci punti, e le ripetizioni lo mostrano con le deviazioni fino a 23 punti su un singolo compito. In più ogni politica è addestrata con un solo seed per robot, quindi nel reale la variabilità dell’addestramento non è misurata. Le medie reggono; i confronti compito per compito vanno letti con prudenza.

Il terzo riguarda il riferimento umano. I teleoperatori che fanno 100% hanno partecipato alla raccolta dei dati e hanno più di 1.500 ore di esperienza ciascuno: dimostrano che i compiti sono fattibili, non che un umano qualunque li risolverebbe sempre. Infine, simulazione e reale non sono coppie di compiti allineati, per scelta dichiarata: il paper non misura il trasferimento dall’una all’altro, e la differenza di classifica fra i due non si può leggere come tale.

Resta un fatto che vale più dei singoli numeri. Nel 2026 i modelli «generalisti» per robot vengono presentati con demo sempre più convincenti, e un banco comune, con disposizioni nascoste, giudici in doppio cieco e video pubblici, è il modo più diretto di distinguere una capacità da una ripresa ben scelta. Se RoboDojo diventerà la pista di tutti dipende da quanti gruppi accetteranno di pubblicare checkpoint e codice per entrare in classifica. Per ora la prima fotografia è chiara: un robot che trova la tazza con le luci accese, e la perde quando cambia la tovaglia.

I commenti sono riservati agli iscritti.

Accedi per commentare