World Action Models: la survey di Fudan che mette ordine fra i robot che immaginano prima di agire

I modelli visione-linguaggio-azione guidano i robot senza chiedersi che cosa succederà dopo. Un gruppo di Fudan raccoglie in 69 pagine i lavori che provano a insegnarglielo e dà una definizione formale a un nome che circolava già, World Action Models: le due famiglie di architetture, i dati, le misure. E il conto aperto: un'inferenza a 7 Hz contro i 50 dei VLA non generativi, e video convincenti che un robot non riesce a eseguire.

Chi versa l’acqua in un bicchiere non guarda soltanto la bottiglia. Guarda il livello che sale e, un attimo prima che arrivi all’orlo, raddrizza il polso. Non reagisce a quello che vede: reagisce a quello che sta per vedere. Un cameriere alle prime armi fa il contrario, guarda la bottiglia, si accorge del disastro quando è già sulla tovaglia e solo allora corregge.

La robotica degli ultimi tre anni, a sentire World Action Models: The Next Frontier in Embodied AI, ha costruito soprattutto camerieri alle prime armi, molto colti. La survey è uscita su arXiv il 12 maggio 2026 (2605.12090). La firmano Siyin Wang, Junhao Shi, Zhaoyang Fu, Xinzhe He e Feihong Liu come primi autori a pari merito, con Yu-Gang Jiang come autore di riferimento, fra l’Università Fudan, lo Shanghai Innovation Institute e la National University of Singapore. Sono 69 pagine e 366 voci di bibliografia, con un elenco di lavori mantenuto su GitHub (OpenMOSS/Awesome-WAM). Non propone un modello nuovo: prova a mettere ordine in un filone che negli ultimi mesi è cresciuto più in fretta dei suoi nomi.

Il limite che la survey mette al centro

Il punto di partenza sono i modelli Vision-Language-Action (VLA), come RT-2, OpenVLA e $\pi_0$: prendono un modello visione-linguaggio preaddestrato su scala internet e gli insegnano a emettere comandi motori. Funzionano, e generalizzano a istruzioni e oggetti mai visti, perché la semantica imparata sul web si trasferisce. Ma, osservano gli autori, imparano una mappa diretta dall’osservazione all’azione, $p(a \mid o, l)$ con $o$ l’osservazione corrente e $l$ l’istruzione, senza mai chiedersi come cambierà la scena dopo il gesto. È il cameriere che guarda la bottiglia.

L’altra metà della storia sono i world model, modelli che fanno il contrario: data una scena e un’azione ipotetica, predicono la scena successiva, $p(o’ \mid o, a)$. Sanno immaginare, ma non sanno decidere.

Che cosa sia un world model, e perché «immaginare» il passo successivo aiuti a decidere, il libro lo spiega da capo.

Leggi «World Model» nel libro →

Per chi fa entrambe le cose la survey adotta un nome che circolava già nei titoli di alcuni lavori recensiti (DreamZero, uscito tre mesi prima, si intitola World Action Models are Zero-shot Policies) e gli dà una definizione formale. Un World Action Model (WAM) è un modello fondazionale per robot che punta alla distribuzione congiunta di stato futuro e azione:

$$\mathcal{L}_{\text{WAM}} = \mathbb{E}_{(o,l,o’,a)\sim\mathcal{D}}\left[-\log p(o’, a \mid o, l)\right]$$

Per rientrare nella definizione servono due requisiti. Il modello deve prevedere lo stato futuro in una forma quantificabile, che siano fotogrammi video, flusso ottico o una rappresentazione latente. E deve legare l’azione a quella previsione, non limitarsi a produrla accanto. È una definizione che esclude: una «video policy» che usa soltanto lo scheletro di un generatore video per estrarre caratteristiche, senza essere addestrata a prevedere il futuro, per gli autori non è un WAM. I «Video Action Models», invece, per la survey ne sono un sottoinsieme: il video è solo uno dei modi di rappresentare il mondo, accanto a nuvole di punti e segnali tattili o di forza. C’è anche una scelta di parole dichiarata: il termine usato da alcuni lavori precedenti, Action World Model, faceva del sistema un simulatore potenziato; World Action Model ne fa un agente, erede diretto della famiglia VLA.

Dall’osservazione all’azione: tre strade VLA reagisce scena o + testo l politica azione a nessun futuro WAM a cascata prima immagina, poi decide scena o + testo l world model futuro o′ decoder a pixel (esplicito) o latente (implicito) due moduli, addestrati separatamente WAM congiunto immagina e decide nello stesso gesto scena o + testo l un solo modello autoregressivo o a diffusione futuro o′ azione a un obiettivo solo: p(o′, a | o, l)

Due famiglie, e le loro tensioni

La tassonomia, che è il contributo principale, divide il campo in due.

I WAM a cascata scompongono il problema: $p(o’, a \mid o, l) = p(a \mid o’, o, l)\, p(o’ \mid o, l)$. Prima un world model genera il futuro desiderato, poi un secondo modulo ne ricava i comandi. Il capostipite è UniPi (2023): un modello a diffusione genera il video del compito eseguito, e un modello di dinamica inversa ricava l’azione fra un fotogramma e il successivo. È un’idea elegante, perché ciascun pezzo fa una cosa sola: il generatore non deve sapere nulla di giunti e cinematica, il decodificatore non deve prevedere la scena. Ma su orizzonti lunghi il video deriva, e gli errori si sommano. Il ramo si divide fra chi ragiona in pixel, interpretabili ma costosi, e chi resta nello spazio latente: VPP prevede in un solo passo le rappresentazioni compresse del futuro e, secondo la survey, è il primo del suo ramo a pianificare a velocità compatibili con il controllo in tempo reale. Un caso istruttivo è Veo-Act: usa i video generati da Veo 3 per gli spostamenti grossolani e cede il controllo a una politica VLA reattiva quando il contatto con l’oggetto è imminente. È la risposta, scrive la survey, a uno scarto di precisione: dove c’è contatto, il video generato non basta.

I WAM congiunti imparano le due cose insieme, con un solo obiettivo. Quelli autoregressivi mettono in fila token di immagine e token di azione, e pagano due prezzi: un’allucinazione visiva all’inizio si propaga alle azioni successive, e la decodifica un token alla volta è lenta. Quelli a diffusione generano scena e azione in parallelo, e nell’elenco della survey sono il ramo più affollato.

Il Diffusion Transformer, la spina dorsale di gran parte dei modelli congiunti a diffusione, è spiegato nel libro.

Leggi «Diffusion Transformer (DiT)» nel libro →

Qui la survey registra soluzioni ingegnose. UWM assegna livelli di rumore separati alla scena e all’azione dentro lo stesso Transformer: regolandoli al momento dell’uso, un modello solo diventa politica, modello della dinamica diretta, dinamica inversa o generatore video, e i video senza azioni annotate si usano lasciando l’azione tutta rumore. Cosmos Policy, costruito sul modello video Cosmos-Predict2 di NVIDIA, codifica azioni, stati futuri e perfino una stima del valore come fotogrammi latenti mescolati a quelli dell’immagine. DreamZero parte dal generatore Wan2.1 e aggiunge poco: codificatori per stato e azione e un decodificatore delle azioni, più una serie di ottimizzazioni di sistema per stare nei tempi.

I dati: il vantaggio più concreto

Il vantaggio che la survey chiama «unico» dei WAM sta nei dati. Un VLA impara da dimostrazioni in cui ogni passo ha la sua azione, raccolte per lo più con la teleoperazione: precise, costose, confinate in laboratorio. Un modello che deve anche prevedere il mondo può imparare pure dai video senza azioni, e di quelli ce ne sono moltissimi. La survey mette in fila quattro fonti, dalla teleoperazione, precisa ma rigida, ai video, economici e sterminati: teleoperazione robotica; dimostrazioni umane con strumenti portatili come UMI, una pinza stampata in 3D con telecamere, usata da persone non esperte fuori dal laboratorio (FastUMI-100K supera le centomila traiettorie); simulazione; video egocentrici. Su quest’ultima i numeri sono di un altro ordine: oltre 3.600 ore per Ego4D, circa 44.000 per DreamDojo. Diversi lavori mostrano che questi video migliorano la manipolazione, ma la questione, che gli autori stessi lasciano aperta, è che cosa passi davvero da quei video al robot: fisica di base come la gravità e la permanenza degli oggetti, relazioni di causa ed effetto, o la logica del compito? Una ricetta di mescolanza fondata su principi, scrivono, ancora non c’è.

Il conto aperto

L’ultima parte è la più utile, perché è franca.

La latenza. Prevedere il futuro costa. DreamZero, con accelerazioni algoritmiche e ottimizzazioni CUDA, ha portato l’inferenza verso i 7 Hz; le politiche VLA non generative lavorano a 50 Hz. Gli autori formulano la domanda che conta: quanta fedeltà predittiva serve davvero al controllo? Se il guadagno si ferma molto prima di un video perfetto, il problema non è rendere veloce la previsione di alta qualità, ma trovare il world model minimo sufficiente.

Forse il futuro non serve vederlo. È l’osservazione più scomoda per l’intera tesi: in alcuni WAM l’utilità della previsione sembra venire dai gradienti che fornisce durante l’addestramento, non dai fotogrammi generati al momento dell’uso, e in alcuni lavori togliere la testa predittiva a inferenza non peggiora necessariamente il controllo. Fast-WAM usa il ramo video solo in addestramento e al momento dell’uso lo toglie; GigaWorld-Policy non lascia che l’azione guardi il futuro immaginato, e così evita di generarlo. Se fosse la regola, il world model sarebbe un ottimo insegnante più che un componente, e le direzioni latenti come JEPA diventerebbero la strada più economica, anche se, avvertono gli autori, resta da vedere se il solo spazio latente basti.

Nessun confronto alla pari. Cascata, congiunto, discreto, latente: il campo ha prodotto moltissime architetture e, scrivono gli autori, nessuno studio controllato le ha messe a confronto a parità di scala, dati e protocollo. Una survey che tassonomizza senza poter dire quale ramo funzioni meglio lo ammette con onestà, ma resta una mappa senza distanze.

Misure scollegate. Il world model si valuta con metriche sui pixel come PSNR e FVD, che premiano anche un video in cui gli oggetti fluttuano senza appoggio. Le azioni si valutano dal successo del compito. Nessuna delle due guarda il legame fra ciò che il modello immagina e ciò che fa, che è la ragione d’essere dei WAM. Il caso citato è il «test di Turing della dinamica inversa» di Wow, wo, val!: si ricavano le azioni dai video generati e le si esegue su un robot vero, e molti modelli visivamente convincenti scendono a un successo quasi nullo. Dall’altra parte, la survey passa in rassegna oltre 40 benchmark per le politiche, dal 2019 al 2026.

Sicurezza. Un modello che immagina con sicurezza un futuro sbagliato può impegnarsi in una sequenza lunga di azioni difficili da interrompere. La stessa capacità predittiva, però, offre un’occasione: verificare, in linea di principio, la previsione contro i vincoli fisici prima di eseguirla.

Ai limiti dichiarati se ne aggiungono due di genere. È una survey: non ci sono esperimenti propri, e i numeri citati vengono dai lavori recensiti, ciascuno con il suo protocollo. E il gruppo è parte in causa: diversi autori firmano i due lavori che l’introduzione cita a sostegno della premessa, un’analisi della fragilità dei VLA (LIBERO-Plus) e uno studio in cui modellare il mondo migliora la pianificazione. Quanto al nome, circolava già; i confini, cioè chi sta dentro e chi resta fuori, li traccia questa survey, e non sono ancora un uso condiviso.

Perché conta adesso

Negli ultimi due anni i generatori video sono diventati abbastanza bravi da far venire a molti laboratori la stessa idea: usarli come immaginazione per un robot. Il risultato, nella linea del tempo della survey, è un affollarsi di sigle soprattutto nei primi mesi del 2026, e il rischio che ciascuno reinventi la stessa architettura con un nome diverso. Il merito di questo lavoro è dare un vocabolario comune e dire ad alta voce le domande che il campo tende a saltare. Il cameriere che guarda il livello dell’acqua è un’immagine giusta, ma resta da dimostrare che il robot guardi davvero il futuro che si immagina, invece di aver imparato soltanto a fingere di farlo.

I commenti sono riservati agli iscritti.

Accedi per commentare