DreamX-Phi 1.0, il world model video che deve muovere il braccio giusto: il primo posto provvisorio su WorldArena 2.0 e che cosa non dimostra

Un world model per la manipolazione robotica riceve una fotografia della scena e la traiettoria prescritta per due bracci, e deve mostrare che cosa succederà. Il DreamX Team lo costruisce su Wan2.2 da 5 miliardi di parametri, con la geometria di ogni braccio iniettata nell'attenzione e tre segnali di addestramento che guardano la scena e l'oggetto afferrato. Primo su 31 nella Track 1 di WorldArena 2.0, in un'istantanea della classifica e con mezzo punto di vantaggio. I numeri, il loro margine e le ablazioni che mancano.

Chiunque abbia visto un film doppiato male conosce la sensazione. Le voci sono belle, la recitazione è buona, la traduzione è corretta; eppure qualcosa non torna, perché la bocca dell’attore si chiude mentre la frase continua. Basta una sillaba fuori tempo per smettere di credere alla scena.

Ai world model video per la robotica capita qualcosa di simile, a parti invertite. Sono modelli che ricevono l’inquadratura di un tavolo e una sequenza di movimenti che si vorrebbe far eseguire a un robot, e generano il video di ciò che accadrebbe, per provare le azioni prima di eseguirle sul serio. Il video che producono può però essere convincente e sbagliato insieme: muove il braccio sinistro quando il comando riguardava il destro, perde l’oggetto a metà della presa, scambia l’apertura della pinza con la chiusura. DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation, uscito su arXiv il 13 agosto 2026 (2608.13489), si occupa proprio di questo doppiaggio. Lo firma il DreamX Team: nove autori in ordine alfabetico, da Rui Chen a Pengfei Zhang. Il paper non riporta affiliazioni; il codice è annunciato sotto l’organizzazione GitHub AMAP-ML, e pesi e codice di inferenza, scrivono gli autori, arriveranno dopo la chiusura della WorldArena 2.0 IROS Challenge.

Che cosa sia un world model e perché ci si aspetti di usarlo per pianificare: il libro ne fa il quadro nel capitolo dedicato.

Leggi «World Model» nel libro →

Un simulatore che riceve le azioni, non le sceglie

Prima il contratto. DreamX-Phi non decide che cosa fare: è quello che gli autori chiamano un forward dynamics model. Riceve una fotografia iniziale $x_0$, un’istruzione in linguaggio naturale $c$ e una traiettoria prescritta $a_{1:T}$ per due bracci, fatta di pose della pinza nello spazio (posizione e orientamento) e del suo stato di apertura, e genera i fotogrammi futuri. In formula, impara la distribuzione condizionata

$$p_\theta(x_{1:T} \mid x_0, a_{1:T}, c).$$

La base è Wan2.2-TI2V-5B, un generatore video a diffusione da 5 miliardi di parametri, addestrato qui con un obiettivo di flow matching. Quasi tutto il resto del lavoro serve a una cosa: fare in modo che a traiettorie diverse, partendo dalla stessa fotografia, corrispondano video diversi nel modo giusto, e che ciò che l’azione non tocca resti invariato.

La geometria di ogni braccio dentro l’attenzione

Il modo abituale di dare le azioni a un generatore video è comprimerle: qualche token in più, oppure una modulazione delle feature. Così il modello deve indovinare da sé che una posa della pinza è un movimento rigido nello spazio, e dove quel movimento comparirà nell’immagine. DreamX-Phi prende un’altra strada, presa in prestito da un lavoro nato per le telecamere: PRoPE, che inserisce le trasformazioni geometriche relative direttamente nel calcolo dell’attenzione. Qui la pinza non viene trattata come una telecamera; del meccanismo si riusa solo la parte che espone le trasformazioni rigide fra un istante e l’altro della traiettoria.

In concreto, ogni posa di ogni braccio diventa una matrice $4 \times 4$ espressa rispetto alla posa iniziale del primo braccio, così che i due bracci stiano nello stesso sistema di riferimento; le traslazioni vengono riscalate con un unico fattore che misura l’ampiezza del movimento, non la distanza fra i bracci. Le teste di attenzione sono divise in gruppi fissi, uno per braccio, e ogni gruppo vede la trasformazione del proprio:

$$Q’_i = D_i^\top Q_i, \qquad K’_i = D_i^{-1} K_i, \qquad V’_i = D_i^{-1} V_i.$$

Il risultato è che due token vengono messi in relazione attraverso il moto relativo $D_i D_j^{-1}$ fra i loro istanti, non attraverso coordinate assolute. E siccome ogni braccio ha le sue teste, il modello ha un posto preciso dove tenere a mente quale braccio sta facendo che cosa: è, nelle intenzioni degli autori, la risposta al video che muove il braccio sbagliato. L’apertura della pinza, che è un numero e non un movimento rigido, entra a parte, come una correzione aggiunta alle teste di quel braccio. Il tutto vive in un ramo parallelo, sommato all’attenzione originale, con la proiezione d’uscita inizializzata a zero: all’inizio dell’addestramento tace, e l’uscita del generatore preaddestrato non cambia. Accanto, un secondo segnale descrive il movimento del solo robot nel piano dell’immagine, sotto forma di flusso ottico; il paper lo nomina nell’introduzione, nello schema e nel confronto con i lavori precedenti, ma non ne descrive la costruzione.

DreamX-Phi 1.0: che cosa entra, che cosa esce, che cosa serve solo a imparare fotografia iniziale istruzione traiettoria prescritta 2 bracci: pose + pinza Generatore video Wan2.2 5 miliardi di parametri attenzione originale, preaddestrata ramo geometrico (all’inizio muto) teste braccio 1 teste braccio 2 + video futuro previsto Solo in addestramento: all’uso non servono profondità ramo che legge l’RGB, mai il contrario maschera dell’oggetto SAM3: più peso ai pixel dell’oggetto manipolato insegnante V-JEPA congelato: l’oggetto resta se stesso nel tempo poi distillazione DMD: da molti passi a pochi

Guardare dove succede la presa

Un braccio che segue il comando non basta: la geometria della scena e il destino dell’oggetto afferrato restano poco vincolati. Il difetto è sottile: l’errore su cui il generatore si addestra è mediato su tutto il fotogramma, e in una scena di manipolazione il braccio e l’oggetto occupano spesso una piccola parte dell’inquadratura. Un video può così risultare fotorealistico anche quando la pinza manca l’oggetto o lo attraversa, o quando l’oggetto cambia forma dopo essere stato preso.

I rimedi sono tre, e tutti e tre agiscono solo durante l’addestramento. Il primo è un ramo di profondità: gli ultimi blocchi del trasformatore vengono duplicati e imparano a prevedere, nello spazio latente, le mappe di profondità ricavate con Depth Anything 3. Il collegamento è a senso unico, la profondità legge le rappresentazioni del video ma il video non legge la profondità, così che all’uso il ramo si può semplicemente togliere. Il secondo è una maschera: SAM3 ritaglia l’oggetto manipolato e i suoi pixel pesano di più nella funzione di perdita, con un peso normalizzato perché la scala complessiva non cambi con la grandezza dell’oggetto:

$$\tilde w_i = 1 + (\lambda_m – 1)\, m_i, \qquad w_i = \frac{\tilde w_i}{\frac{1}{|V|}\sum_{j \in V} \tilde w_j},$$

dove $m_i$ vale 1 sui token dell’oggetto e $\lambda_m > 1$ è il rapporto fra il peso dell’oggetto e quello dello sfondo prima della normalizzazione. Il terzo è un insegnante: V-JEPA, un modello video congelato. Non si chiede al generatore di copiarne le feature, ma di riprodurne le relazioni, cioè quanto ogni punto dell’oggetto somiglia agli altri nello spazio e nel tempo. L’oggetto deve restare se stesso lungo tutta la presa.

Per l’uso pratico, infine, il generatore a molti passi viene distillato con DMD2 in uno studente che ne fa pochi, con un termine avversariale in aggiunta. Quanti, il paper non lo dice.

Come si passa da decine di passi di denoising a pochi, e che cosa si perde: la distillazione è spiegata nel capitolo sui modelli di diffusione.

Leggi «Generatori a un passo» nel libro →

I dati

Il corpus mescola tre tipi di materiale. Video in prima persona senza azioni (Ego4D, 3.700 ore), che allargano il repertorio di aspetti e movimenti. Dimostrazioni di robot reali: AgiBot World 2026 (1.900 ore in tabella; la parte di imitation learning, filtrata, ne conta 178,7), Cosmos3-DROID (350), RoboCOIN (618). E simulazione: InternData-A1 (78 ore reali e 3.747 simulate) e 25.000 clip bimanuali di RoboTwin 2.0, passate prima da DreamX-Refiner, un modello della stessa squadra che ne alza la risoluzione. Le esecuzioni fallite restano di proposito nel corpus.

I numeri

Il banco di prova è WorldArena, e le cifre vengono da istantanee fissate di una classifica che si aggiorna di continuo. Nella Track 1 di WorldArena 2.0 (1.000 episodi derivati da RoboTwin 2.0: dato l’inizio e un’istruzione o una traiettoria, prevedere il seguito) DreamX-Phi è primo su 31 voci nell’istantanea del 12 agosto. Il punteggio complessivo, l’EWMScore-P, è la media di 15 metriche fra qualità visiva, movimento, coerenza, fisica, 3D e controllabilità. Il primo posto vale mezzo punto su cento, e non è, avvertono gli autori, la classifica finale della gara. Dove il vantaggio è più netto è proprio nella voce che il paper vuole migliorare, l’accuratezza della traiettoria.

I primi tre della Track 1 WorldArena 2.0, istantanea del 12 agosto · più alto è meglio
Modello EWMScore-P Traiettoria
DreamX-Phi 60,65 57,15
Alpha-World 60,13 49,22
FlowWAM-FiveAges 59,72 49,76

Sulle altre voci il quadro è meno netto. Nella qualità dell’interazione il margine è minimo (57,36 contro 57,18), sulla precisione della profondità FlowWAM fa meglio (98,99 contro 98,55), e sulla qualità d’immagine DreamX-Phi è dietro entrambi (63,25 contro 64,59 e 64,31).

La Track 2 misura un’altra cosa, più vicina all’uso vero: si ottimizza una politica π0.5, partendo da un’inizializzazione fornita dagli organizzatori, facendola interagire con il world model al posto del simulatore, e poi la si mette alla prova su episodi mai visti di un solo compito, «Adjust Bottle», sistemare una bottiglia. Con DreamX-Phi come ambiente la politica riesce nel 67,19% dei casi: secondo posto a pari merito con Lute, dietro WOVR-PLUS al 68,75%. Fra i nove sistemi della tabella la forbice è stretta: l’ultimo, iVideoGPT, è al 56,25%.

Su WorldArena 1.0, Track 1, gli autori riportano 76,88 contro il 73,64 di UNIS, primo nella classifica ufficiale del 15 luglio. Ma è una valutazione fatta da loro, offline, non un’iscrizione in classifica.

Che cosa resta da verificare

Non ci sono ablazioni. È il limite più grande, e gli autori lo scrivono loro stessi due volte: le classifiche valutano il sistema intero e non dicono quanto contribuisca ciascun pezzo. L’attenzione geometrica per braccio, il flusso ottico, la profondità, la maschera, l’insegnante V-JEPA, i dati raffinati, la distillazione: nessuno è stato tolto per vedere che cosa succede. La tesi che la geometria dell’azione vada preservata è coerente con il vantaggio sull’accuratezza di traiettoria, ma non è dimostrata.

Il perimetro è stretto. Tutto si svolge su WorldArena e quindi su RoboTwin, cioè in simulazione; la Track 2 copre un compito solo. Robot reali, altri corpi robotici, altri compiti: non verificati, per dichiarazione degli autori. E la simulazione della valutazione è la stessa da cui vengono le 25.000 clip dell’addestramento condizionato, e il paper non discute quanto le due cose si sovrappongano.

Il modello non agisce. DreamX-Phi prevede ciò che accadrebbe dato un comando, non genera comandi, e non è stato provato come controllore a ciclo chiuso.

Mancano i costi e, per ora, i pesi. Nessun dato su risorse di calcolo, tempi di addestramento, velocità di generazione o numero di passi dello studente distillato: non è un dettaglio, per un modello che dovrebbe provare molte azioni in fretta. Pesi e codice, che permetterebbero ad altri di controllare, sono promessi a gara chiusa.

Perché conta adesso

La promessa dei world model per la robotica è pratica: provare mille movimenti in un video prima di rischiarne uno su un braccio vero. Perché regga, il video deve essere prima di tutto fedele al comando, e solo dopo bello. DreamX-Phi è un esempio chiaro di questa correzione di rotta: invece di chiedere al generatore di indovinare la geometria dell’azione, gliela consegna nella forma in cui esiste, un moto rigido per ciascun braccio, e poi sposta l’attenzione dell’addestramento dallo sfondo al punto in cui la pinza tocca l’oggetto. I numeri dicono che la ricetta funziona abbastanza da guidare, di poco, un’istantanea di una classifica affollata. Quale ingrediente la faccia funzionare, e se funzioni fuori dalla simulazione, sono le due domande che la versione 1.0 lascia a chi verrà dopo, compresi i suoi autori.

I commenti sono riservati agli iscritti.

Accedi per commentare