Il guidatore esperto, prima di girare il volante, si è già figurato dove sarà l’auto fra tre secondi. E non come una fotografia: sa quanto è larga la curva, a che distanza è il marciapiede, che quella sagoma a destra è un ciclista e non un cartello. Colori, distanze, cose: tre modi di vedere lo stesso futuro, tenuti insieme senza pensarci. In autostrada deserta, poi, smette quasi di farlo e va col pilota automatico.
È l’idea, trasportata in un laboratorio di robotica, di Flex-π: A Multi-Stream World-Action Model with Compute Flexibility, uscito su arXiv l’11 agosto 2026 (2608.10860, versione 3 del 29 agosto). Lo firmano Ge Yan, Jinghao Liu e Yuzhi Fan (primi autori a pari merito), Lei Cai, Minwen Liao, Jesse Zhang e Dieter Fox, dell’Università di Washington e, per Fox, anche dell’Allen Institute for AI. Il motivo sta nei numeri: su un robot a due braccia vero, nei compiti più difficili, stacca i concorrenti di decine di punti, e nella modalità più rapida lo fa restando più veloce di π0.5.
Il limite dei world-action model
Negli ultimi anni la ricetta più seguita per i robot generalisti è stata il VLA, vision-language-action: un grande modello visione-linguaggio preaddestrato sul web, a cui si insegna a emettere azioni. Di recente le si è affiancata un’alternativa, il world-action model (WAM): un modello che, mentre decide che cosa fare, prevede anche che cosa vedrà dopo. I vantaggi riportati sono due: prevedere il futuro insieme all’azione costringe a imparare rappresentazioni più robuste; e partire da un generatore video preaddestrato regala al robot un’intuizione di come si muovono le cose nel tempo.
Che cosa significa per un modello «immaginare» il mondo prima di agire, e perché è una strada diversa dal solo imparare a reagire: i world model sono spiegati nel libro.
Il difetto messo a fuoco dagli autori è sottile. Quasi tutti i WAM prevedono solo i latenti RGB, i fotogrammi compressi dall’autoencoder del generatore video. Quei latenti sono addestrati a ricostruire pixel: sanno molto di aspetto, poco di geometria e di oggetti, che sono proprio ciò che serve a chi deve infilare un cucchiaio in un portaposate. Aggiungere geometria e semantica sembrerebbe ovvio, ma ha tre prezzi: sensori in più, un nuovo preaddestramento, un’inferenza più lenta. Il paper sostiene di evitarli tutti e tre.
Un pranzo gratis dentro l’autoencoder
Tutto poggia su una sorpresa. Gli autori prendono l’autoencoder variazionale (VAE) congelato del generatore video Wan-2.2-5B, addestrato soltanto su immagini a colori, e ci fanno passare una pointmap: un’immagine in cui ogni pixel, invece di tre valori di colore, contiene le tre coordinate $(x, y, z)$ del punto di scena che rappresenta. Il VAE non ha mai visto nulla del genere, eppure la ricostruisce quasi senza perdite: nell’esempio della figura 3, PSNR 38 ed errore quadratico medio di 0,0001, l’unica misura che il paper ne dà. Tre numeri per pixel sono tre numeri per pixel, e lo spazio latente del video basta a ospitare anche la profondità.
Da qui la ricetta dei tre flussi, tutti ricavabili dalla stessa immagine RGB. Nel preaddestramento le pointmap non vengono da un sensore di profondità ma da Depth Anything 3, un modello che stima la geometria da un’immagine; la semantica degli oggetti viene dalle feature di DINOv3, un encoder visivo autosupervisionato. Entrambi pronti all’uso, entrambi congelati. Le feature DINO vengono piegate a gruppi di 2×2 patch in un solo token (da 768 a 3072 dimensioni), così il modello deve generare quattro volte meno token senza perdere dettaglio spaziale.
Il meccanismo: tre flussi e un’azione, denoisati insieme
Ognuno dei tre segnali diventa un flusso di token, e i tre flussi passano in una spina dorsale di tipo Mixture-of-Transformers inizializzata da Wan-2.2-5B: pesi condivisi per tutte le modalità visive, proiezioni proprie per ciascuna. Accanto lavora un «esperto d’azione» più stretto e con pesi propri: circa un miliardo di parametri, per un totale di 6. I flussi si parlano solo nei 16 blocchi centrali dei 30: all’inizio e alla fine ciascuno resta per conto proprio. L’attenzione va in un senso solo: le azioni guardano i futuri immaginati, nessun token visivo guarda le azioni.
Tutto viene generato con il flow matching, lo stesso strumento dei generatori video: si parte da rumore e si integra un campo di velocità, in $K$ passi di Euler, fino al futuro pulito. L’obiettivo di addestramento è la somma delle perdite di ciascun flusso, azione compresa:
$$\mathcal{L}(\theta) = \lambda_a \,\mathcal{L}_{\mathrm{FM}}^{a}(a_t) + \sum_{i \in \{o,\,d,\,p\}} \lambda_i \,\mathcal{L}_{\mathrm{FM}}^{i}(i_{t+1}),$$
dove $o$, $d$ e $p$ sono colore, DINO e pointmap, e tutti i pesi $\lambda$ valgono 1 in ogni esperimento. Per DINO la testa predice direttamente la feature pulita invece della velocità, perché in 3072 dimensioni la predizione di velocità si degrada.
Come si passa dal rumore a un campione seguendo un campo di velocità, e perché la traiettoria rettilinea rende pochi passi sufficienti: il flow matching è spiegato nel capitolo sui modelli di diffusione.
La parte che dà il nome al modello è l’addestramento. Per ogni esempio si estraggono due maschere indipendenti: quali flussi il modello vede in ingresso (ognuno spento con probabilità 0,5, purché ne resti almeno uno) e quali futuri le azioni possono leggere. Ma ogni futuro viene comunque generato e paga la sua perdita. Così, se in ingresso manca la geometria, il modello deve lo stesso immaginare la pointmap del prossimo istante a partire da colore e semantica. Gli autori lo chiamano cross-modality forcing, e somiglia al gioco delle parole mascherate dei modelli linguistici: per indovinare ciò che manca bisogna aver capito come le parti stanno insieme.
Il risultato pratico è che un solo checkpoint copre tutte le combinazioni: solo azioni, veloce, oppure azioni più uno, due o tre futuri immaginati, più lento e più preciso. Il compromesso fra velocità e prestazioni non si fissa in addestramento: lo sceglie chi mette il robot in produzione.
I numeri
Il preaddestramento usa circa 500 ore di dimostrazioni da 100 compiti di AgiBot World, poi ogni banco di prova ha il suo fine-tuning. Sul robot reale, uno YAM a due braccia, i compiti sono cinque, tra cui due molto difficili: rimontare la propria pinza con un avvitatore elettrico, in otto fasi, con giochi di inserimento di ±0,25-0,5 millimetri; e aprire un astuccio morbido, metterci una penna e richiudere la zip. Flex-π vince su tutti e cinque, e in modalità completa il margine sul miglior concorrente cresce con la difficoltà.
| Compito | Margine |
|---|---|
| Riordino della cucina | +5,0 |
| Rimontare la pinza con l’avvitatore | +42,7 |
| Penna nell’astuccio, con la zip | +27,2 |
In media Flex-π ottiene un tasso di successo pieno 3,5 volte quello di π0.5 e 2,3 volte quello di ManiFlow, una politica 3D che riceve anche la profondità. La modalità solo-azione, a circa 60 millisecondi per chiamata, batte già tutti i concorrenti ed è la più rapida; accendere la generazione dei futuri alza il successo pieno medio di 13 punti, dal 50 al 63 per cento, al prezzo di circa il triplo della latenza.
Su tre compiti, con oggetti mai visti e tavoli ingombri di distrazioni, Flex-π perde in media 4,7 punti in modalità completa e 4,1 in solo-azione. ManiFlow ne perde 26,7; π0.5 cede 25,6 punti sull’astuccio. Con metà delle dimostrazioni, la versione completa fa ancora meglio di tutti i concorrenti addestrati con i dati interi; ma questa prova il paper la mostra su un compito solo, il piatto nella rastrelliera.
In simulazione, su 50 compiti di RoboTwin, raggiunge il 94,6 per cento contro il 93,9 di Qwen-RobotManip-Context, che però è stato preaddestrato su circa 38.100 ore: 76 volte di più. Le due modalità si equivalgono, segno per gli autori di un banco di prova forse vicino alla saturazione. Con 50 dimostrazioni per compito il vantaggio su π0.5, Fast-WAM e LingBot-VA è di 1,9-4,5 volte; a 500 Fast-WAM e LingBot-VA arrivano a circa 3 punti. Su LIBERO, che senza separazione fra addestramento e test misura soprattutto quanto bene si riproducono le azioni viste, la variante senza dropout arriva al 99,2 per cento in modalità completa, pari al migliore. Su LIBERO-Plus, che perturba lungo sette assi fra cui luci, camere, istruzioni e disposizione, fa 88,6 contro l’85,7 di π0.5, a 0,4 punti da Qwen-RobotManip e dietro solo alla sua variante con contesto (91,4).
Le ablazioni, su cinque compiti di RoboTwin, dicono da dove viene il guadagno. Aggiungere DINO al solo video alza il successo di 6,8 punti; le pointmap, sopra entrambi, di altri 20. Togliere il cross-modality forcing lo abbassa di 21 punti. Gli autori ne traggono la tesi più interessante: la modalità solo-azione, che a inferenza non immagina nulla, beneficerebbe comunque dell’addestramento sui tre flussi, come se la geometria imparata in palestra restasse nei pesi anche in gara. La prova però è indiretta: un confronto diretto della solo-azione addestrata con e senza pointmap c’è solo su LIBERO, e lì la differenza è di 0,1-0,4 punti.
I limiti
Gli autori ne dichiarano tre. Le modalità in più e il forcing rallentano la convergenza: servono almeno dieci epoche di fine-tuning sui compiti reali. La generazione completa resta più lenta di un VLA di taglia comparabile, e il vantaggio di velocità vale solo in modalità solo-azione. Su LIBERO-Plus gli unici davanti abbinano un robusto modello visione-linguaggio a 76 volte più dati robotici, segno che la comprensione semantica di Flex-π ha ancora margine.
A questi se ne aggiungono alcuni che dal paper si leggono. La promessa «niente sensori nuovi» è verificata a metà: Depth Anything 3 serve nel preaddestramento, ma sul robot vero le pointmap vengono da telecamere stereo che la profondità la misurano, e in simulazione dal simulatore. Con il solo colore in ingresso il modello è provato soltanto in simulazione. Le prove reali sono cinque compiti con 10-20 tentativi ciascuno, su una sola piattaforma: con così pochi tentativi le barre d’errore restano ampie. Le latenze, avvertono gli autori in appendice, sono misurate con un’ottimizzazione diversa per ciascun metodo. Fast-WAM, l’unico WAM concorrente sul robot reale, non è stato provato sui due compiti più difficili perché già scarso sugli altri. E la curva velocità-prestazioni in simulazione viene da cinque compiti addestrati da zero per cinque epoche: una tendenza, non una misura di produzione.
Che cosa c’è in gioco
La lezione più larga sta nella scoperta collaterale. Se l’autoencoder di un generatore video, addestrato solo sui colori, codifica la geometria quasi senza perdite, i grandi modelli video già esistenti diventano uno spazio in cui versare molto più del video, senza pagarne l’addestramento. E se un robot impara di più quando gli si chiede di immaginare il mondo in tre modi, anche se al lavoro non ne usa nessuno, la domanda non è più solo quanti dati raccogliere, ma quante cose chiedere di prevedere a partire dagli stessi dati. La pagina del progetto è flex-pi.github.io; la prova vera sarà fuori dai laboratori che l’hanno scritto.

I commenti sono riservati agli iscritti.
Accedi per commentare