Chi ha giocato di ruolo attorno a un tavolo sa che la partita la reggono due persone diverse. Il giocatore dice che cosa fa il suo personaggio: apre la porta, sguaina la spada. Il master decide che cosa succede di conseguenza, e fa in modo che il mondo non resti mai fermo: arriva un temporale, compare un mercante. Senza il master il giocatore cammina in una scenografia vuota; senza il giocatore il master racconta a nessuno.
È lo schema di Infinite Worlds with Versatile Interactions, depositato su arXiv l’8 luglio 2026 (2607.07534). Lo firmano venti autori del team Robbyant, con Zelin Gao primo autore e Hao Ouyang responsabile del progetto, lo stesso gruppo che aveva pubblicato la prima versione di LingBot-World. Il paper presenta la seconda, LingBot-World 2.0, chiamata anche LingBot-World-Infinity: un modello che genera un mondo fotogramma dopo fotogramma rispondendo alla tastiera e a comandi scritti, che gli autori dichiarano di rilasciare con pesi, codice e l’impalcatura di agenti attorno.
Il problema: i mondi generati si sciolgono
Un world model interattivo è un generatore video che non conosce il finale. Ogni nuovo pezzo di video dipende da quelli già prodotti e dall’ultimo comando dell’utente, e gli errori si accumulano: un dettaglio sbagliato al secondo dieci diventa il contesto del secondo undici. Le texture si impastano, la geometria si deforma. La maggior parte dei sistemi, scrivono, resta stabile per secondi o pochi minuti. Il secondo problema è il costo: generare video dettagliato rispondendo in tempo reale costa molto, e chi ci è riuscito ha di solito sacrificato risoluzione, fluidità o controlli.
Che cosa si intende per world model, perché un generatore video che risponde ai comandi viene chiamato simulatore e il dibattito su quanto «capisca» davvero del mondo: tutto nel capitolo dedicato.
Il paper dichiara quattro novità rispetto alla prima versione: un orizzonte di interazione illimitato senza perdita di qualità, una variante distillata che gira in tempo reale, un vocabolario di azioni più ricco (combattere, tirare con l’arco, lanciare incantesimi, sparare) con più eventi guidati dal testo, e l’impalcatura di agenti. Il modello principale ha 14 miliardi di parametri; l’abstract annuncia anche una versione leggera da 1,3 miliardi che si può mettere in servizio su una sola GPU.
Come è costruito
La formulazione è quella di ogni generatore causale: ogni stato visivo $x_t$ dipende solo dagli stati passati e dagli input dell’utente fino a quel momento,
$$p_\theta(x_{1:T} \mid a_{1:T}) = \prod_{t} p_\theta(x_t \mid x_{\lt t}, a_{\le t}),$$
dove gli input $a_t$ sono di due tipi. Il primo è la posa della telecamera (posizione e orientamento), codificata con gli embedding di Plücker, che descrivono il raggio visivo di ogni pixel con sei coordinate, e iniettata nella rete con una normalizzazione adattiva. Il secondo è il testo: ogni blocco di video ha la sua didascalia, e una maschera di attenzione triangolare impedisce a un blocco di leggere le didascalie di quelli successivi. Così si può cambiare comando a metà sessione, «ora nevica», senza che il modello lo sappia prima.
Per addestrarlo serviva un dataset annotato blocco per blocco, e il paper dedica ai dati un’intera sezione. Le fonti sono tre: video in prima persona raccolti dal gruppo, video sintetici da giochi e ambienti Unreal Engine (portano segnali di azione allineati nel tempo, come saltare, attaccare, guidare o volare, difficili da ricavare dai video presi in rete) e video dal web. Dopo filtri tecnici e una classificazione con un modello linguistico-visivo, l’annotazione separa cinque tracce (chi è visibile, come si muove, con che cosa interagisce, che cosa cambia nell’ambiente, che cosa resta fermo) invece di schiacciarle in una frase sola.
La scelta tecnica più caratteristica si chiama MoBA, Mixture of Bidirectional and Autoregressive. Un modello causale si addestra di solito con il teacher forcing: ogni fotogramma rumoroso guarda soltanto sé stesso e i fotogrammi puliti che lo precedono. Gli autori osservano che, più il contesto si allunga, più il modello impara ad appoggiarsi al contesto invece di prevedere davvero il futuro, e la qualità visiva cala. MoBA aggiunge alla maschera un blocco in cui l’attenzione è completa, in entrambe le direzioni, accompagnato da una didascalia globale: fa da regolarizzatore e aiuta il passaggio da un generatore bidirezionale, che vede tutto il video insieme, a uno che procede in avanti. L’obiettivo di addestramento è il flow matching condizionato.
Dal maestro lento all’allievo veloce
Il modello preaddestrato è di qualità ma lento: servono molti passi di denoising per ogni fotogramma. La seconda fase lo comprime in un generatore a pochi passi, combinando due tecniche note. La consistency distillation insegna all’allievo a saltare direttamente al risultato che il maestro raggiungerebbe con tutti i passi. La distribution matching distillation (DMD) corregge la qualità, e qui c’è il dettaglio che conta: gli autori la applicano su lunghe sequenze generate dall’allievo stesso, non solo su stati costruiti dal contesto vero dei dati, come nel teacher forcing. L’allievo impara così sugli errori che produrrà davvero quando nessuno lo tiene per mano. Il merito della tenuta sulle lunghe durate il paper lo divide fra questo passaggio e il preaddestramento causale, a cui l’abstract attribuisce l’orizzonte illimitato.
Come un modello di diffusione da decine di passi diventa un generatore da uno o pochi passi, con consistency model e distribution matching messi a confronto: lo spiega il capitolo sui generatori veloci.
Il resto è ingegneria di servizio: kernel ottimizzati, parallelismo su più GPU, decodifica su processi dedicati, streaming progressivo, una cache che tiene solo la storia utile al comando corrente. Dopo la decodifica, un raffinatore leggero compilato con TensorRT fa due cose: aumenta la risoluzione dei fotogrammi e ne sintetizza di intermedi per alzare la frequenza. È un dettaglio da tenere a mente quando si legge «720p a 60 fotogrammi al secondo».
Il regista e il pilota
La parte che dà il tono al paper è l’impalcatura di agenti, costruita con un’analogia esplicita agli assistenti di programmazione: un modello forte diventa un lavoratore utile solo dentro un harness che gli permette di osservare, agire e perseguire un obiettivo. Qui un modello linguistico-visivo fa da regista: guarda la scena, ragiona sulle conseguenze delle azioni e formula «proposte di evento». Il generatore video fa da pilota: traduce quelle proposte in video fisicamente coerente.
Le modalità sono due. Nella prima l’utente agisce sul mondo, e il regista prevede che cosa ne consegue; per le interazioni con oggetti precisi, come aprire una porta o girare un pallone fra le mani, un modello di segmentazione della famiglia SAM segue l’oggetto da un blocco all’altro. Nella seconda l’utente interviene come autore: fa scendere la notte, chiama una tempesta di neve, fa comparire uno stormo di uccelli, e per le entità nuove il regista sceglie dove e quando è plausibile che entrino. Nell’interfaccia tutto diventa tastiera, come mostra la figura.
Una nota di lettura: abstract e introduzione descrivono i ruoli in un altro modo, con un pilota che pianifica il comportamento del personaggio e un regista che aggiunge elementi all’ambiente, due agenti distinti. La sezione tecnica sull’impalcatura e la sua figura dicono invece che il regista è il modello linguistico-visivo e il pilota è il generatore video. Qui si è seguita la sezione tecnica.
Che cosa mostra, e che cosa no
I risultati sono di tre tipi. Il primo è una sessione ininterrotta di un’ora, raccontata con venti fotogrammi, uno per ciascuno dei venti scenari attraversati, da un canale fra i bambù a una vista sulla Terra. Secondo gli autori la qualità non mostra un degrado percepibile, e questo proverebbe che la stabilità è strutturale e non il caso fortunato di una clip ben scelta. Il secondo è un confronto visivo fino a 60 secondi con Genie 3, HappyOyster, la prima versione di LingBot-World, Matrix-Game 3.0, DreamX-World, HY-World 1.5 e SANA-WM, su due prompt: un personaggio su una moto d’acqua e due mani con un estintore in una stanza bruciata; un confronto dello stesso tipo mette il modello preaddestrato accanto a HY-World 1.5 e MAGI-1. Il terzo è una tabella di caratteristiche su sei sistemi in cui LingBot-World 2.0 è l’unico con durata «ore (infinita)» e interazione semantica «infinita»: gli altri si fermano ai «minuti», e tutti risultano in tempo reale.
Il paper non contiene una sola metrica misurata. Non ci sono punteggi di qualità video, non ci sono benchmark per world model, non c’è uno studio con utenti, anche se la sezione dei risultati evoca «numeri aggregati di benchmark». L’affermazione che il modello «eguaglia o supera la qualità visiva dei sistemi chiusi più forti» poggia su fotogrammi affiancati scelti dagli autori, e la tabella di caratteristiche è compilata dagli autori stessi, con voci come «infinita» che non si possono verificare. L’ora di stabilità è una sessione sola, giudicata a occhio.
Il tempo reale non ha una macchina. Il paper descrive parallelismo su più GPU, decodifica su processi dedicati e un raffinatore che alza risoluzione e frequenza dopo la generazione, ma non dice su quante GPU e quali giri il sistema, quanti passi usi l’allievo, a che risoluzione e frequenza lavori il generatore prima del raffinatore, né la latenza fra il tasto premuto e il fotogramma che risponde. Per confronto, ABot-World-0 di Alibaba, uscito due settimane dopo, dichiara fino a 16 fotogrammi al secondo in 720p e 1,2 secondi dal tasto al primo fotogramma su una sola RTX 5090: numeri più modesti ma legati a un hardware preciso. Anche la variante da 1,3 miliardi «su una sola GPU» e la modalità a più giocatori compaiono nell’abstract e non vengono più descritte.
I limiti dichiarati sono seri. Il primo è la memoria: il mondo resta stabile nell’aspetto ma non nell’identità, e una zona che esce dal contesto e viene rivisitata viene rigenerata invece che ricordata. Il secondo è la coerenza di personaggi e stile, che su sessioni molto lunghe cambiano piano piano. Il terzo è la fisica: il modello impara solo dai pixel, senza nozione di geometria o di collisione, e capita che oggetti e personaggi si compenetrino. Il quarto è il costo, che resta lontano dall’hardware di tutti i giorni.
Perché conta adesso
I world model interattivi, in questi mesi, si sono misurati su due assi: quanto dura il mondo e quanto in fretta risponde. LingBot-World 2.0 ne aggiunge un terzo: chi decide che cosa succede. Mettere un modello linguistico-visivo a proporre gli eventi e un generatore a disegnarli è la stessa mossa che ha trasformato i modelli di linguaggio in agenti, portata dentro un mondo che si inventa mentre lo si attraversa. Resta un rapporto tecnico che chiede molta fiducia e dà pochi strumenti per verificarla. Ma se pesi, codice e harness sono pubblici, come gli autori dichiarano, la verifica si sposta dove deve stare: a chi li scarica e prova a restare in quel mondo per un’ora.

I commenti sono riservati agli iscritti.
Accedi per commentare