Nell’improvvisazione teatrale c’è una regola che tutti imparano presto: si accetta quello che il compagno ha appena detto e ci si costruisce sopra. Funziona per dieci minuti. Dopo un’ora, se nessuno tiene il filo, la scena si è riempita di dettagli contraddittori, i personaggi hanno cambiato nome e la stanza da cui si era partiti non esiste più. Ogni battuta era plausibile; è la somma a non reggere.
È il problema di ogni modello che genera video un pezzo alla volta, e diventa centrale quando il video deve rispondere ai comandi di chi guarda. ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU, uscito su arXiv il 21 luglio 2026 (2607.19191), è un technical report di 33 pagine firmato dall’ABot-World Team dell’AMAP CV Lab, il gruppo di visione artificiale della divisione mappe di Alibaba. Descrive un world model video da 5 miliardi di parametri che si comanda con otto tasti, gira in streaming su una sola scheda da gioco e, secondo gli autori, regge rollout di ore senza collassare. Il codice è su GitHub.
Quattro problemi legati fra loro
Un world model interattivo, in questo senso, è un generatore video che a ogni passo riceve un’azione dell’utente e produce ciò che quell’azione vedrebbe: si preme W e la camera avanza, si preme J e ruota. Genie 3 di Google DeepMind ha mostrato che si può fare in tempo reale. La tesi degli autori è che ingrandire il modello video non basta, perché i colli di bottiglia sono quattro e si tengono l’un l’altro: dati in cui immagini e comandi siano sincronizzati, comandi che valgano sia per una camera sia per un personaggio in terza persona, un video generato che, riusato come contesto, non derivi, e tutto abbastanza veloce per hardware che si possa avere in casa.
Che cosa vuol dire «simulare il mondo» con un generatore video, da Genie in poi, e perché non tutti sono d’accordo che basti: il capitolo sui world model.
I dati: videogiochi, simulatori e video del web
La prima scelta è mescolare tre fonti, ciascuna con un difetto diverso. I videogiochi AAA danno i comandi esatti, letti dall’API del gioco fotogramma per fotogramma, ma uno stile visivo ristretto. I simulatori danno geometria precisa e controllo totale: Unreal Engine e un motore di Gaussian Splatting, ABot-3DGS, che ricostruisce strade e interni dalle riprese aeree e stradali proprietarie di AMAP. Il video di internet porta luce vera e movimenti naturali, ma nessun comando: le azioni si ricavano stimando la posa della camera, proiettando gli spostamenti sugli assi della camera e binarizzandoli con una soglia, con il rumore che ne consegue.
Per giochi e simulatori la raccolta la fa un agente, WorldExplorer, che naviga da solo cercando per prime le zone inesplorate e registra video, camera e comandi con un errore di allineamento sotto i 33 millisecondi. La parte interessante è il ciclo: la valutazione del modello indica dove è debole, e la raccolta successiva si sposta lì; quanto renda, il report non lo misura. In mezzo ci sono 14 controlli deterministici su sei dimensioni di qualità e un modello visione-linguaggio, che scarta interfacce sovrapposte e schermate di caricamento; morti del personaggio e filmati di intermezzo si tagliano leggendo lo stato del gioco.
Otto tasti, sommati ai pixel
Il controllo è volutamente povero. Ogni fotogramma ha un vettore di otto bit: W, A, S, D per muoversi, I, J, K, L per ruotare la camera. Niente pose calibrate in un riferimento globale, che su rollout lunghi finirebbero fuori dalla distribuzione vista in addestramento. Siccome il codificatore video comprime il tempo di un fattore 4, le azioni di quattro fotogrammi consecutivi vengono impacchettate in un unico gettone da 32 bit:
$$\tilde a_\tau = \mathrm{Concat}(a_{4\tau-3}, a_{4\tau-2}, a_{4\tau-1}, a_{4\tau}) \in \{0,1\}^{32}.$$
Un adattatore convoluzionale porta questi gettoni alla stessa risoluzione spaziale dei token del trasformatore, e lì vengono sommati: $\hat z = \mathrm{PatchEmbed}(z) + F_\psi(\tilde a)$. Nessun meccanismo di attenzione dedicato. Per segnali espliciti come i tasti, sostengono gli autori senza un confronto che lo misuri, basta e disturba poco ciò che il modello di partenza, Wan2.2 affinato su tutti i parametri, sa già del mondo visivo.
Per la terza persona c’è un’aggiunta: alcune immagini canoniche del personaggio (fronte, retro, due lati, più un ritratto frontale ricostruito) vengono codificate e messe in testa alla sequenza con posizioni temporali negative. I token del video possono guardarle, loro non guardano il video. Serve a evitare che, a rollout inoltrato, il protagonista abbia cambiato giacca.
Dal maestro lento allo studente che va in diretta
Prima si costruisce un maestro bidirezionale: genera un intero clip in un colpo solo, con ogni fotogramma che vede tutti gli altri, passato e futuro. È di buona qualità e inutilizzabile in diretta, perché non si può mostrare il fotogramma 10 finché non si è finito il 100. Lo studente invece deve essere causale, cioè modellare solo il pezzo successivo di $L$ fotogrammi dato quello che è già stato mostrato e i tasti premuti:
$$p_\theta\big(v_{t:t+L-1} \mid v_{0:t-1},\, a_{t:t+L-1},\, c\big),$$
dove $c$ raccoglie testo e immagini di riferimento. Il passaggio avviene in tre fasi. Nel teacher forcing lo studente parte dai pesi del maestro e impara a generare con una maschera causale, avendo come passato i fotogrammi veri. Nella distillazione ODE impara a saltare direttamente al risultato pulito che il modello della fase precedente otterrebbe con molti passi di denoising, così da bastarne pochi.
Come un modello di diffusione da decine di passi diventa uno che ne usa pochi, dalla distillazione della traiettoria ODE al distribution matching: il capitolo sui modelli di diffusione.
La terza fase è il contributo di metodo del report, LongForcing. Il difetto delle prime due è quello dell’improvvisazione: in addestramento lo studente vede un passato perfetto, in uso vede il proprio, con i suoi piccoli errori, e più il rollout si allunga più finisce in situazioni mai incontrate. Metodi come Self-Forcing già addestrano lo studente sui propri rollout; LongForcing aggiunge un maestro con un orizzonte più lungo, che nella fase finale di distribution matching (DMD) giudica tratti di rollout più avanzati, dove l’errore ha avuto più tempo per accumularsi. Non si chiede di riprodurre una traiettoria, ma di restare, anche tardi, dentro ciò che il maestro considera plausibile.
Il tempo reale è un problema di sistema
Pochi passi di denoising non bastano per andare in diretta, e la tabella dei tempi lo mostra. Su una RTX 5090, a 1280×704 e batch 1, il modello di base non entra in memoria. Nemmeno con un’attenzione a bassa precisione, SageAttention2. La prima configurazione che gira è quella con LightVAE, un decodificatore video potato e semplificato. Da lì si aggiungono la quantizzazione in FP8 dei livelli lineari del trasformatore e Fast-RoPE, che riancora le posizioni temporali dentro la finestra locale: la velocità sale, ma con Fast-RoPE il picco di memoria risale. I «16 fps» dell’abstract sono la configurazione più aggressiva, con i livelli lineari in MXFP4. La configurazione predefinita, «orientata alla qualità», resta l’FP8.
| Configurazione | Fotogrammi al secondo | Picco di memoria |
|---|---|---|
| Con LightVAE | 9,1 | 20,5 GiB |
| Più livelli lineari in FP8 | 12,4 | 15,9 GiB |
| Più Fast-RoPE | 13,3 | 19,3 GiB |
| Livelli lineari in MXFP4, la più aggressiva | 15,8 | 17,1 GiB |
Ogni blocco genera 3 fotogrammi latenti, cioè 12 fotogrammi decodificati, e prima di mostrarne uno va decodificato tutto il blocco. Da qui la latenza dichiarata: 1,2 secondi fra la pressione del tasto e il primo fotogramma che ne tiene conto. Una cache delle chiavi e dei valori limitata a un contesto locale impedisce che la memoria cresca con la durata del rollout.
I numeri
Il confronto è su WorldRoamBench, un benchmark per world model interattivi, contro Genie 3, HappyOyster, LingBot-World (14 miliardi di parametri) e HY-World 1.5 (8,3 miliardi). ABot-World-0 non è primo su nessuna voce, e il quadro è più interessante così. HappyOyster è primo su cinque delle sette voci riportate, Genie 3 sulle altre due. ABot-World-0 è secondo sull’accuratezza dell’azione, sulla traiettoria, sull’estetica e sulla qualità d’immagine; terzo sulla meccanica fisica e sulla memoria, dove con 0,5041 resta lontano da Genie 3 (0,6073) e HappyOyster (0,6309). Distanzia invece di molto i due concorrenti di dimensione dichiarata, entrambi più grandi, che su tutte le voci stanno sotto 0,42.
| Voce | ABot-World-0 | Il primo |
|---|---|---|
| Accuratezza dell’azione, stretta | 0,5266 | 0,5317 |
| Accuratezza dell’azione, parziale | 0,7290 | 0,7631 |
| Traiettoria | 0,6752 | 0,7737 |
LongForcing viene misurato a parte, su rollout di 60 secondi, contro una baseline in stile Causal Forcing adattata dagli autori e addestrata allo stesso modo salvo l’orizzonte del maestro. Nella seconda metà del rollout la baseline perde punteggio estetico (HPSv3) e accumula saturazione, sfocatura e texture ripetute; LongForcing resta più alto sul primo e più basso sugli altri tre. Le curve sono solo in un grafico, senza la dimensione dell’insieme di valutazione.
Il resto è qualitativo: cinque rollout da un’ora e quattro da 24 ore, mostrati come fotogrammi campionati, più effetti fisici emergenti come orme che restano nella neve o un muro che ferma la camera.
Che cosa resta da verificare
Il benchmark è di casa. WorldRoamBench è un lavoro del 2026 e dieci dei suoi quindici autori compaiono fra i contributori di questo report, compreso l’intero Benchmark Team; HappyOyster, il sistema che vince, è un prodotto di Alibaba Cloud. Non è un motivo per diffidare dei numeri, ma per aspettare valutazioni esterne. Il report non spiega come siano stati ottenuti i video di Genie 3 e HappyOyster, e riporta «sotto-dimensioni selezionate» del benchmark, non tutte.
Mancano i numeri di base. Non si sa quante ore di video compongano il corpus, quanta potenza di calcolo sia servita, quanti passi di denoising usi lo studente, né quanto sia lungo l’orizzonte di addestramento che i rollout da 60 secondi dovrebbero superare. Parte dei dati di simulazione viene da riprese proprietarie.
Ore e giorni sono una promessa qualitativa. I rollout da 24 ore sono pochi fotogrammi campionati, e gli autori scrivono con prudenza di assenza di collasso «osservabile ai momenti valutati». L’unica misura della deriva si ferma a un minuto.
Il tempo reale ha un prezzo. 1,2 secondi fra tasto e risposta sono tanti per chi viene dai videogiochi, e i 16 fps valgono con la quantizzazione più spinta, di cui il report non misura l’effetto sulla qualità; né dice con quale configurazione siano stati prodotti i video del benchmark.
Perché conta adesso
ABot-World-0 non è il sistema migliore della sua tabella, ma sposta la domanda su un mondo generato in cui muoversi con la tastiera: non più se si possa fare, ma su quale macchina. E la risposta, più onesta nella tabella dei tempi che nel titolo, è che il collo di bottiglia è anche tutto ciò che sta intorno al modello. Per chi vuole addestrare agenti in mondi simulati è un punto di partenza concreto: un improvvisatore che dichiara di tenere il filo per ore, a patto di concedergli un secondo per pensare.

I commenti sono riservati agli iscritti.
Accedi per commentare