Sui set cinematografici c’è una figura che il pubblico non vede mai: la segretaria di edizione. Il suo mestiere è ricordare. Se nella prima ripresa il bicchiere era mezzo pieno e la sedia girata a sinistra, tre giorni dopo, quando si rigira la scena dall’altro lato, il bicchiere deve essere mezzo pieno e la sedia girata a sinistra. Non ricostruisce il set in scala: tiene un quaderno di fotografie, e quando il regista annuncia l’inquadratura successiva va a cercare quelle che coprono meglio quell’angolo.
Ai world model video manca proprio questa figura. Sono i modelli che generano un mondo fotogramma dopo fotogramma mentre l’utente lo esplora con la tastiera, e sono diventati in un anno uno dei fronti più affollati della visione artificiale. Il loro difetto più noto è la smemoratezza: si entra in una piazza, si gira la testa, si torna a guardare, e la fontana ha cambiato forma. WorldCrafter: Consistent Video World Model with Implicit 3D-aware Memory, uscito su arXiv il 21 settembre 2026 (2609.24984), prova a dare al generatore una segretaria di edizione. Lo firmano undici autori di ARC Lab (Tencent IEG) e dell’Università di Pechino, con Wangbo Yu e Kunhao Liu primi autori a pari merito e Ying Shan in chiusura.
Che cosa si intende per world model, perché un video generato interattivo è una forma di simulatore e dove passa il confine con il dibattito su che cosa questi modelli capiscano davvero: il libro ci dedica un capitolo.
Tre modi di ricordare, tre modi di sbagliare
Il paper divide le soluzioni esistenti in tre famiglie. La prima è la memoria di contesto: si rimettono nell’attenzione del generatore i fotogrammi già prodotti. Tenerli tutti costa troppo; sceglierne pochi, quelli con l’inquadratura più simile a quella richiesta, riduce la copertura e rende il risultato fragile a una scelta sbagliata. La seconda è la memoria spaziale: si stima la profondità, si proiettano i vecchi fotogrammi nel punto di vista nuovo e li si passa al modello come guida. Funziona finché la geometria stimata è giusta e la scena sta ferma; con oggetti che si muovono, l’allineamento rigido diventa una gabbia. La terza è la memoria implicita: comprimere la storia in una rappresentazione appresa. Le versioni recenti usano le feature di stimatori geometrici come VGGT, ma secondo gli autori quei modelli sono addestrati a indovinare la forma della scena, non il suo aspetto, e per ritrovare la stessa fontana serve anche il colore della pietra.
Una memoria presa in prestito, interrogata con le pose
La scommessa di WorldCrafter sta nella scelta del codificatore. Invece di un modello geometrico, gli autori partono da LagerNVS, un modello di novel view synthesis: uno che, date alcune immagini di una scena, deve produrne una da un punto di vista mai visto. Per riuscirci deve conservare insieme geometria e aspetto, ed è esattamente ciò che serve a una memoria. Ne tengono l’encoder, tolgono i primi strati che lavorano sui pixel e li sostituiscono con uno strato che legge direttamente i latenti del VAE video: la memoria non torna mai nello spazio delle immagini.
Il funzionamento ha tre tempi. Scrittura: l’encoder $\Phi$ prende i fotogrammi latenti della storia $z_h$ con le loro pose $C_h$ e ne ricava una rappresentazione $R = \Phi(z_h, C_h)$, senza mai costruire una nuvola di punti esplicita. Poiché $R$ cresce linearmente con i fotogrammi in ingresso, l’input è limitato a nove: l’ultimo generato più otto scelti fra tutti quelli dell’archivio. La selezione è golosa e mira alla massima copertura: non gli otto fotogrammi più simili alla traiettoria in arrivo, ma quelli che insieme ne coprono di più la regione inquadrata. Lettura: un modulo di readout interroga la rappresentazione con un insieme di dimensione fissa di pose $C_q$ campionate dalla traiettoria che l’utente sta per percorrere,
$$M = \mathrm{Readout}\big(\Phi(z_s, C_s),\, C_q\big),$$
e restituisce un numero fisso di token, pari a quelli di quattro fotogrammi interi, qualunque sia la lunghezza della storia. Condizionamento: il Diffusion Transformer denoisa il blocco corrente vedendo in una sola sequenza $[M; z_r; z_t]$, cioè la memoria, i fotogrammi recenti e il blocco rumoroso. La memoria porta la scena già vista, il contesto recente porta il movimento in corso. Il blocco generato finisce nell’archivio e il giro ricomincia.
Due dettagli distinguono il progetto dai concorrenti. Il primo: encoder, readout e generatore sono addestrati insieme nell’ultima fase, così la memoria impara a parlare la lingua dei token del generatore invece di restare quella del modello da cui è nata. Il secondo: la lettura guidata dalle pose. La variante senza pose lascia al generatore il compito di capire che cosa gli serve; quella con le pose spende il budget fisso di token solo su ciò che la camera sta per inquadrare. È la segretaria di edizione che non porta tutto il quaderno, ma le pagine dell’angolo che si sta per girare.
Il generatore di partenza è un Diffusion Transformer addestrato con il flow matching, a blocchi autoregressivi. Come un transformer denoisa un video diviso in patch, e perché il flow matching ne ha preso il posto accanto alla diffusione classica, è spiegato nel libro.
Il resto è ingegneria dichiarata. La base è Helios-base, un generatore video a blocchi a cui gli autori tolgono il segmento compresso di sedici fotogrammi di storia per far posto ai token di memoria; la camera entra attraverso un ramo di attenzione dedicato. L’addestramento procede in quattro fasi, la prima su 760.000 video del dataset Open-Sora Plan, con l’aggiunta di DL3DV e di video sintetici del dataset MIND per insegnare i soggetti in movimento. Le pose della camera di tutti i video sono stimate con Depth Anything 3, le didascalie scritte da Qwen2.5-VL. Per l’uso interattivo c’è una versione distillata, WorldCrafter-fast: tre risoluzioni a piramide con due passi di denoising ciascuna, e due modelli distinti, uno per i passi rumorosi e uno per l’ultimo, per non pagare in texture sbavate ciò che i dati sintetici danno in fedeltà ai soggetti. Il risultato dichiarato è 16 fotogrammi al secondo su una macchina a quattro GPU.
I numeri
Il banco di prova l’hanno costruito gli autori: 145 immagini iniziali (83 scene dinamiche con un soggetto, 62 statiche), ciascuna con cinque traiettorie di camera fra 528 e 1.648 fotogrammi che ritornano su luoghi già visti. Fanno 725 video per metodo, confrontati con otto world model recenti, fra cui Lyra 2.0, HY-WorldPlay, Matrix-Game 3.5 e SANA-WM. La memoria si misura confrontando il fotogramma del ritorno con quello della prima visita.
Il vantaggio è netto. Su LPIPS, la distanza percettiva fra le due immagini, WorldCrafter scende a 0,255 contro 0,487 del miglior concorrente, Lyra 2.0: è il 47,6% di miglioramento che il paper mette nell’abstract. Il PSNR sale da 14,05 a 18,02 dB. Curiosamente la versione distillata fa ancora meglio, 0,186 di LPIPS e 20,87 dB, e il paper registra il dato senza spiegarlo. Sul controllo della camera il modello pieno ha l’errore di rotazione più basso (13,5 contro 16,1 di Lyra 2.0), mentre quello distillato scende al terzo posto. Sulla qualità visiva, misurata con VBench, il punteggio complessivo è il più alto ma di poco: 81,91 contro 81,41 di Alaya-EVOKE.
Le ablazioni sono la parte più convincente, perché cambiano una scelta alla volta a parità di budget di token. Sostituire la memoria implicita con quattro fotogrammi recuperati riporta LPIPS al livello dei concorrenti e quasi raddoppia l’errore di rotazione. Congelare l’encoder invece di addestrarlo insieme al generatore, leggere senza pose, scegliere i fotogrammi per somiglianza invece che per copertura: ogni pezzo conta, e il più importante è la memoria stessa. Il grafico sull’intervallo fra visita e ritorno mostra che il vantaggio sulla memoria di contesto si allarga quanto più tempo passa.
| Variante | LPIPS |
|---|---|
| WorldCrafter completo | 0,255 |
| Memoria di contesto, quattro fotogrammi recuperati | 0,497 errore di rotazione 26,5 |
| Encoder congelato | 0,305 |
| Lettura senza pose | 0,333 |
| Fotogrammi scelti per somiglianza, non per copertura | 0,296 |
Anche il costo è a favore. Stimare la profondità e proiettare i fotogrammi, come fanno le memorie spaziali, richiede 1,346 secondi per blocco; codificare e leggere la memoria di WorldCrafter 0,062, circa 21,7 volte meno. Sono tempi misurati dagli autori sul solo trattamento della memoria, esclusi denoising e decodifica.
Che cosa non dice
Il banco di prova è degli autori. Immagini, traiettorie e protocollo li hanno scelti loro, e i concorrenti sono valutati in configurazioni diverse (alcuni al numero pieno di passi, altri distillati). Sono scelte dichiarate, ma finché nessuno rifà le misure i numeri restano quelli di chi ha costruito il modello.
Più coerente, forse anche più fermo. Nella voce di VBench che misura quanto si muove la scena, il dynamic degree, le due versioni di WorldCrafter sono le ultime: 96,9 la piena e 96,5 la distillata, contro valori fra 97,1 e 100 degli altri otto. Il paper non commenta. Un mondo che si muove un po’ meno è anche più facile da ritrovare uguale, e sarebbe utile sapere quanta parte del guadagno di memoria dipende da questo: è un’ipotesi nostra, non un risultato.
I limiti dichiarati. Gli autori scrivono che la coerenza può ancora cedere su traiettorie particolarmente complesse o lunghe, e che ricodificare la storia a ogni blocco aggiunge latenza; propongono come passo successivo un encoder che aggiorni la memoria in modo incrementale. I 16 fotogrammi al secondo sono dichiarati senza dire quali GPU, e il paper rimanda a una pagina di progetto senza annunciare pesi o codice.
Perché conta adesso
Da Genie 3 in poi, buona parte della gara fra i world model video si è misurata in durata: quanti minuti prima che il mondo si sfaldi. WorldCrafter sposta l’attenzione su una domanda più esigente, quella della segretaria di edizione: se torni nello stesso punto, trovi la stessa cosa? E ci risponde con una scelta che ha una logica riconoscibile, cioè cercare la memoria nei modelli che già sanno immaginare una scena da un altro punto di vista, invece di costruirle sopra una geometria esplicita che con i soggetti in movimento si rompe. Se l’idea regge fuori dal banco di prova dei suoi autori, i world model potrebbero smettere di essere splendidi sogni lucidi e diventare luoghi in cui si può tornare.

I commenti sono riservati agli iscritti.
Accedi per commentare