Un apprendista pittore copia un maestro, e il maestro ha un solo modo di giudicarlo: guarda ogni tela e dice se avrebbe potuto dipingerla lui. Non gli chiede mai di vedere tutto il suo repertorio. In poco tempo l’apprendista capisce il trucco: i tramonti accesi, con quei rossi pieni, il maestro li approva sempre. Smette di dipingere nebbie, interni, mattine grigie. Nessuna tela è sbagliata, ma tutte si somigliano, e tutte hanno il colore un po’ troppo alto.
È, con qualche semplificazione, il difetto che affronta Mask Forcing: Improving Autoregressive Video Diffusion Distillation via Dual-Noise Masking Rollout, uscito su arXiv l’8 settembre 2026 (2609.09123). Lo firmano dieci autori di HKUST (sedi di Hong Kong e Guangzhou), Lightspeed, UC San Diego, CUHK Shenzhen e National University of Singapore, con la firma di Zhuoran Zhao in testa e quella di Anyi Rao in chiusura. La proposta è piccola, un cambiamento nel modo in cui si prepara l’input durante l’addestramento. Il bersaglio è preciso: l’aspetto sovrasaturo e troppo liscio dei video generati in tempo reale.
Da dove viene il difetto
I modelli video più noti generano una clip intera in un colpo, guardando avanti e indietro nel tempo, con molti passi di pulizia dal rumore. Per la diretta (un mondo interattivo, una telecamera che segue i comandi, un video che non finisce) serve altro: un modello autoregressivo che produca il video a blocchi, uno dopo l’altro, ciascuno condizionato solo su quelli già usciti, e in pochissimi passi. È la strada di Self Forcing, Causal Forcing e LongLive, i tre metodi su cui il paper lavora, ed è la stessa famiglia di tecniche che abbiamo visto all’opera in Vidu S1.
La ricetta comune è la Distribution Matching Distillation (DMD). Un modello grande e lento, l’insegnante, fa da giudice. Lo studente, piccolo e causale, genera un video intero sulle proprie uscite precedenti, come farà in esercizio: è il self-rollout. Poi la DMD lo corregge confrontando due funzioni score, quella stimata sull’insegnante e quella stimata sulla distribuzione dello studente. L’obiettivo che ne risulta è una divergenza di Kullback-Leibler inversa, $D_{\mathrm{KL}}(p_{\text{fake}} \,\|\, p_{\text{real}})$, e il suo carattere è quello del maestro della parabola: punisce lo studente quando produce cose che l’insegnante non produrrebbe, ma non quando ignora intere regioni del repertorio dell’insegnante. Il risultato è il cosiddetto mode seeking: lo studente si accomoda su poche soluzioni sicure.
Come si comprime un modello di diffusione da decine di passi a uno o pochi, e che cosa fa esattamente la distillazione per corrispondenza di distribuzioni: è spiegato nel capitolo sui generatori a un passo.
Gli autori aggiungono una seconda causa. La DMD giudica solo il video finito: le previsioni intermedie dei quattro passi di pulizia non ricevono alcun segnale diretto, eppure vengono riusate dal passo successivo e, a blocco concluso, diventano il contesto dei blocchi che seguono. Un errore piccolo all’inizio viaggia lungo tutto il video.
Le soluzioni proposte finora aggiungono qualcosa: dati video reali da selezionare e curare (DMD2, DFD), un secondo addestramento con rinforzo e modelli di ricompensa (Astrolabe), oppure un obiettivo di coerenza da bilanciare con la DMD (rCM, DistillAlign). Mask Forcing lascia intatto l’obiettivo e non aggiunge dati. Cambia solo la traiettoria che lo studente percorre mentre impara.
Due livelli di rumore nello stesso input
A ogni passo del rollout lo studente riceve un blocco rumoroso a un certo livello $t_j$, ne stima la versione pulita, e quella stima viene riportata al livello di rumore del passo successivo. Mask Forcing interviene proprio qui. Oltre al livello previsto $t_j$ estrae un secondo livello, più basso, dentro una finestra:
$$t’_k \sim \mathcal{U}\!\left[\max\!\left(t_{\min},\, t_j – \tfrac{\Delta}{N_t}\right),\; t_j\right],$$
dove $\Delta$ è l’ampiezza della finestra misurata sui $N_t = 1000$ livelli di addestramento, e $t_{\min}$ è un pavimento che impedisce all’aggiunta di essere quasi del tutto pulita. La stessa stima viene sporcata due volte, con lo stesso rumore ma ai due livelli, e una maschera binaria casuale $M_i$ sceglie, posizione per posizione, quale delle due versioni tenere:
$$x^{\text{mix}}_i = M_i \odot x^{t’_k}_i + (1 – M_i) \odot x^{t_j}_i.$$
Il dettaglio decisivo è che al modello si continua a dire che il livello è $t_j$. Lo studente riceve un input in cui un quinto dei punti (la frazione di maschera $\alpha = 0{,}2$) è più nitido di quanto dichiarato, e deve cavarsela. All’inferenza non cambia niente: niente maschere, stesso numero di passi, stesso costo.
La perturbazione, dicono gli autori, fa due cose. La prima riguarda il mode seeking: con maschere e livelli sempre diversi lo studente non percorre più la stessa strada verso la stessa soluzione, i video su cui la DMD lo giudica sono più vari, e l’insegnante può così dare indicazioni anche su regioni che lo studente da solo non avrebbe mai visitato. La seconda riguarda l’accumulo di errori: i punti più puliti fanno da appiglio per ricostruire quelli più sporchi, la stessa intuizione delle tecniche di mascheramento come MAE o, più di recente, Self-Flow, e le previsioni intermedie migliorano.
Sulla prima tesi il paper offre un argomento formale. Se si considera la distribuzione dello studente come una miscela sulle possibili traiettorie di maschere $V$, la divergenza della miscela dall’insegnante è uguale alla media delle divergenze delle singole traiettorie meno l’informazione mutua fra traiettoria e uscita, $I_\theta(V; X_\tau \mid c)$. Ogni traiettoria può restare concentrata su una gobba, purché gobbe diverse per traiettorie diverse: nell’insieme la miscela ne copre più di una. Maschere troppo timide producono uscite simili fra loro e un’informazione mutua piccola; maschere troppo aggressive allontanano lo studente dall’insegnante. Da qui la scelta di non esagerare.
I numeri
Lo studente è Wan2.1-T2V da 1,3 miliardi di parametri, l’insegnante la versione da 14 miliardi dello stesso modello; i video sono di 81 fotogrammi a 832×480. Mask Forcing si applica dentro la fase di addestramento DMD, che secondo il paper dura circa 1.500 passi e 14 ore su 8 GPU (il tipo non è indicato). Le metriche principali sono HPSv3 e VisionReward, due modelli addestrati a imitare le preferenze umane, più il Dynamic Degree, che misura quanto si muove la scena, e i punteggi di VBench.
Nella configurazione a blocchi HPSv3 sale su tutti e tre i metodi; il punteggio totale di VBench cresce anch’esso, ma di poco. HPSv3 migliora anche sui video lunghi generati con LongLive. Nella configurazione fotogramma per fotogramma i miglioramenti ci sono ovunque. Le curve di addestramento del paper mostrano inoltre una convergenza più rapida verso i video dell’insegnante.
| Metodo di partenza | Senza | Con Mask Forcing |
|---|---|---|
| HPSv3, configurazione a blocchi | ||
| Self Forcing | 9,55 | 9,84 |
| Causal Forcing | 9,37 | 10,17 |
| LongLive | 9,11 | 10,14 |
| VBench totale, configurazione a blocchi | ||
| Self Forcing | 81,89 | 82,61 |
| Causal Forcing | 82,67 | 82,76 |
| LongLive | 82,02 | 82,75 |
| HPSv3, video lunghi da 30 secondi | ||
| LongLive | 8,44 | 9,11 |
Il test con le persone è il dato più netto. Ventiquattro valutatori, messi davanti a coppie anonime, hanno scelto più spesso il video con Mask Forcing in ogni confronto, con i pareggi contati a parte. In appendice ci sono anche due metodi che bilanciano la DMD con un obiettivo di coerenza, DistillAlign e Causal-rCM.
| Confronto | Preferenze |
|---|---|
| contro Self Forcing | 80% |
| contro Causal Forcing | 79% |
| contro LongLive | 83% |
| sui video lunghi | 72% |
| In appendice | |
| contro DistillAlign | 83% |
| contro Causal-rCM | 77% |
Che cosa resta da verificare
La qualità è misurata da altri modelli. HPSv3 e VisionReward sono giudici appresi, non occhi umani, e un metodo che toglie saturazione può piacere a un modello di preferenza per ragioni che non coincidono del tutto con il realismo. Il test con le persone va nella stessa direzione, ed è il contrappeso giusto, ma è piccolo: ventiquattro valutatori, e il paper non dice quante coppie ciascuno abbia visto né come siano stati scelti i prompt da mostrare.
Qualità e movimento si tirano la coperta. Le ablazioni, fatte su Self Forcing, lo mostrano senza giri di parole: le frazioni di maschera che alzano di più HPSv3 fanno crollare il Dynamic Degree, cioè il movimento. Il valore scelto non è il migliore per qualità, è il compromesso.
| Frazione di maschera | HPSv3 | Dynamic Degree |
|---|---|---|
| 0,1 | 10,00 | 47 |
| 0,2, il valore scelto | 9,84 | 82 |
| 0,5 | 10,17 | 44 |
E su LongLive il movimento peggiora, da 76 a 69 nei video brevi generati a blocchi e da 70 a 64 nei lunghi. Gli autori lo attribuiscono al fatto che VBench premia anche il flusso ottico prodotto dalla deriva della scena, citando un altro lavoro: è un’ipotesi, non una misura fatta qui.
La diversità cresce, ma non ovunque. Misurata con CLIP, sale su tutti e tre i metodi; misurata con DINOv3, sale su LongLive e Causal Forcing e scende di poco su Self Forcing, da 0,1704 a 0,1645. Per un metodo che si presenta come rimedio al collasso sulle mode, è il numero che meriterebbe una verifica più larga di otto video per prompt.
La teoria spiega, non dimostra. La scomposizione con l’informazione mutua è un’identità, e il suo legame con l’addestramento vero presuppone che le due funzioni score siano stimate esattamente. Dice che una miscela di traiettorie diverse può coprire più mode; non garantisce che l’addestramento reale le produca. E tutti i numeri vengono da un solo studente, Wan2.1 a 1,3 miliardi: l’appendice prova anche Wan2.2 da 5 miliardi con controllo della camera, ma solo con esempi visivi, e gli autori la chiamano una valutazione iniziale. Il paper rimanda a una pagina di progetto; il repository ufficiale (licenza Apache 2.0) contiene per ora il codice di inferenza e i pesi della configurazione a blocchi, mentre il codice di addestramento, cioè Mask Forcing vero e proprio, è annunciato ma non ancora pubblicato (verificato il 24 settembre 2026).
Perché conta adesso
Il video in tempo reale è la base dei modelli di mondo interattivi e dei giochi generati al volo, e molti passano dalla stessa strettoia: distillare un modello grande in uno che corre, e accettare in cambio quell’aria da cartolina ritoccata che chi ha visto qualche demo riconosce. Le cure proposte finora costano: dati reali da curare, una fase di addestramento in più, modelli di ricompensa da tarare. Mask Forcing non aggiunge dati, fasi né passaggi della rete: cambia il modo di preparare l’input dentro l’addestramento che la ricetta fa già, e non tocca l’inferenza. Se i numeri reggono alla prova di altri gruppi e di altri modelli, può diventare una di quelle correzioni che entrano nelle ricette senza che nessuno ne ricordi il nome. Come l’apprendista a cui il maestro, ogni tanto, passa una tela già cominciata da un’altra parte.

I commenti sono riservati agli iscritti.
Accedi per commentare