MOSS-VL, il modello che guarda mentre parla: il video in tempo reale secondo Fudan

Il gruppo OpenMOSS dell'Università Fudan pubblica una famiglia di modelli visione-linguaggio a pesi aperti costruita attorno a una capacità precisa: continuare a guardare il video mentre si risponde, e decidere da soli quando parlare. Com'è fatta, che cosa dicono i benchmark di streaming, quanto è più veloce e che cosa, per ora, si vede solo nelle demo.

Chi ha ascoltato una radiocronaca di calcio sa che il cronista non aspetta la fine dell’azione per raccontarla. Parla mentre la palla corre, e se a metà frase il pallone finisce sul palo invece che in rete si corregge al volo. Sa anche tacere: nei minuti di melina a centrocampo lascia spazio al rumore dello stadio. Un buon cronista fa tre cose insieme, guardare, parlare e scegliere il momento, e nessuna delle tre si interrompe per lasciare posto alle altre.

È questa la capacità attorno a cui è costruito MOSS-VL Technical Report, depositato su arXiv il 15 agosto 2026 (2608.15045). Lo firma l’OpenMOSS Team, con affiliazioni all’Università Fudan, allo Shanghai Innovation Institute e a MOSI Intelligence; Pengyu Wang guida il progetto, Xipeng Qiu è l’autore di riferimento. Il gruppo rilascia cinque checkpoint, il curriculum di addestramento e il codice di inferenza in tempo reale.

Che cosa non funzionava

La maggior parte dei modelli visione-linguaggio aperti capisce il video a cose fatte: riceve la clip intera, la legge dall’inizio alla fine e poi risponde. Gli autori ordinano le alternative in cinque livelli: al primo c’è il regime offline. Dal secondo al quarto c’è lo streaming, dove stanno i modelli recenti di questo filone: il video arriva di continuo e il modello risponde subito (L2), sa aspettare in silenzio finché la risposta non è determinabile (L3), tiene una domanda «residente» e torna a rispondere man mano che la scena cambia (L4).

Tutti questi, però, hanno un punto cieco: mentre scrivono la risposta non vedono i fotogrammi che intanto arrivano. Il quinto livello, quello che il paper chiama tempo reale, aggiunge proprio questo: percepire mentre si genera, in modo da poter correggere o troncare una risposta nel momento in cui la scena la smentisce.

Rispondere senza smettere di guardare video tempo streaming (L2–L4) zitto risposta tutta d’un fiato: nel frattempo non vede zona cieca MOSS-VL (L5) zitto zitto 1 2 3 1 2 un pezzo per fotogramma pezzo di risposta silenzio scelto il fotogramma entra nella memoria visiva Schema concettuale, non in scala.

Gli occhi fuori dalla frase

La scelta che rende possibile tutto il resto è architetturale, e non è nuova: è quella di Flamingo, del 2022. In molti modelli visione-linguaggio di oggi, Qwen3-VL compreso, i token dell’immagine vengono infilati nella stessa sequenza del testo. In MOSS-VL no. Il decoder, inizializzato da Qwen3-8B, ha 48 strati: 36 di self-attention che vedono solo il testo, e 12 di cross-attention con cancello, uno ogni quattro, che sono l’unica porta da cui entra la visione. I cancelli partono da zero, così all’inizio dell’addestramento il modello linguistico è intatto.

Token dell’immagine dentro la sequenza oppure cross-attention con cancello alla Flamingo: il libro mette a confronto le due strade per innestare un encoder visivo su un modello linguistico, e che cosa costa ciascuna.

Leggi «Innestare gli occhi» nel libro →

La conseguenza per il video in diretta è semplice. Quando arriva un fotogramma nuovo, solo quello viene codificato, e le sue chiavi e i suoi valori si aggiungono in coda alla memoria della cross-attention; i fotogrammi precedenti non si ricalcolano. Nella sequenza del testo il fotogramma lascia soltanto un’etichetta con il suo istante in secondi (del tipo «7.0 seconds») e un segnaposto. Lo stato del decoder resta quello che era, e il token successivo che il modello scrive vede già il fotogramma appena entrato. Il modello, dicono gli autori, è in tempo reale «per costruzione».

Ci sono due aggiunte. XRoPE, una codifica di posizione rotazionale per il canale della cross-attention, che mette testo e patch visive in un unico spazio di coordinate a tre assi (posizione nel flusso, altezza, larghezza): gli autori la presentano come la prima pensata per quel canale. E appunto i timestamp assoluti, perché la frequenza di campionamento varia da 1 a 16 fotogrammi al secondo a seconda del movimento, e la posizione nella sequenza da sola non dice quanto tempo è passato. Il conto dei parametri è di 11,3 miliardi: circa 8,2 nella spina dorsale linguistica, 2,3 negli strati di cross-attention, 0,8 nell’encoder visivo e nella proiezione.

Imparare quando parlare

L’architettura permette il comportamento; a insegnarlo è l’ultima fase di addestramento, che il paper chiama Realtime-SFT. Prima ci sono quattro stadi di pre-addestramento, che portano il contesto da 8K a 256K token, e un fine-tuning supervisionato ordinario da cui nasce MOSS-VL-Instruct, il modello offline. Tutto ciò che riguarda il tempo reale sta in quest’ultima fase, che vale meno del 3% dei token complessivi: 0,56 milioni di esempi, circa 34,8 miliardi di token.

Dopo ogni fotogramma c’è uno spazio di decisione, e il modello può scriverci <|silence|> (continuo a guardare), oppure <|response|> seguito da un pezzo di testo (sto parlando), oppure un pezzo chiuso da un silenzio (ho finito). Una risposta lunga si distribuisce su più fotogrammi consecutivi, un pezzo alla volta, ed è per questo che fra un pezzo e l’altro il modello continua a vedere. Due soli token nuovi nel vocabolario, nessuna testa di decisione dedicata: parlare o tacere è una normale previsione del token successivo. La modalità si sceglie con un prompt di sistema, e gli stessi pesi funzionano offline, in streaming e in tempo reale.

Il cuore di quella fase è il corpus. Accanto a dataset aperti di streaming, filtrati e riannotati, la parte che per gli autori conta di più è sintetizzata in casa da descrizioni dense e ancorate al tempo. Ogni esempio dà al modello un ruolo: istruzioni che scattano una sola volta al verificarsi di una condizione, domande con risposta da aggiornare, commento continuo, conteggi. In tutto 2,2 milioni di decisioni di emissione supervisionate, il 58,7% a iniziativa del modello e non in risposta a una domanda appena arrivata; nel 5,1% degli esempi l’evento atteso non succede mai, e la cosa giusta è tacere fino alla fine.

C’è però un problema di proporzioni: i silenzi sono molti più delle prese di parola, e con pesi uniformi il modello impara semplicemente a stare zitto. Gli autori ripesano i due token di stato con un fattore focale e con coefficienti inversi alla frequenza delle classi, calcolati sul batch globale a ogni passo:

$$\mathcal{L} = \frac{\sum_i m_i\, w_i\, \ell_i}{\sum_i m_i}, \qquad w_i = \begin{cases} \alpha_{y_i}\,(1-p_i)^{\gamma} & \text{se } y_i \text{ è un token di stato} \\ 1 & \text{altrimenti} \end{cases}$$

dove $\ell_i$ è la cross-entropia del token, $m_i$ la maschera di supervisione, $p_i$ la probabilità assegnata al token giusto, $\gamma = 2$ e $\alpha_k = (n_s + n_r)/(2 n_k)$, con $n_s$ e $n_r$ i conteggi di silenzi e risposte nel batch. Prima della modulazione focale, parlare e tacere pesano lo stesso, per quanto raro sia parlare.

Da dove viene il fattore $(1-p)^\gamma$, e perché abbassa il peso degli esempi facili quando una classe schiaccia l’altra: la focal loss nasce nella detection, e il libro la racconta lì.

Leggi «Detection e segmentazione» nel libro →

Un dettaglio piccolo: nel video in diretta, quando l’utente interviene, la conversazione non finisce. Per questo gli autori tolgono dalla supervisione il token che chiude il turno dell’assistente, così il modello non impara a smettere di parlare solo perché qualcuno ha scritto. In un confronto a una sola variabile, questa maschera ha fatto crescere del 39% la frequenza delle prese di parola e del 68% la lunghezza media delle risposte.

I numeri

Sui quattro benchmark di streaming, contro modelli aperti di questo filone, MOSS-VL-Realtime ha la media migliore su tre; su StreamingBench è secondo, dietro AURA. Il dato più netto sta nei sottoinsiemi che misurano l’intervento non richiesto al momento giusto. Non vince ovunque: dove il compito si riduce a domande di percezione sulla scena corrente, AURA resta davanti.

Streaming, contro i modelli aperti punteggi dei benchmark · più alto è meglio
Benchmark MOSS-VL-Realtime Concorrente
Media sul benchmark
OVO-Bench 70,2 65,3
OmniMMI 32,7 25,4
ProactiveVideoQA 47,2 42,7
StreamingBench 69,7 71,1 AURA
Intervenire senza che nessuno lo chieda
Proactive Alerting, OmniMMI 66,0 37,5
Proactive Output, StreamingBench 60,0 53,2
Forward Active Responding, OVO-Bench 62,1 55,8
Percezione della scena corrente
Percezione in tempo reale, OVO-Bench 75,9 79,8 AURA

La velocità viene dalla stessa scelta. Il confronto è con Qwen3-VL-8B, stessa spina dorsale Qwen3-8B, su una H200 con SGLang. A parità di token visivi, il vantaggio nel tempo al primo token cresce da 2,8 a 5,1 volte man mano che il contesto visivo si allunga, e la latenza complessiva da 1,9 a 4,3 volte. Sullo stesso video MOSS-VL porta circa il doppio dei token visivi, perché rinuncia a comprimere l’asse del tempo per poter codificare ogni fotogramma appena arriva, e comunque non resta mai indietro: sul video più lungo provato, 1024 fotogrammi, è circa due volte più rapido.

Offline, nel confronto scelto dagli autori, MOSS-VL-Instruct è primo sui benchmark di ragionamento temporale sul video: Minerva (40,5, dove però l’unico rivale con un numero è Gemma-4), TOMATO (39,5), VideoMME-Logical (17,1). Ma resta indietro dove si ragiona «da esame» o si leggono documenti.

Offline, dove resta indietro esame e documenti · più alto è meglio
Benchmark MOSS-VL-Instruct Qwen3-VL-8B
MMMU 51,1 69,6
DocVQA 89,6 96,1
InfoVQA 68,9 83,4

Che cosa il paper non dimostra

Il limite principale lo scrivono gli autori: il quinto livello è attestato solo qualitativamente. I benchmark pubblici arrivano fino a L4, e nessuno misura se un modello corregge o interrompe una risposta quando la scena la smentisce. Nel paper le prove sono due sessioni della demo, in cinese: un gatto che tocca una carota quattro volte, e il modello che lo segnala esattamente quattro volte; una punizione di Cristiano Ronaldo raccontata dalla preparazione al 3 a 3 con la Spagna. Nessuna delle due mostra una risposta corretta o troncata a metà, il gesto con cui il paper definisce il quinto livello: sono dimostrazioni, non misure.

I numeri dei concorrenti, inoltre, vengono quasi tutti dai loro rapporti ufficiali, con impostazioni che possono differire da quelle degli autori, soprattutto nel numero di fotogrammi; fa eccezione, offline, la colonna di Gemma-4, rivalutato in casa con lo stesso protocollo. La media di StreamingBench copre solo i gruppi visivi, perché MOSS-VL non riceve audio. Su OmniMMI i valori restano bassi per tutti: la media migliore è 32,7. Il confronto di velocità, infine, è offline, con SGLang su una GPU di fascia altissima, mentre il tempo reale gira su un’implementazione di riferimento separata; la latenza di una sessione dal vivo non è misurata, salvo l’osservazione che nella demo il commento parte entro un secondo. Niente reinforcement learning e niente modalità di ragionamento: il primo, con un benchmark dedicato al quinto livello, è il prossimo passo dichiarato.

Perché conta adesso

Un assistente che guarda (una videocamera che avvisa, un paio di occhiali che commentano) ha bisogno di un modello che sappia tacere a lungo e intervenire al momento giusto, non di uno che risponde bene a domande su un video finito. MOSS-VL mostra che una parte di questo si ottiene tornando a un’idea architetturale di quattro anni fa, quella di Flamingo, che molti modelli recenti avevano lasciato da parte. E lo mostra a pesi aperti, con il curriculum pubblicato. La domanda che il paper lascia aperta, e che solo un benchmark ancora da costruire può chiudere, è la stessa che si farebbe a un cronista: quando l’azione cambia a metà frase, se ne accorge davvero?

I commenti sono riservati agli iscritti.

Accedi per commentare