Un revisore dei conti con una settimana di tempo e diecimila fatture non le controlla tutte. Guarda il bilancio di quell’azienda, capisce qual è la spesa tipica e quanto si discosta di solito, e verifica una per una solo le voci che escono dalla norma. Le altre non le ignora: le somma in blocco, con una stima. Due dettagli contano. La soglia non è la stessa per tutti, perché una cifra anomala per una bottega è normale per una multinazionale. E le voci non verificate entrano comunque nel conto, anche se approssimate.
È, trasportata dentro una GPU, l’idea di Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification, uscito su arXiv il 27 luglio 2026 (2607.24027). Lo firmano undici autori di NVIDIA, da Haopeng Li come primo nome a Enze Xie e Song Han in chiusura: è il gruppo della famiglia di modelli SANA, nel cui repository sta anche il codice. Il bersaglio è preciso: l’inferenza dei diffusion transformer che generano e modificano video, dove l’attenzione è diventata la voce di costo dominante.
Perché l’attenzione pesa tanto nei video
Un video da 720p e qualche secondo, una volta compresso nello spazio latente, diventa una sequenza di decine di migliaia di token, e il paper misura il suo kernel fino a 128K. L’attenzione confronta ogni token con tutti gli altri, e il costo cresce col quadrato della lunghezza. FlashAttention ha risolto il problema della memoria, perché non scrive mai per intero la matrice dei punteggi, ma non quello del calcolo: tutte le coppie vengono comunque valutate, a ogni strato e a ogni passo di denoising.
Come FlashAttention calcola l’attenzione a pezzi, tenendo aggiornati massimo e somma del softmax mentre scorre i blocchi (la «online softmax» su cui Sol-Attn si innesta), è spiegato nel capitolo sulle GPU.
La via più battuta per risparmiare è l’attenzione sparsa senza addestramento: si divide la sequenza in blocchi (in Sol-Attn da 64 token) e, per ogni blocco di query, si calcola l’attenzione esatta solo con i blocchi di chiavi che contano. Per sapere quali contano si usa un punteggio di comodo, il prodotto fra la media delle query del blocco e la media delle chiavi di ciascun blocco. Poi si sceglie: con il top-k si tengono sempre i $k$ blocchi migliori, con il top-p si tengono blocchi finché la loro probabilità cumulata raggiunge una quota $p$.
Gli autori individuano due difetti. Il primo è di instradamento: il top-k impone lo stesso budget a ogni riga, concentrata o diffusa che sia l’attenzione; il top-p ha un budget variabile ma difficile da governare, perché a parità di $p$ può tenere un blocco solo oppure fino a $\lceil pN \rceil$ blocchi su $N$, a seconda di come è distribuita la probabilità. E tutti e due costruiscono la mappa completa dei punteggi e gli indici scelti nella memoria della GPU prima che l’attenzione vera cominci, un traffico che a sequenze lunghe non è trascurabile. Il secondo difetto è più semplice: i blocchi esclusi vengono buttati per intero, anche quando portavano una fetta non piccola dell’attenzione, e con sparsità spinte l’errore si accumula.
Una soglia per ogni riga
Il punto di partenza è un’osservazione empirica. Raccogliendo i punteggi di comodo su passi, strati, teste e blocchi di Wan 2.1, HunyuanVideo 1.5 e LTX 2.3, gli autori trovano che, una volta standardizzati, hanno una distribuzione vicina a una gaussiana. Questo suggerisce di scegliere come fa il revisore: per il blocco di query $i$, con $\mu_i$ e $\sigma_i$ media e deviazione standard dei suoi punteggi, si tengono i blocchi di chiavi che superano
$$\tau_i = \mu_i + \beta\,\sigma_i, \qquad \mathcal{S}_i = \{\, j : \hat{s}_{ij} > \tau_i \,\}.$$
Il parametro $\beta$ è uno solo per tutto il modello e fissa la densità media: se la distribuzione è gaussiana, la quota di blocchi tenuti è circa $1 – \Phi(\beta)$, dove $\Phi$ è la funzione di ripartizione della normale standard. Ma ogni riga traduce quella soglia sulla propria scala, e il numero di blocchi scelti resta libero di variare. Nell’ablazione, a parità di densità media del 15%, il top-k inchioda ogni riga al valore fisso, il top-p produce densità molto disperse, e la soglia resta raccolta attorno al bersaglio pur variando riga per riga.
La soglia costa poco: $\mu_i$ e $\sigma_i$ si ottengono dalla media delle chiavi compresse e dalla loro matrice dei secondi momenti, grande $d \times d$, senza calcolare la riga dei punteggi né scrivere in memoria una mappa $N \times N$.
Scegliere mentre si calcola
La seconda mossa è di ingegneria del kernel, ed è quella che dà il nome al metodo (Sparsifying online attention). Nota la soglia, non serve più vedere tutta la riga per decidere: ogni punteggio può essere confrontato con $\tau_i$ nel momento in cui viene prodotto. Il kernel diventa allora un doppio ciclo. Quello esterno scorre le chiavi compresse, una per blocco, a gruppi, e calcola i punteggi; i blocchi sopra soglia vengono passati subito al ciclo interno, che carica le chiavi e i valori originali e fa l’attenzione esatta. Gli autori mostrano che il risultato coincide con una soglia applicata offline sull’intera riga, ma senza scrivere in memoria né la mappa né gli indici.
La terza mossa riguarda i blocchi sotto soglia. Invece di buttarli, Sol-Attn li approssima con il termine di ordine zero di uno sviluppo di Taylor: ogni token del blocco escluso viene trattato come se avesse la chiave media del blocco, e il suo contributo entra sia al numeratore sia al denominatore del softmax. Il punto è che i punteggi fra le query e le chiavi medie servono già all’instradamento, che ne prende la media: la correzione riusa gli stessi numeri, e il ramo esatto e quello approssimato aggiornano lo stesso stato della online softmax. La correzione in sé non è nuova: PISA, un lavoro precedente dello stesso primo autore, approssima già i blocchi esclusi con uno sviluppo di Taylor. La novità rivendicata è averla fusa con la scelta in un solo passaggio.
Che cosa sia un diffusion transformer e perché, nei modelli video, l’attenzione su tutto il volume spazio-temporale sia il cuore dell’architettura, lo racconta il libro.
I numeri
Sul kernel isolato, su una H100 e contro FlashAttention-3, l’accelerazione cresce con la lunghezza e con la sparsità, fino a 5,41 volte a 128K token e al 90% di sparsità. L’instradamento a soglia impiega 0,33 millisecondi contro 3,80 del top-k e 10,8 del top-p: 11,5 e 32,7 volte meno. E la memoria di lavoro resta vicina a quella dell’attenzione densa, mentre Sparse-VideoGen2 ne chiede circa otto volte tanta.
Il confronto che conta è da un capo all’altro della generazione, a parità di sparsità con tre metodi recenti senza addestramento: XAttention, Sparse-VideoGen2 e PISA. Su Wan 2.1 Sol-Attn è più veloce del migliore concorrente e la qualità tiene. Su HunyuanVideo la qualità cala leggermente, e PISA fa un po’ meglio sia su VBench sia su tutte e tre le misure di somiglianza con l’uscita densa.
| Modello | Accelerazione | VBench | Attenzione densa |
|---|---|---|---|
| Wan 2.1, 14 miliardi di parametri, 720p, 81 fotogrammi | 2,02 volte migliore concorrente: 1,86 | 76,13 | 75,90 |
| HunyuanVideo, 13 miliardi, 720p, 129 fotogrammi | 2,12 volte | 76,81 | 77,06 |
Su LTX 2.3 da 22 miliardi, a 1080p con 721 fotogrammi finali e circa il 90% di sparsità, l’accelerazione è di 1,9 volte sull’intera pipeline e di 2,4 sul secondo stadio, l’unico a cui il metodo è applicato.
Fra video e video i guadagni salgono: 3,04 volte nel raffinamento di un video di un minuto con SANA-WM e 2,34 nell’editing con Bernini, dove Sol-Attn ha anche la miglior somiglianza all’uscita densa fra i metodi sparsi. Su una scheda da gioco, la RTX 5090, con il Wan più piccolo a 480p, 1,71 volte (qui contro FlashAttention-4). E innestato in Sol-Engine, il motore d’inferenza del gruppo che somma fusione dei kernel e cache dei passi di diffusione, su una B200 porta HunyuanVideo da 867 a 171 secondi, 5,08 volte, e Wan 2.1 a 3,48 volte. Nell’ablazione diretta, contro l’implementazione a blocchi sparsi di cuDNN con gli stessi blocchi, il kernel di Sol-Attn costa fra l’1,6 e il 9,4% in più per via della correzione, ma l’intero percorso risulta più veloce del 6–7%, perché non c’è una fase di instradamento separata.
Dove leggere con attenzione
La qualità non è sempre «preservata». Sui video la parola regge: le differenze VBench sono di qualche decimo. Ma nel raffinamento con SANA-WM l’errore di rotazione della camera passa da 7,13 dell’attenzione densa a 8,78, meglio degli altri metodi sparsi ma chiaramente peggio del riferimento. E sulle immagini 2K con Ideogram 4 la media di Qwen-Image-Bench scende da 59,24 a 55,31, per un guadagno di 1,56 volte: a sequenze medie il conto è meno favorevole.
I trucchi di contorno contano. Su Wan, HunyuanVideo, Bernini e Ideogram i primi passi di denoising (circa il 20%) e il primo strato restano densi; su LTX è denso tutto il primo stadio; e i token del testo, in cross-attention o dentro l’attenzione congiunta, sono sempre calcolati in modo esatto. È la prassi dei lavori precedenti, ma significa che la qualità misurata è quella di un sistema ibrido, non dell’attenzione sparsa da sola.
I concorrenti sono stati adattati dagli autori. Per XAttention e Sparse-VideoGen2 su modelli come LTX, che le versioni originali non coprivano, le configurazioni sono state portate dagli autori stessi; e PISA, il concorrente più vicino, viene dallo stesso primo autore. Il 5× finale, poi, passa per il motore della stessa squadra, e una fetta grossa di quel salto viene dalla cache dei passi (da 781 a 328 secondi), non da Sol-Attn, che da lì porta a 171.
I limiti dichiarati. Il kernel esiste solo per l’inferenza, senza passaggio all’indietro; su Blackwell non sfrutta ancora tutto l’hardware; e la valutazione riguarda solo i modelli a diffusione bidirezionali, non la generazione video autoregressiva. Aggiungiamo noi che il presupposto quasi gaussiano è mostrato su tre modelli soli, e che con maschere causali, avverte l’appendice, l’approssimazione va adattata.
Perché conta adesso
Il conto dei modelli video aperti è alto: nelle misure del paper, HunyuanVideo senza ottimizzazioni impiega quasi un quarto d’ora per un video su una B200, e ogni minuto è costo per chi offre il servizio e attesa per chi lo usa. L’attenzione sparsa senza addestramento è attraente proprio perché non chiede di toccare i pesi. Sol-Attn non inventa tutti i pezzi: soglie per scartare blocchi, correzione dei blocchi esclusi e scorrimento a blocchi esistevano già in altre forme. Li ricuce in un solo passaggio in cui, nelle misure degli autori, scegliere costa pochissimo. È il lavoro del revisore fatto bene: la soglia giusta per ciascuno, e nessuna voce lasciata fuori dal conto. Il codice è pubblicato; resta da vedere quanto regge fuori dai modelli su cui è stato provato, tutti a diffusione bidirezionale.

I commenti sono riservati agli iscritti.
Accedi per commentare