Chi ha lavorato in un archivio fotografico conosce il trucco più vecchio del mestiere: non serve inventare una foto, basta rimettere in giro una foto vera con una didascalia sbagliata. Un’alluvione del 2014 diventa quella di ieri, un corteo pacifico diventa una rivolta. Il falso non sta nell’immagine, sta in quello che le si fa dire. I generatori video di oggi aggiungono un passaggio: prendono quella foto vera e la fanno continuare. L’acqua sale, il fumo si alza, la folla si muove. Il primo fotogramma è autentico, tutto il resto no.
È esattamente lo scenario che mette al centro Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events?, uscito su arXiv a metà agosto 2026 (2608.14391, prima versione del 14 agosto, seconda del 17). Il lavoro è firmato da trentasei autori, con Shuo Liang, Yixing Ma e Pengfei Zhou come primi nomi e tra i cinque autori corrispondenti Yang You della National University of Singapore e Wei Wang e Wangbo Zhao della Hong Kong University of Science and Technology. Propone un banco di prova, RA-Bench, e una domanda secca: gli strumenti che dovrebbero riconoscere un video generato funzionano quando il video racconta una crisi vera? La risposta del paper, con i suoi numeri, è no.
Un banco di prova ancorato al reale
«RA» sta per Real videos as Anchors. I benchmark precedenti (GenVideo, GenVidBench, AIGVDBench e altri) partono da raccolte generiche di video dal web; questo parte da 675 filmati pubblici di eventi con un peso sociale, soprattutto da account di governi e istituzioni pubbliche, poi da archivi a licenza aperta come Wikimedia Commons e da piattaforme come YouTube. Li organizza in 10 categorie di rischio e 44 sottocategorie: meteo e disastri naturali, guerre e conflitti, politica, sicurezza pubblica, incidenti e infrastrutture, panico economico e sociale, salute pubblica, tecnologia, spazio, grandi eventi pubblici.
I filmati vengono tagliati per scene (5774 spezzoni), passati da due giri di revisione umana e ripuliti: durata fra 3 e 15 secondi, stessa codifica H.264 per tutti, doppioni rimossi, diritti di redistribuzione verificati fonte per fonte e annotati su ogni clip. Restano 1830 spezzoni reali da 338 video sorgente, circa cinque ore in tutto.
Poi l’attacco. Ogni spezzone viene descritto da Gemini-3.1-Pro-Preview, la descrizione diventa un prompt comune, e nove generatori image-to-video ricevono prompt e primo fotogramma reale. Quattro sono aperti (Wan2.2 in due varianti, LTX-2.3, OmniWeaving) e coprono tutti i 1830 spezzoni; cinque sono commerciali (HappyHorse, Runway, Kling, Seedance 2.0, Hailuo), e i loro filtri di sicurezza hanno respinto una parte delle richieste: Seedance, per esempio, si ferma a 1524. Il totale è di 16.056 video generati, 17.886 video in tutto. Per non regalare scorciatoie ai rilevatori, la durata del falso segue quella dell’originale secondo la regola $t_{\mathrm{gen}} = \mathrm{clamp}(t_{\mathrm{real}} \cdot 8/15,\ 2,\ 8)$ secondi, e l’audio è tolto a tutti.
Come un modello di diffusione genera un video a partire da rumore e da un fotogramma di partenza, e perché il Transformer ha preso il posto della U-Net: nel libro.
Diciannove rilevatori, tre famiglie
Dall’altra parte del tavolo ci sono tre famiglie di difensori. Sette rilevatori tradizionali, classificatori addestrati a cercare artefatti nei singoli fotogrammi (CNNSpot, NPR, UnivFD, ForgeLens) o nel tempo (DeCoF, D3, ReStraV). Dieci modelli multimodali generalisti interrogati senza addestramento specifico, con tre formati di domanda: un sì o no, una diagnosi per aspetti, un voto. Due modelli multimodali addestrati apposta sul compito, Skyra e BusterX++.
Le metriche sono due, e vale la pena tenerle a mente perché il paper gioca tutto sulla loro differenza. L’AUC dice quanto spesso un rilevatore dà al falso un punteggio più alto del vero corrispondente: 50% è una moneta. L’accuratezza bilanciata fa la media fra quanti falsi riconosce (fake recall) e quanti veri riconosce come veri:
$$\mathrm{BAcc} = \tfrac{1}{2}\,\big(\mathrm{FakeR} + \mathrm{RealR}\big).$$
Il dettaglio che conta è che un rilevatore che risponde sempre «vero» ottiene il 50%, esattamente come uno che tira a caso. Un 50% di accuratezza bilanciata può nascondere un sistema che non vede nessun falso.
Curva ROC, AUC, accuratezza bilanciata e perché l’accuratezza semplice inganna quando le classi sono squilibrate: nel libro, nel capitolo sulla valutazione.
I numeri: nessuna famiglia regge
I rilevatori tradizionali crollano fuori casa. Sui benchmark pubblici di riferimento avevano AUC fra il 67,6% e il 98,6%. Su RA-Bench la media dei sette scende al 50,9–57,3% sui generatori aperti e al 43,9–54,0% su quelli commerciali. In 26 coppie rilevatore-generatore su 63 l’AUC è sotto il 50%: il falso sembra più vero del vero. Anche la classifica salta: la correlazione fra l’ordine sul benchmark pubblico e quello su RA-Bench è 0,26, e il primo della lista cambia da un generatore all’altro. Fissando i falsi allarmi al 5% dei video veri, la media dei sette intercetta fra il 2,8% e il 7,5% dei falsi.
I modelli generalisti dipendono da come gli si chiede. Il migliore è Gemini-3.1-Pro-Preview, intorno al 63% di accuratezza bilanciata, che però va dal 54,3% su Seedance 2.0 al 74,5% su LTX. Cambiare solo il formato della domanda ribalta i modelli piccoli: Qwen3.5-0.8B passa dal 19,7% di falsi riconosciuti con il sì/no al 97,8% con la diagnosi. GPT-5.5 è stabile, ma nel modo sbagliato: riconosce fra il 2,9% e il 4,4% dei falsi e dichiara vero oltre il 99% dei video veri. Crescere di taglia, da 0,8 a 122 miliardi di parametri, migliora alcune combinazioni e lascia Hailuo e Kling a pochi punti dal caso.
I modelli addestrati apposta hanno imparato l’orologio. È il risultato più istruttivo. Skyra, con il suo protocollo ufficiale, arriva al 68,5–69,5% di accuratezza bilanciata. Ma nel prompt i fotogrammi sono etichettati con il loro istante in secondi, e gli autori notano un’anomalia: sullo stesso generatore, con gli stessi input, portare la durata fissa a circa 5 secondi fa salire i falsi riconosciuti dal 33,8% al 96,4%. Sostituendo i secondi con semplici numeri di fotogramma, stesse immagini e stesso ordine, il vantaggio sparisce e Skyra scende al 54,4–54,9%. Un controllo sui dati di addestramento pubblicati mostra che un video di esattamente 5 secondi era correlato con l’etichetta «falso». È una spiegazione plausibile, dicono gli autori, non una prova: il modello sembra aver imparato una proprietà del dataset più che del video. E togliere i secondi non basta a renderlo affidabile: con i numeri di fotogramma l’accuratezza per singolo generatore oscilla ancora fra circa il 30% e il 61%. BusterX++ ha il difetto opposto: dice «vero» quasi sempre e riconosce fra il 4,1% e il 9,1% dei falsi.
Cosa rende un falso difficile
La seconda parte del paper cerca di capire da dove venga la difficoltà, e trova risposte che cambiano da famiglia a famiglia. Più il video generato resta fedele al fotogramma di partenza e coerente nel tempo, meno i rilevatori lo segnalano: per la diagnosi di Gemini, un aumento interquartile della fedeltà al fotogramma si accompagna a 14,4 punti in meno di falsi riconosciuti. Le scene con molto movimento invece aiutano Gemini e lasciano indifferenti i rilevatori tradizionali. Sono associazioni misurate dentro il dataset, avvertono gli autori, non rapporti di causa.
Il dato più scomodo riguarda quanta realtà si concede al generatore. Con Wan2.2 lo stesso prompt viene prodotto in tre modi: solo testo, testo più primo fotogramma, testo più primo e ultimo fotogramma. Per i modelli addestrati sul compito, ogni fotogramma vero in più rende il falso più difficile da vedere. Per i rilevatori tradizionali il quadro non è monotono: l’AUC media prima sale e poi scende.
| Rilevatori | Solo testo | Più il primo fotogramma | Più primo e ultimo |
|---|---|---|---|
| Modelli addestrati sul compito, falsi riconosciuti | 70,5% | 42,7% | 28,3% |
| Rilevatori tradizionali, AUC media | 33,4% | 50,9% | 44,6% |
Le persone, e l’ultimo miglio
Venti revisori hanno guardato i video senza sapere da dove venissero, tre giudizi per video. Riconoscono come generati il 68,6% dei falsi dei modelli aperti e il 52,9% di quelli commerciali; su Seedance 2.0 si scende al 40,7%, su Kling al 45,1%. E l’errore va anche nell’altra direzione: il 22,8% dei giudizi sui video veri li dichiara generati.
Dai falsi giudicati veri da tutti e tre i revisori, poi riconfermati da altri due, nasce RA-Bench-HumanProof: 633 video che cinque persone su cinque hanno creduto autentici, 514 dei quali da generatori commerciali. Su questo sottoinsieme Gemini scende al 54,7% di accuratezza bilanciata, i sette rilevatori tradizionali stanno al 47,5% di AUC, BusterX++ riconosce il 3,9% dei falsi. I video che ingannano le persone restano difficili anche per le macchine; gli autori precisano però che i due fallimenti si sovrappongono senza coincidere, e i rilevatori tradizionali erano già vicini al caso prima della selezione umana.
L’ultimo esperimento, RA-Bench-LastMile, simula quello che succede a un video prima di arrivare a chi lo guarda: ricodifica, risoluzione dimezzata, 8 fotogrammi al secondo, un bollino in stile telegiornale. Le stesse operazioni vengono applicate al vero e al falso. I modelli addestrati sul compito passano dal 46,0% di falsi riconosciuti all’1,4%; BusterX++ arriva allo 0,2%. L’accuratezza bilanciata resta vicina al 50%, ed è proprio il caso descritto dalla formula: non tirano a caso, dicono «vero» a tutto. Aggiunto alla sola ricodifica, il bollino da telegiornale, che non tocca la scena, fa scendere i falsi riconosciuti dal 29,9% al 14,0%: un elemento di presentazione basta a spostare il giudizio della macchina verso «vero».
Cosa il paper non dice
Gli autori sono espliciti sui limiti. RA-Bench è una fotografia: nove generatori e un rilevamento solo visivo, in un campo dove un generatore nuovo può cambiare la difficoltà in un mese; per questo propongono versioni successive. L’audio è escluso, mentre modelli come Seedance generano già audio e video insieme. Generazione e diffusione sui social sono studiate come fasi separate e controllate, mentre chi falsifica davvero combina montaggio, didascalie, voce sintetica e ripetuti passaggi fra piattaforme. I revisori hanno giudicato in un’interfaccia neutra, senza l’account che rilancia, i commenti e il contesto che online decidono la credibilità di un video.
Si può aggiungere un’osservazione. I filtri di sicurezza dei generatori commerciali hanno rifiutato una parte delle richieste, e il paper le conta ma non le analizza: non sappiamo quali scene di crisi siano state bloccate e se fossero proprio le più delicate. È un dato che interessa chi scrive le regole almeno quanto le percentuali di rilevamento.
Perché conta adesso
Il calendario dell’AI Act fissa al 2 agosto 2026 l’avvio in Europa degli obblighi di trasparenza sui contenuti sintetici, compresa l’etichettatura dei deepfake; il paper non ne parla, ma arriva due settimane dopo e dice che la parte difensiva della catena, il riconoscimento a valle, oggi non è all’altezza: dipende dalla fonte, dal formato della domanda, da scorciatoie nei dati di addestramento, e cede alla compressione di una qualsiasi piattaforma. Le direzioni che gli autori indicano vanno tutte nello stesso senso: rilevatori che combinano indizi diversi, spiegazioni di cui si possa verificare la fedeltà, e soprattutto filigrane inserite dal generatore stesso, da mettere alla prova contro lo stesso ultimo miglio. Il codice è pubblico; del dataset sono distribuiti come video 1319 spezzoni reali su 1830, gli altri 511 solo come metadati e link alla fonte, per ragioni di licenza. Il paper lascia una conclusione pratica: davanti a un video di una crisi, oggi l’unico controllo affidabile resta quello del vecchio archivio fotografico, cioè chiedersi da dove viene.

I commenti sono riservati agli iscritti.
Accedi per commentare