Immaginate un congresso con mille partecipanti divisi in cinquanta tavoli. Se ognuno deve parlare con tutti gli altri, la sala si riempie di un brusio ingestibile: le conversazioni possibili crescono con il quadrato delle persone. Gli organizzatori esperti fanno un’altra cosa. Ogni tavolo discute al suo interno, poi manda un paio di delegati a una riunione comune; i delegati tornano al tavolo e riferiscono. Non tutto passa, ma quasi tutto ciò che conta sì, e la sala resta vivibile.
È, spostata dentro una rete neurale, una delle idee di VGGT-Ω, uscito su arXiv il 14 maggio 2026 (2605.15195) e firmato da dieci autori del Visual Geometry Group di Oxford e di Meta AI, fra cui Jianyuan Wang, primo autore anche del VGGT originale, Andrea Vedaldi, Christian Rupprecht e David Novotny. Ma i delegati sono il mezzo. Il fine è rispondere a una domanda che nel linguaggio e nelle immagini 2D ha già una risposta e nella visione 3D è poco esplorata: se un modello di ricostruzione lo si fa più grande e lo si nutre con più dati, migliora in modo prevedibile?
Da dove si parte
Per decenni ricostruire una scena da un insieme di foto ha voluto dire una catena di passaggi: trovare punti corrispondenti fra le immagini, stimare le posizioni delle camere, triangolare, raffinare tutto con il bundle adjustment. Da un paio d’anni esiste un’altra strada, i modelli feed-forward: una rete che riceve le immagini e restituisce in un solo passaggio camere, mappe di profondità e nuvole di punti, senza ottimizzazione. VGGT, presentato dallo stesso gruppo nel 2025, è uno dei riferimenti di questa famiglia, e i token interni di modelli come questo sono stati riusati da decine di lavori come rappresentazione «che sa di geometria».
Che cosa sono camera, profondità e corrispondenze fra viste, e come la geometria multi-vista ricava la terza dimensione da immagini piatte: è spiegato nel capitolo del libro dedicato alla geometria.
Il limite di VGGT, per chi volesse ingrandirlo, era il costo dell’addestramento. Il modello alterna due tipi di attenzione: una dentro ogni fotogramma, una globale che mette in relazione tutti i token di tutti i fotogrammi. Quest’ultima costa in proporzione al quadrato del numero totale di token, e le teste che producono le mappe dense tengono in memoria attivazioni ad alta risoluzione che né lo sharding né il gradient checkpointing riescono a eliminare.
Tre tagli che liberano memoria
Il primo taglio sono i delegati del congresso. A ogni immagine il modello aggiunge, come già VGGT, un token per la camera e dei registri, qui sedici: token appresi che non corrispondono a nessuna porzione dell’immagine. In un quarto degli strati di attenzione globale, gli autori sostituiscono l’attenzione fra tutti i token con la register attention: fra i fotogrammi parlano solo i registri,
$$\big(z_1^{\text{scene}\,\prime}, \dots, z_N^{\text{scene}\,\prime}\big) = \mathrm{attn}\big(z_1^{\text{scene}}, \dots, z_N^{\text{scene}}\big),$$
e i registri aggiornati riportano l’informazione ai token della propria immagine nel successivo strato di attenzione locale. La motivazione è empirica: le mappe dell’attenzione globale di VGGT risultano molto sparse, come se pochi token bastassero a far circolare quello che serve. Nell’ablazione, con sola attenzione globale l’errore sui punti 3D è 0,071, con un quarto di register attention 0,073, mentre il backbone risparmia in addestramento circa il 23% delle operazioni e il 16% della memoria.
Il secondo taglio riguarda le teste di uscita. Gli ultimi blocchi convoluzionali ad alta risoluzione sono sostituiti da un solo MLP seguito da un pixel shuffle, che ridispone i canali in una mappa quattro volte più fine per lato. Un decodificatore del tutto privo di convoluzioni, provato e scartato, andava spesso meglio nei numeri ma lasciava artefatti a blocchi, soprattutto nelle scene all’aperto. Il terzo taglio elimina le teste ridondanti: VGGT prevedeva separatamente profondità, mappe di punti e tracce; VGGT-Ω tiene una sola testa densa per la profondità e una per la camera, ma continua a supervisionare punti e corrispondenze attraverso la funzione di perdita,
$$\mathcal{L} = \lambda_{\text{cam}}\mathcal{L}_{\text{cam}} + \lambda_{\text{depth}}\mathcal{L}_{\text{depth}} + \lambda_{\text{point}}\mathcal{L}_{\text{point}} + \lambda_{\text{match}}\mathcal{L}_{\text{match}}.$$
Le mappe di punti si ricavano dalla profondità e dalla camera, quindi non serve una testa che le produca. Insieme, i tre tagli portano la memoria di addestramento a circa il 30% di quella del predecessore.
Da dove arrivano quattro milioni di scene
La memoria liberata serve a far entrare dati, e qui il paper spende molta fatica. Gli autori raccolgono una trentina di dataset pubblici, reali e sintetici, più dataset interni di Meta: circa 3 milioni di sequenze. Poi partono da circa 40 milioni di video interni «in stile Internet» e li fanno passare per una filiera volutamente spietata. Un modello visione-linguaggio giudica metà dei clip troppo difficili da ricostruire, un altro 40% ricostruibile ma poco preciso, e manda avanti solo il 10%; un rilevatore toglie persone e auto dai calcoli; un insieme di metodi di matching, il VGGT originale e COLMAP stimano le camere; controlli di coerenza fra viste e un classificatore addestrato su mille sequenze annotate a mano eliminano il resto. Ne sopravvivono 0,8 milioni: 600mila statiche e 200mila con oggetti in movimento. Il totale arriva a circa 4 milioni di scene, più di quindici volte il dataset di VGGT.
La severità ha un prezzo in resa, ma sulle sequenze sintetiche di Sintel, dove la verità è nota, le annotazioni della filiera raggiungono il 96,4% di AUC@30° sulle camere, contro il 62,1% di MegaSaM, un metodo di ottimizzazione pensato proprio per scene dinamiche. Il confronto però avviene solo su ciò che supera entrambi i filtri: 8 sequenze su 23 e tutte le regioni in movimento sono escluse.
Si aggiunge una fase auto-supervisionata alla DINO su 18 milioni di video senza etichette: uno studente impara a imitare un maestro che vede gli stessi fotogrammi con aumentazioni diverse e in un altro ordine, mentre il maestro si aggiorna come media mobile dello studente, $\theta_T \leftarrow m\,\theta_T + (1-m)\,\theta_S$.
La curva che cercavano
Il risultato che dà senso al paper è la figura d’apertura. Portando il modello da 0,2 a 10 miliardi di parametri, e i dati da circa duemila a due milioni di sequenze a parità di token visti, l’errore sui punti 3D scende con regolarità. Sul solo asse dei dati, a passi di dieci volte, cala da 0,275 a 0,073. Nei risultati gli autori scrivono che la forma delle curve «suggerisce» una legge di potenza, senza stimarla; l’introduzione parla già di un miglioramento «simile a una legge di potenza».
Sui benchmark la versione da 10 miliardi supera tutti i confronti su tre insiemi statici e tre dinamici, spesso con margini larghi. Il caso più citato è Sintel. Sulle camere l’AUC@3° arriva a 40,0, contro 22,5 di MegaSaM, il migliore precedente: è il +77% del sommario. Sulla profondità, sempre su Sintel, il modello tocca 93,5 di $\delta_{1.25}$. L’introduzione lo confronta con il 74,1 di MegaSaM, ma Depth Anything 3, il concorrente più forte, era già a 86,1 (ed è il confronto che il paper fa nei risultati). Anche la versione da 1 miliardo, grande quanto DA3-Giant, sta davanti quasi ovunque. In inferenza, su una A100 da 80 GB, VGGT-Ω gestisce circa 1.250 fotogrammi contro i circa 750 di DA3, come VGGT con l’implementazione corretta, ed è più veloce: soprattutto perché i patch di DINOv3 riducono i token di circa un quarto, poi per la register attention (20–25%). Una variante con sola register attention scende da 240 a 12 secondi su mille fotogrammi, ma perde precisione fino al livello del VGGT originale.
I registri servono anche altrove
La parte più curiosa riguarda i sedici registri, che di solito nei vision transformer vengono buttati via. Congelati e aggiunti come input a OpenVLA-OFT, un modello che guida un braccio robotico, alzano il tasso di successo medio su LIBERO da 97,1 a 98,5%, e sui compiti lunghi da 94,5 a 96,7%. Allineati in stile CLIP alle descrizioni di un modello visione-linguaggio, recuperano la descrizione giusta al primo colpo nel 76,8% dei casi su un banco di prova di cento video scelti a mano. Il margine robotico è piccolo perché il punto di partenza era già vicino al tetto; il banco linguistico è minuscolo e costruito dagli autori. Sono indizi, e il paper li presenta come tali: la ricostruzione come «compito proxy» per imparare a capire lo spazio.
Che cosa resta da verificare
I dati non sono replicabili. Il salto di scala poggia su 40 milioni di video e su dataset interni di Meta: la filiera di annotazione, per quanto descritta con cura, gira su materiale che nessuno fuori può ottenere. Né lo è il calcolo: 128 H100 per 240mila iterazioni. Il testo rimanda a una pagina del progetto ma non dice se e con quale licenza i pesi saranno rilasciati.
La valutazione è su dieci fotogrammi. Ogni sequenza dei benchmark viene ridotta a dieci immagini campionate a caso: un’impostazione da ricostruzione sparsa, legittima, ma lontana dalle riprese lunghe dove conta la tenuta su migliaia di fotogrammi. Lì il paper misura memoria e tempi, non l’accuratezza.
L’auto-supervisione è onestamente ridimensionata. Sostituire il 10% dei passi supervisionati la porta da 0,073 a 0,070 di errore; gli autori scrivono che aiuta sui dati fuori distribuzione ma incide poco sui benchmark, e che tutti gli altri protocolli provati, dalla sintesi di nuove viste ai Gaussian splat, nella loro implementazione non hanno funzionato.
I casi difficili sono dichiarati. Mosso marcato, campo visivo che cambia bruscamente, ottiche molto distorte; e uffici pieni di monitor, colpa di dati rumorosi visti a inizio addestramento. Volti e marchi oscurati nei dati per ragioni di privacy e di licenza lasciano talvolta artefatti proprio lì. Gli autori rinunciano anche, per semplicità, a un 4–6% di AUC@3° che otterrebbero con l’affinamento iterativo delle camere di VGGT e altri accorgimenti.
L’ottimizzazione non è morta. In condizioni favorevoli il bundle adjustment stima le camere con errori di pochi centesimi di grado, e per NeRF e Gaussian splatting quella precisione conta. Il paper lo riconosce, e propone il feed-forward come punto di partenza per l’ottimizzazione, non come suo sostituto.
Perché conta adesso
Nel linguaggio e nella visione 2D i modelli di fondazione sono arrivati quando si è visto che più parametri e più dati danno, in modo prevedibile, modelli migliori. Nel 3D mancava una curva così, e mancava un estrattore di rappresentazioni geometriche generale come lo erano stati VGG16 o ResNet per le immagini. VGGT-Ω non chiude la questione: la curva è una media su sei dataset, con pochi punti per asse, e la ricetta dipende da dati che solo un’azienda come Meta possiede. Ma sposta il problema da «si può fare?» a «chi ha i dati e il calcolo per farlo?», che per robotica e world model è una domanda molto più concreta. E suggerisce che, come al congresso, buona parte della conversazione fra mille fotogrammi può passare per pochi delegati ben scelti. Non tutta, come mostra la variante con soli registri.

I commenti sono riservati agli iscritti.
Accedi per commentare