VGGT-Ω: la ricostruzione 3D in un solo passaggio scopre di crescere con la scala

Oxford e Meta riprendono VGGT, il modello che da una manciata di foto ricava in un colpo solo camere e profondità, e lo fanno crescere fino a 10 miliardi di parametri e 4 milioni di scene, video in movimento compresi. L'errore scende con regolarità al crescere di modello e dati, e la conversazione fra i fotogrammi passa in parte per sedici «delegati» per immagine. I numeri, il trucco di memoria che rende possibile la scala, e ciò che dal paper non si può verificare.

Immaginate un congresso con mille partecipanti divisi in cinquanta tavoli. Se ognuno deve parlare con tutti gli altri, la sala si riempie di un brusio ingestibile: le conversazioni possibili crescono con il quadrato delle persone. Gli organizzatori esperti fanno un’altra cosa. Ogni tavolo discute al suo interno, poi manda un paio di delegati a una riunione comune; i delegati tornano al tavolo e riferiscono. Non tutto passa, ma quasi tutto ciò che conta sì, e la sala resta vivibile.

È, spostata dentro una rete neurale, una delle idee di VGGT-Ω, uscito su arXiv il 14 maggio 2026 (2605.15195) e firmato da dieci autori del Visual Geometry Group di Oxford e di Meta AI, fra cui Jianyuan Wang, primo autore anche del VGGT originale, Andrea Vedaldi, Christian Rupprecht e David Novotny. Ma i delegati sono il mezzo. Il fine è rispondere a una domanda che nel linguaggio e nelle immagini 2D ha già una risposta e nella visione 3D è poco esplorata: se un modello di ricostruzione lo si fa più grande e lo si nutre con più dati, migliora in modo prevedibile?

Da dove si parte

Per decenni ricostruire una scena da un insieme di foto ha voluto dire una catena di passaggi: trovare punti corrispondenti fra le immagini, stimare le posizioni delle camere, triangolare, raffinare tutto con il bundle adjustment. Da un paio d’anni esiste un’altra strada, i modelli feed-forward: una rete che riceve le immagini e restituisce in un solo passaggio camere, mappe di profondità e nuvole di punti, senza ottimizzazione. VGGT, presentato dallo stesso gruppo nel 2025, è uno dei riferimenti di questa famiglia, e i token interni di modelli come questo sono stati riusati da decine di lavori come rappresentazione «che sa di geometria».

Che cosa sono camera, profondità e corrispondenze fra viste, e come la geometria multi-vista ricava la terza dimensione da immagini piatte: è spiegato nel capitolo del libro dedicato alla geometria.

Leggi «Geometria e profondità» nel libro →

Il limite di VGGT, per chi volesse ingrandirlo, era il costo dell’addestramento. Il modello alterna due tipi di attenzione: una dentro ogni fotogramma, una globale che mette in relazione tutti i token di tutti i fotogrammi. Quest’ultima costa in proporzione al quadrato del numero totale di token, e le teste che producono le mappe dense tengono in memoria attivazioni ad alta risoluzione che né lo sharding né il gradient checkpointing riescono a eliminare.

Tre tagli che liberano memoria

Il primo taglio sono i delegati del congresso. A ogni immagine il modello aggiunge, come già VGGT, un token per la camera e dei registri, qui sedici: token appresi che non corrispondono a nessuna porzione dell’immagine. In un quarto degli strati di attenzione globale, gli autori sostituiscono l’attenzione fra tutti i token con la register attention: fra i fotogrammi parlano solo i registri,

$$\big(z_1^{\text{scene}\,\prime}, \dots, z_N^{\text{scene}\,\prime}\big) = \mathrm{attn}\big(z_1^{\text{scene}}, \dots, z_N^{\text{scene}}\big),$$

e i registri aggiornati riportano l’informazione ai token della propria immagine nel successivo strato di attenzione locale. La motivazione è empirica: le mappe dell’attenzione globale di VGGT risultano molto sparse, come se pochi token bastassero a far circolare quello che serve. Nell’ablazione, con sola attenzione globale l’errore sui punti 3D è 0,071, con un quarto di register attention 0,073, mentre il backbone risparmia in addestramento circa il 23% delle operazioni e il 16% della memoria.

Chi parla con chi fra i fotogrammi Attenzione globale tutti i token di tutti i fotogrammi foto 1 foto 2 foto 3 Register attention fra i fotogrammi parlano solo i registri foto 1 foto 2 foto 3 token camera registri (16 per foto) token dell’immagine (schema illustrativo)

Il secondo taglio riguarda le teste di uscita. Gli ultimi blocchi convoluzionali ad alta risoluzione sono sostituiti da un solo MLP seguito da un pixel shuffle, che ridispone i canali in una mappa quattro volte più fine per lato. Un decodificatore del tutto privo di convoluzioni, provato e scartato, andava spesso meglio nei numeri ma lasciava artefatti a blocchi, soprattutto nelle scene all’aperto. Il terzo taglio elimina le teste ridondanti: VGGT prevedeva separatamente profondità, mappe di punti e tracce; VGGT-Ω tiene una sola testa densa per la profondità e una per la camera, ma continua a supervisionare punti e corrispondenze attraverso la funzione di perdita,

$$\mathcal{L} = \lambda_{\text{cam}}\mathcal{L}_{\text{cam}} + \lambda_{\text{depth}}\mathcal{L}_{\text{depth}} + \lambda_{\text{point}}\mathcal{L}_{\text{point}} + \lambda_{\text{match}}\mathcal{L}_{\text{match}}.$$

Le mappe di punti si ricavano dalla profondità e dalla camera, quindi non serve una testa che le produca. Insieme, i tre tagli portano la memoria di addestramento a circa il 30% di quella del predecessore.

Da dove arrivano quattro milioni di scene

La memoria liberata serve a far entrare dati, e qui il paper spende molta fatica. Gli autori raccolgono una trentina di dataset pubblici, reali e sintetici, più dataset interni di Meta: circa 3 milioni di sequenze. Poi partono da circa 40 milioni di video interni «in stile Internet» e li fanno passare per una filiera volutamente spietata. Un modello visione-linguaggio giudica metà dei clip troppo difficili da ricostruire, un altro 40% ricostruibile ma poco preciso, e manda avanti solo il 10%; un rilevatore toglie persone e auto dai calcoli; un insieme di metodi di matching, il VGGT originale e COLMAP stimano le camere; controlli di coerenza fra viste e un classificatore addestrato su mille sequenze annotate a mano eliminano il resto. Ne sopravvivono 0,8 milioni: 600mila statiche e 200mila con oggetti in movimento. Il totale arriva a circa 4 milioni di scene, più di quindici volte il dataset di VGGT.

La severità ha un prezzo in resa, ma sulle sequenze sintetiche di Sintel, dove la verità è nota, le annotazioni della filiera raggiungono il 96,4% di AUC@30° sulle camere, contro il 62,1% di MegaSaM, un metodo di ottimizzazione pensato proprio per scene dinamiche. Il confronto però avviene solo su ciò che supera entrambi i filtri: 8 sequenze su 23 e tutte le regioni in movimento sono escluse.

Si aggiunge una fase auto-supervisionata alla DINO su 18 milioni di video senza etichette: uno studente impara a imitare un maestro che vede gli stessi fotogrammi con aumentazioni diverse e in un altro ordine, mentre il maestro si aggiorna come media mobile dello studente, $\theta_T \leftarrow m\,\theta_T + (1-m)\,\theta_S$.

La curva che cercavano

Il risultato che dà senso al paper è la figura d’apertura. Portando il modello da 0,2 a 10 miliardi di parametri, e i dati da circa duemila a due milioni di sequenze a parità di token visti, l’errore sui punti 3D scende con regolarità. Sul solo asse dei dati, a passi di dieci volte, cala da 0,275 a 0,073. Nei risultati gli autori scrivono che la forma delle curve «suggerisce» una legge di potenza, senza stimarla; l’introduzione parla già di un miglioramento «simile a una legge di potenza».

Sui benchmark la versione da 10 miliardi supera tutti i confronti su tre insiemi statici e tre dinamici, spesso con margini larghi. Il caso più citato è Sintel. Sulle camere l’AUC@3° arriva a 40,0, contro 22,5 di MegaSaM, il migliore precedente: è il +77% del sommario. Sulla profondità, sempre su Sintel, il modello tocca 93,5 di $\delta_{1.25}$. L’introduzione lo confronta con il 74,1 di MegaSaM, ma Depth Anything 3, il concorrente più forte, era già a 86,1 (ed è il confronto che il paper fa nei risultati). Anche la versione da 1 miliardo, grande quanto DA3-Giant, sta davanti quasi ovunque. In inferenza, su una A100 da 80 GB, VGGT-Ω gestisce circa 1.250 fotogrammi contro i circa 750 di DA3, come VGGT con l’implementazione corretta, ed è più veloce: soprattutto perché i patch di DINOv3 riducono i token di circa un quarto, poi per la register attention (20–25%). Una variante con sola register attention scende da 240 a 12 secondi su mille fotogrammi, ma perde precisione fino al livello del VGGT originale.

I registri servono anche altrove

La parte più curiosa riguarda i sedici registri, che di solito nei vision transformer vengono buttati via. Congelati e aggiunti come input a OpenVLA-OFT, un modello che guida un braccio robotico, alzano il tasso di successo medio su LIBERO da 97,1 a 98,5%, e sui compiti lunghi da 94,5 a 96,7%. Allineati in stile CLIP alle descrizioni di un modello visione-linguaggio, recuperano la descrizione giusta al primo colpo nel 76,8% dei casi su un banco di prova di cento video scelti a mano. Il margine robotico è piccolo perché il punto di partenza era già vicino al tetto; il banco linguistico è minuscolo e costruito dagli autori. Sono indizi, e il paper li presenta come tali: la ricostruzione come «compito proxy» per imparare a capire lo spazio.

Che cosa resta da verificare

I dati non sono replicabili. Il salto di scala poggia su 40 milioni di video e su dataset interni di Meta: la filiera di annotazione, per quanto descritta con cura, gira su materiale che nessuno fuori può ottenere. Né lo è il calcolo: 128 H100 per 240mila iterazioni. Il testo rimanda a una pagina del progetto ma non dice se e con quale licenza i pesi saranno rilasciati.

La valutazione è su dieci fotogrammi. Ogni sequenza dei benchmark viene ridotta a dieci immagini campionate a caso: un’impostazione da ricostruzione sparsa, legittima, ma lontana dalle riprese lunghe dove conta la tenuta su migliaia di fotogrammi. Lì il paper misura memoria e tempi, non l’accuratezza.

L’auto-supervisione è onestamente ridimensionata. Sostituire il 10% dei passi supervisionati la porta da 0,073 a 0,070 di errore; gli autori scrivono che aiuta sui dati fuori distribuzione ma incide poco sui benchmark, e che tutti gli altri protocolli provati, dalla sintesi di nuove viste ai Gaussian splat, nella loro implementazione non hanno funzionato.

I casi difficili sono dichiarati. Mosso marcato, campo visivo che cambia bruscamente, ottiche molto distorte; e uffici pieni di monitor, colpa di dati rumorosi visti a inizio addestramento. Volti e marchi oscurati nei dati per ragioni di privacy e di licenza lasciano talvolta artefatti proprio lì. Gli autori rinunciano anche, per semplicità, a un 4–6% di AUC@3° che otterrebbero con l’affinamento iterativo delle camere di VGGT e altri accorgimenti.

L’ottimizzazione non è morta. In condizioni favorevoli il bundle adjustment stima le camere con errori di pochi centesimi di grado, e per NeRF e Gaussian splatting quella precisione conta. Il paper lo riconosce, e propone il feed-forward come punto di partenza per l’ottimizzazione, non come suo sostituto.

Perché conta adesso

Nel linguaggio e nella visione 2D i modelli di fondazione sono arrivati quando si è visto che più parametri e più dati danno, in modo prevedibile, modelli migliori. Nel 3D mancava una curva così, e mancava un estrattore di rappresentazioni geometriche generale come lo erano stati VGG16 o ResNet per le immagini. VGGT-Ω non chiude la questione: la curva è una media su sei dataset, con pochi punti per asse, e la ricetta dipende da dati che solo un’azienda come Meta possiede. Ma sposta il problema da «si può fare?» a «chi ha i dati e il calcolo per farlo?», che per robotica e world model è una domanda molto più concreta. E suggerisce che, come al congresso, buona parte della conversazione fra mille fotogrammi può passare per pochi delegati ben scelti. Non tutta, come mostra la variante con soli registri.

I commenti sono riservati agli iscritti.

Accedi per commentare