Un traslocatore esperto guarda la foto di un soggiorno mandata su WhatsApp e deve dire se l’armadio passerà dalla porta. Riconoscere l’armadio è la parte facile. Il difficile è tutto il resto: quanto è alto, quanto è profondo, di quanto è girato rispetto al muro. Dalla foto sola può solo stimare, affidandosi a quello che sa degli armadi in generale. Se però il cliente gli manda anche un paio di misure prese col metro, la stima cambia natura: non indovina più, ricostruisce.
È il mestiere che WildDet3D: Scaling Promptable 3D Detection in the Wild, depositato su arXiv il 9 aprile 2026 (2604.08626) e rivisto il 17 aprile, prova a insegnare a una rete neurale per migliaia di categorie di oggetti. Lo firma un gruppo dell’Allen Institute for AI (Ai2) e dell’Università di Washington, con Cornell, UNC-Chapel Hill e Johns Hopkins; i contributori principali sono Weikai Huang, Jieyu Zhang, Zhongzheng Ren e Ranjay Krishna, e fra gli autori c’è Ali Farhadi. Insieme al paper escono il modello, il codice, i dati, due benchmark, una demo su Hugging Face e un’app per iPhone.
Il salto dal rettangolo al parallelepipedo
La detection a due dimensioni è ormai un problema maturo: un modello riceve un’immagine e restituisce i rettangoli degli oggetti, spesso per qualunque categoria gli si nomini. La detection 3D monoculare chiede molto di più alla stessa immagine: per ogni oggetto un parallelepipedo con il centro in metri, le tre dimensioni fisiche e un orientamento completo nello spazio. Il problema è mal posto in partenza. Un oggetto piccolo e vicino e uno grande e lontano producono la stessa immagine, e nessun pixel da solo dice quale dei due si ha davanti.
Qui si dà per nota la detection classica: riquadri, punteggi di confidenza, la misura di sovrapposizione IoU con cui si decide se una previsione è giusta. Il libro la costruisce dall’inizio.
Gli autori mettono in fila tre requisiti che nessun sistema precedente soddisfaceva insieme. Il rilevatore deve funzionare fuori dal laboratorio, su categorie rare o mai viste. Deve accettare più modi di chiedere: un robot riceve un comando a parole («prendi la tazza»), un’interfaccia di realtà aumentata un tocco del dito, e un altro rilevatore a monte può passare un riquadro 2D da trasformare in 3D. E deve saper usare la profondità quando c’è, da un LiDAR, da una coppia stereo o da un sensore di profondità, senza smettere di funzionare quando non c’è. I metodi aperti al vocabolario libero, come 3D-MOOD, si interrogano col testo; quelli come DetAny3D partono da un riquadro dato. Nessuno dei due accoglie una misura di profondità in più.
Due encoder, un indirizzo solo
L’architettura tiene separati il riconoscere e il misurare. Un primo encoder, un ViT-H preso da SAM 3, il modello di segmentazione di Meta, estrae le caratteristiche semantiche: che cosa c’è e dove sta nell’immagine. Un secondo encoder, un DINOv2 ViT-L preso da LingBot-Depth e preaddestrato a completare mappe di profondità, riceve l’immagine più un quarto canale di profondità, che resta a zero quando nessun sensore la fornisce. In quel caso la geometria viene stimata dalla sola immagine. La ragione della separazione, secondo gli autori, è pratica: un encoder unico ottimizzato per entrambe le cose peggiorerebbe l’una per migliorare l’altra, e legherebbe l’intero modello a un solo stimatore di profondità.
Le due correnti si riuniscono con un innesto in stile ControlNet. Le caratteristiche geometriche $Z_d$, riportate alla risoluzione di quelle visive $V$, vengono normalizzate, proiettate e sommate:
$$V’ = V + \mathrm{Conv}_{1\times 1}\big(\mathrm{LN}(Z_d^{\uparrow})\big)$$
La convoluzione parte con pesi a zero, quindi all’inizio dell’addestramento $V’ = V$: il contributo della profondità si impara piano, senza guastare quello che l’encoder semantico sapeva già. Per insegnare al modello a vivere con o senza sensore, in addestramento la profondità viene tolta del tutto nel 70% dei casi, fornita a pezzi nel 20% e completa nel restante 10%.
Perché da una sola immagine la distanza non si può misurare ma solo stimare, e che cosa aggiungono una seconda vista o un sensore: la geometria della camera e della profondità è nel libro.
Leggi «Dove sono le cose: geometria, corrispondenze e profondità» nel libro →
Sopra questa rappresentazione lavora un rilevatore «a richiesta» che eredita da SAM 3 il modo di codificare le domande. Si può scrivere il nome di una categoria (e il modello trova tutte le istanze), cliccare su un punto o disegnare un riquadro (e trova quell’oggetto), oppure indicare un riquadro come esempio (e trova tutti gli oggetti che gli somigliano). Una testa 2D localizza l’oggetto nell’immagine, una testa 3D la segue e aggiunge profondità, dimensioni e rotazione, consultando i raggi della camera e le caratteristiche di profondità. Contano anche i dettagli poco vistosi: una scatola ruotata di 90 gradi, con larghezza e lunghezza scambiate, è la stessa scatola, e senza una convenzione fissa la rete dovrebbe imparare quattro risposte equivalenti; gli autori la fissano prima di calcolare l’errore.
Un milione di immagini sollevate in 3D
La parte che probabilmente durerà di più sono i dati. Annotare in 3D costa molto più che in 2D, perché servono profondità metrica e parametri della camera, e infatti il riferimento del settore, Omni3D, ha 98 categorie concentrate fra guida autonoma e arredamento. WildDet3D-Data parte da ciò che esiste già in 2D: i riquadri di COCO, LVIS, Objects365 e V3Det. Per ogni immagine una catena di modelli stima profondità e camera; cinque metodi diversi, fra cui SAM-3D e un adattamento geometrico puro basato su RANSAC e PCA, propongono fino a cinque parallelepipedi candidati per ogni riquadro 2D; filtri geometrici e semantici scartano i candidati implausibili, compresi i poster e i riflessi, che raffigurano un oggetto senza esserlo. Un LLM fornisce per ogni categoria le misure plausibili, così un gatto lungo tre metri non passa.
Il risultato: 1.003.886 immagini, 3,7 milioni di annotazioni valide, 13.499 categorie, 138 volte quelle di Omni3D. Qui però conviene leggere la tabella e non solo l’abstract, che parla di box «verificati da persone». Le persone, reclutate su Prolific e controllate con compiti trappola, hanno scelto il candidato migliore su circa 103.000 immagini. Le altre 896.000 sono state selezionate da un modello visione-linguaggio, Molmo2 adattato al compito, che assegna a ogni candidato un punteggio fino a 11 e lo tiene solo a punteggio pieno. Gli autori misurano quanto fidarsi di quel giudice: a punteggio 10 gli annotatori umani scartano ancora il 16,7% dei candidati, a 11 il 9,2%. La parte automatica del dataset è quindi buona ma non pulita, e il paper lo dice.
I numeri
Sul benchmark nuovo, WildDet3D-Bench, con oltre 700 categorie e annotazioni controllate da persone, la differenza rispetto al passato è netta. Richiesto col testo, 3D-MOOD arriva a 2,3 di AP; WildDet3D addestrato sugli stessi dati di Omni3D a 6,8; con i dati nuovi, più altri quattro dataset 3D, a 22,6; con la profondità «vera» fornita al momento dell’uso a 41,6. Col riquadro come richiesta i valori salgono a 24,8 e 47,2. Il guadagno maggiore sta proprio nelle categorie rare.
Su Omni3D il modello arriva a 34,2 di AP col testo, contro il 30,0 del miglior 3D-MOOD, e a 36,4 col riquadro, contro il 34,4 di DetAny3D; col riquadro più la profondità dei sensori a 45,8. Gli autori insistono sull’efficienza, 12 epoche contro le 80–120 dei concorrenti, ma ne attribuiscono loro stessi il merito alle rappresentazioni preaddestrate di SAM 3 e LingBot-Depth, il cui costo non entra nel conto delle epoche. Il trasferimento a dataset mai visti è il risultato più forte. Con il modello addestrato solo su Omni3D, l’Open Detection Score (che combina AP ed errori di posizione, scala e orientamento) passa su Argoverse 2 da 23,8 del miglior 3D-MOOD a 40,3, e su ScanNet da 31,5 a 48,9.
Le ablazioni dicono dove sta il lavoro. Togliere la testa 2D e far predire i parallelepipedi direttamente fa crollare l’AP su Omni3D da 30,2 a 11,1: il riquadro nell’immagine è l’ancora su cui si regge tutto il resto. Le altre componenti valgono da pochi decimi a 2,5 punti.
I limiti
Non vince ovunque. Nella tabella di Omni3D con richiesta testuale, WildDet3D fa 60,5 su Objectron contro il 67,9 di 3D-MOOD, e su nuScenes resta sotto sia col testo sia col riquadro. Su Stereo4D, senza profondità, arriva a 7,5 di AP, sotto il 9,9 di OVMono3D-LIFT.
La profondità fa gran parte del lavoro, e quella «vera» va letta con cautela. Il salto da 22,6 a 41,6 misura anche quanto la stima dalla sola foto resti il collo di bottiglia, come ammettono gli autori: oggetti lontani o molto occlusi restano difficili, e quando i parametri della camera vanno stimati invece che forniti la localizzazione peggiora. Il paper però non dice da dove venga la profondità «vera» di WildDet3D-Bench. Le sue foto vengono da COCO, LVIS e Objects365, senza misure di profondità, e i loro parallelepipedi sono stati ricavati da una mappa di profondità stimata da un modello: se è quella, una parte del salto misura la coerenza con il modo in cui sono state fatte le annotazioni. Il controllo più pulito è Stereo4D, dove la profondità viene da una coppia stereo: lì l’AP passa da 7,5 a 27,7, ma su 383 immagini.
La rotazione è la parte più debole, soprattutto per oggetti quasi simmetrici come tavoli rotondi e scatole quadrate, e le categorie rare hanno ancora risultati molto variabili.
Non gira sul telefono, benché l’introduzione parli di inferenza «on-device». I due encoder in parallelo pesano: l’app per iPhone manda immagini e profondità LiDAR a un server remoto, e secondo gli autori il modello completo è troppo grande per l’inferenza in tempo reale sul dispositivo senza distillazione o quantizzazione. Tutte le dimostrazioni, dall’iPhone al Meta Quest 3 al braccio robotico Franka, sono presentate esplicitamente come prototipi di ricerca, senza garanzie sull’errore e non adatti ad applicazioni critiche per la sicurezza.
Perché conta adesso
La visione in 2D ha fatto il suo salto quando i rilevatori hanno smesso di conoscere solo un elenco chiuso di categorie e hanno cominciato ad accettare richieste in linguaggio naturale. WildDet3D prova a portare lo stesso passaggio nello spazio, e la sua mossa più interessante è forse la più modesta: la possibilità di ricevere un riquadro 2D da chiunque. Gli autori la mostrano con un modello visione-linguaggio che ragiona su una domanda come «qual è l’oggetto più costoso?», indica un riquadro, e lascia a WildDet3D il compito di trasformarlo in un parallelepipedo in metri. Il ragionamento resta al modello linguistico, la geometria a uno strumento specializzato. Se questa divisione del lavoro regge, a robot e visori potrebbe servire meno un modello che fa tutto e più un buon traduttore dal piano allo spazio. Con i pesi e il milione di immagini pubblici, verificare se WildDet3D lo è davvero non dipende più solo da chi l’ha scritto.

I commenti sono riservati agli iscritti.
Accedi per commentare