WorldSculpt: una scena da settecento oggetti, generata un oggetto alla volta

I generatori di mondi 3D consegnano scene bellissime ma fuse in un blocco solo, dove una sedia non si può spostare perché non esiste come cosa a sé. Alaya Lab e l'Università di Tokyo prendono un generatore pensato per un oggetto e una foto, gli insegnano a guardare lo stesso oggetto da molte inquadrature e lo lanciano su scene da centinaia di pezzi, senza mai addestrarlo su una scena. I numeri, il benchmark nuovo e le condizioni che il metodo dà per scontate.

Chi ha dovuto fare l’inventario di una cantina conosce il metodo. Non si fotografa la cantina: si prende un oggetto alla volta, lo si guarda da tutti i lati da cui si riesce a vederlo, dietro la bicicletta, sopra lo scatolone, e se ne scrive la scheda. Dove un oggetto sta lo si segna a parte, con un’etichetta sullo scaffale. Alla fine la cantina è ancora quella, ma è diventata un elenco di cose che si possono prendere, spostare, regalare.

È il metodo che propone WorldSculpt: Generating Compositional Worlds from Grounded Videos, uscito su arXiv il 4 settembre 2026 (2609.05416, seconda versione il 7). Lo firmano dodici autori di Alaya Lab e dell’Università di Tokyo, con Muyao Niu primo autore e Zhixiang Wang responsabile del progetto e autore di riferimento con Kaipeng Zhang: lo stesso gruppo di KaiNinja, il generatore che consegna gli oggetti divisi in parti. Qui la scala è un’altra: gli oggetti di un mondo.

Un mondo bellissimo, e tutto d’un pezzo

Di recente i generatori di mondi, come Marble o HY-World 2.0, hanno imparato a costruire ambienti 3D esplorabili a partire da un’immagine o da una frase. Il risultato però è una rappresentazione unica: una mesh fusa o una nuvola di gaussiane in cui la sedia e il pavimento sotto la sedia sono lo stesso materiale. Per guardare va benissimo; per un videogioco, un simulatore fisico o un robot che deve prendere un vaso no.

Che cosa sono NeRF e 3D Gaussian splatting, e perché una scena ricostruita così si rende benissimo ma non si lascia smontare in oggetti: il libro li costruisce da capo.

Leggi «NeRF e splatting» nel libro →

Le strade esistenti coprono un pezzo di problema ciascuna. I metodi geometrici, come DUSt3R, ricostruiscono bene ciò che si vede e lasciano buchi dove un oggetto ne copre un altro. I generatori di oggetti come TRELLIS completano anche il lato nascosto, ma da una sola foto di un solo oggetto, senza sapere dove stia nel mondo. I metodi composizionali recenti (MIDI, SceneGen, SceneMaker) sono stati mostrati su scene semplici: qualche oggetto su un tavolo, pochi mobili. In una cantina vera ogni inquadratura mostra solo una frazione di ciascun oggetto.

Un oggetto, molte inquadrature, un cubo suo

La tesi del paper è che per una scena da centinaia di oggetti non serva un modello di scene. Basta un buon modello di oggetti, a cui si insegni a usare più viste. Il modello scelto è Pixal3D, un generatore 3D nativo costruito sull’ossatura di TRELLIS.2, che produce un oggetto con una cascata di stadi di flow matching. WorldSculpt ne usa i primi due, quelli della geometria: uno stima quali celle di una griglia $64^3$ sono occupate, l’altro genera un latente ad alta risoluzione solo su quelle celle, poi decodificato in mesh.

Il punto di partenza sono le immagini della scena con le pose della camera note, una maschera per ogni oggetto in ogni vista in cui compare e una scatola 3D approssimativa che dice dove sta. È il senso di «grounded» nel titolo, e il paper lo dichiara: recuperare pose, maschere e scatole sta fuori dal lavoro.

Per ogni oggetto si sceglie poi una vista àncora, quella in cui si vede più per intero, e si costruisce attorno all’oggetto un cubo virtuale orientato come la camera dell’àncora. Il generatore lavora sempre dentro quel cubo normalizzato, come se l’oggetto fosse solo al mondo. Rimetterlo nella scena è una similitudine: una scala uniforme, una rotazione, una traslazione,

$$x^w_k = s_k R_k\, x + c_k,$$

dove $c_k$ è il centro della scatola, $R_k$ viene dalla camera àncora e $s_k$ parte dal lato più lungo della scatola e si allarga finché la proiezione del cubo copre la maschera dell’oggetto in tutte le viste. È l’etichetta sullo scaffale dell’inventario: la scheda dell’oggetto e il suo posto viaggiano separati.

Il paper proietta ogni cella del cubo in ogni immagine con i parametri intrinseci ed estrinseci della camera. Come si passa da un punto 3D a un pixel, e perché serve conoscere la posa, è nel capitolo sulla geometria delle immagini.

Leggi «Geometria e profondità» nel libro →

Il resto è il modo di far entrare le viste nel generatore. Ogni ritaglio dell’oggetto, mascherato e ridimensionato, passa per DINOv3, che ne estrae una mappa di feature. Ogni cella del cubo va a leggere la feature nel punto dell’immagine in cui cade: così le viste diverse finiscono allineate sulla stessa griglia 3D prima di essere messe insieme. La fusione è un modulo nello stile di IBRNet, che accetta un numero qualsiasi di viste in qualsiasi ordine:

$$g_{\text{out}}(x) = \mu(x) + \sum_{n} \alpha_n(x)\, g’_n(x),$$

la media delle viste più una correzione pesata, dove i pesi $\alpha_n$ sono un softmax appreso cella per cella. L’ultimo strato che produce la correzione parte da zero: all’inizio dell’addestramento il modulo è una media esatta, e impara via via a pesare le viste in modo diverso, cosa che secondo gli autori conta quando non sono tutte ugualmente affidabili.

La griglia fusa entra nei due stadi di Pixal3D attraverso proiezioni inizializzate a zero, sommate alle feature di ogni blocco del transformer. I pesi originali restano congelati; si adattano con LoRA (rango 32) l’attenzione e le proiezioni di ogni blocco, mentre aggregatore e iniezione si addestrano per intero. La vista àncora continua ad arrivare anche per la vecchia strada, i token d’immagine globali, così il modello ritrova la convenzione a una foto con cui era stato addestrato.

WorldSculpt: la scena come inventario di oggetti 1 · la scena viste con posa nota maschere per oggetto scatola 3D approssimativa (fornite a monte, non stimate qui) 2 · un oggetto alla volta cubo orientato sulla vista àncora feature DINOv3 proiettate nelle celle media + correzione pesata per vista Pixal3D congelato + LoRA occupazione 64³ → forma fine → mesh addestrato solo su oggetti singoli, mai su scene 3 · al suo posto scala · rotazione · traslazione mesh separate, stesso mondo ogni oggetto resta selezionabile e spostabile si ripete per ogni oggetto della scena (fino a 701), senza fondere nulla fra oggetti

Come si allena un modello di oggetti a reggere il disordine

Il dettaglio che rende il paper interessante è che il modello non vede mai una scena durante l’addestramento. Lo si adatta su oggetti singoli del dataset TexVerse, 15.000 iterazioni per ciascuno dei due stadi, pescando ogni volta da 1 a 20 viste e un’àncora a caso. Il divario fra un oggetto renderizzato pulito e lo stesso oggetto intravisto dietro una pila di scatole si colma con un programma di degradazioni applicate solo agli ingressi: occlusioni, sia come macchie 2D sia come ostacoli 3D che si muovono in modo coerente da una vista all’altra; pose delle viste non àncora perturbate; bordi delle maschere sporcati; immagini rimpicciolite, come per un oggetto che occupa pochi pixel. L’intensità cresce da zero al massimo nelle prime 3.000 iterazioni.

I numeri

Le prove salgono di difficoltà in tre gradini, e le metriche principali sono la distanza di Chamfer (quanto la superficie generata dista da quella vera, più bassa è meglio) e l’F-Score (la quota di superficie ricostruita entro una tolleranza, più alta è meglio).

Oggetti singoli. Su 500 oggetti di Toys4k, con una sola vista pulita WorldSculpt è leggermente dietro a Pixal3D originale: CD-ℓ2 di 2,59 contro 2,17 (in unità di $10^{-3}$). È il prezzo, piccolo, di un modello addestrato per molte viste. Poi le viste diventano un vantaggio, soprattutto quando sono coperte. Con il 75% di ogni vista occluso, Pixal3D da una foto arriva a 63,95; WorldSculpt scende a 25,45 con una vista, 10,03 con due, 2,25 con sedici. TRELLIS nella sua modalità multi-immagine, con le stesse sedici viste, resta a 34,39. Con sedici viste, passare da immagini pulite a immagini coperte per metà sposta l’errore da 1,19 a 1,44.

Scene con pochi oggetti. Su HouseCat6D, riprese reali di tavoli con oggetti scansionati, WorldSculpt stacca ShapeR, il concorrente più vicino, e di molto RecGen, che si ferma a una CD-ℓ2 di 7,22. Su Toys4k-Scene, sintetico, con pochi oggetti ma occlusioni molto più forti, il distacco da ShapeR si allarga. Qui gli oggetti sono confrontati direttamente nel sistema del mondo, senza riallinearli uno per uno: conta anche dove vengono messi, non solo la forma.

Scene con pochi oggetti CD-ℓ2 più bassa è meglio · F-Score più alto è meglio
Metrica WorldSculpt ShapeR
HouseCat6D, riprese reali
CD-ℓ2 0,28 1,26
F-Score 0,995 0,973
Toys4k-Scene, sintetico
CD-ℓ2 0,61 8,38
F-Score 0,981 0,746

Scene da centinaia di oggetti. Per l’ultimo gradino gli autori costruiscono UE-MeshyScene: sei ambienti realizzati in Unreal Engine 5.8 (un hangar, l’interno di una città abbandonata, una cattedrale, un ufficio, una scuola giapponese, una cittadina nel deserto), da 93 a 701 oggetti ciascuno, 2.299 oggetti e 5.964 fotogrammi a 2560×1440 in tutto, con mesh vere, pose, maschere, scatole e profondità per ogni fotogramma. Il confronto è solo con ShapeR, scelto perché sa usare più viste, e WorldSculpt è davanti su tutte e tre le misure. Che il guadagno sia più netto sulla mediana, notano gli autori, dice che non dipende da pochi oggetti difficili. Vale anche il rovescio: la media di WorldSculpt è dieci volte la sua mediana, quindi una minoranza di oggetti resta sbagliata di molto.

UE-MeshyScene, centinaia di oggetti per scena CD-ℓ2 più bassa è meglio · F-Score più alto è meglio
Metrica WorldSculpt ShapeR
CD-ℓ2 media 2,48 7,42
CD-ℓ2 mediana 0,25 2,47
F-Score 0,951 0,813

Oggetti coperti al 75%: l’errore scende con le viste distanza di Chamfer CD-ℓ2 (×10⁻³, più bassa è meglio) · Toys4k, 500 oggetti Pixal3D · 1 vista 63,95 TRELLIS · 16 viste 34,39 WorldSculpt · 1 vista 25,45 WorldSculpt · 2 viste 10,03 WorldSculpt · 4 viste 5,67 WorldSculpt · 8 viste 3,52 WorldSculpt · 16 viste 2,25

L’ablazione sull’aggregatore va nella stessa direzione. Sostituirlo con una media semplice non cambia quasi nulla su HouseCat6D, dove gli oggetti si vedono bene (la media è anzi un filo migliore sulla CD-ℓ2, 0,27 contro 0,28); su UE-MeshyScene l’aggregatore appreso toglie il 12% dell’errore e porta l’F-Score da 0,944 a 0,951.

C’è infine una prova di fattibilità: gli autori prendono un mondo generato da Marble, ne renderizzano una sequenza di viste con profondità, segmentano gli oggetti con SAM 3, ricavano le scatole e passano tutto a WorldSculpt senza riaddestrarlo. Ne esce una scena di mesh separate. È una dimostrazione solo visiva, senza numeri, ma mostra il ruolo che il metodo si ritaglia: non generare mondi, rendere smontabili quelli che altri generano.

Che cosa resta fuori

I limiti dichiarati sono tre. Il primo è la dipendenza da ciò che arriva a monte: l’addestramento con degradazioni rende il metodo più robusto a errori moderati di pose, maschere e scatole, non a quelli grandi, e riprese al buio o mosse non sono state modellate. Il secondo è che il metodo genera solo geometria: niente colori né materiali, anche se Pixal3D e TRELLIS.2 li saprebbero produrre. Il terzo è che la scena deve essere ferma, perché ogni vista è trattata come una misura dello stesso oggetto nella stessa posa.

A questi si aggiungono cose che dal paper non si ricavano. UE-MeshyScene è un benchmark degli autori, sintetico, e il confronto su quel terreno è con un solo concorrente. Il testo non dice se nei test di scena maschere e scatole siano quelle annotate o stimate da una pipeline reale, e il benchmark le fornisce esatte: il caso d’uso che dà il titolo, un video qualunque, passa per strumenti di cui non si misura l’errore. Non sono riportati nemmeno i tempi di generazione, che su settecento oggetti generati uno alla volta non sono un dettaglio. Codice d’inferenza, pesi e le sei scene del benchmark sono pubblici.

Resta la tesi, che è la parte più utile del lavoro: un generatore di oggetti addestrato su oggetti, se gli si dà modo di guardare da più lati, regge scene da centinaia di pezzi senza aver mai visto una scena. Se la cosa tiene fuori dai benchmark, il collo di bottiglia dei mondi 3D per giochi, simulatori e robot si sposta dalla generazione all’inventario: sapere, con precisione, dove stanno le cose e dove finisce ciascuna.

I commenti sono riservati agli iscritti.

Accedi per commentare