Raster2Seq: la planimetria ridisegnata angolo dopo angolo, come si scrive una frase

Le planimetrie nascono vettoriali nei programmi CAD e circolano come immagini, e l'immagine ha perso tutto quello che serviva a un calcolatore: dove finisce una stanza, che cosa è. Due ricercatori di Cornell trattano la ricostruzione come la generazione di un testo, una stanza dopo l'altra e un angolo dopo l'altro, con un'etichetta su ogni angolo. I numeri su quattro dataset, dove il metodo non vince e che cosa costa.

Chi ha comprato casa conosce il foglio che l’agenzia manda per email: una planimetria in PDF, spesso scansionata, a volte fotografata storta. Per un architetto che deve ristrutturare quel foglio è un punto di partenza scomodo. Prima di spostare un muro deve ridisegnarlo: ripassare con il mouse ogni parete, chiudere ogni stanza, scriverci dentro «cucina» o «bagno». E lo fa in un ordine preciso, senza pensarci: parte da un angolo, gira attorno alla stanza, la chiude, passa alla successiva.

È quel gesto che Raster2Seq: Polygon Sequence Generation for Floorplan Reconstruction prova a insegnare a una rete neurale. Il paper è su arXiv dal febbraio 2026 (2602.09016), oggi alla terza versione, datata 7 agosto; lo firmano Hao Phung e Hadar Averbuch-Elor, della Cornell University. L’idea di fondo è dichiarata già nel titolo: la planimetria non si ricostruisce tutta insieme, si scrive come una sequenza.

Un problema vecchio, con un collo di bottiglia nuovo

Le planimetrie nascono in formato vettoriale, dentro programmi come AutoCAD, ma di solito circolano come immagini. La rasterizzazione butta via proprio la struttura: un’immagine non sa dove finisce una stanza né che cosa sia. Riportarla a vettori, il compito che in letteratura si chiama raster-to-vector, è il prerequisito per tutto quello che viene dopo: modificare la pianta in automatico, analizzarla, ricostruirne un modello 3D.

I metodi recenti più forti vengono da un problema vicino, la ricostruzione di piante da scansioni 3D, e ragionano come i rilevatori di oggetti. RoomFormer, il riferimento principale del confronto, prepara un numero fisso di «domande» parallele al modello, 2800 nell’esempio che fanno gli autori, e ne abbina le risposte alle stanze vere con il matching ungherese. Funziona finché la pianta ci sta dentro. Quando le stanze e gli angoli superano la capacità prevista, non c’è modo di produrne di più; e allargare il budget costa, perché l’attenzione fra le domande cresce col quadrato del loro numero. Altri approcci passano per stadi intermedi, angoli e poi spigoli, oppure segmenti e poi stanze, e ogni stadio può sbagliare per conto suo.

Da dove vengono le «domande» fisse, perché serve il matching ungherese e che cosa sono le ancore nei rilevatori di oggetti: detection e segmentazione hanno un capitolo nel libro.

Leggi «Detection e segmentazione» nel libro →

La pianta come una frase

Raster2Seq cambia la domanda. Invece di chiedere al modello tutti i poligoni in una volta, gli chiede il prossimo angolo, sapendo quelli già scritti. Ogni angolo è un piccolo pacchetto, coordinate più etichetta:

$$c_i = (x_i,\, y_i,\, p_i), \qquad p_i \in [0,1]^C,$$

dove $p_i$ è la distribuzione di probabilità sulle $C$ categorie semantiche: camera, cucina, bagno, e anche porta e finestra, che il paper tratta semplicemente come due categorie in più. Le stanze si concatenano con un separatore, e la pianta intera diventa una sequenza del tipo $[\langle\mathrm{BOS}\rangle, c^1_1, c^1_2, \dots, \langle\mathrm{SEP}\rangle, c^2_1, \dots, \langle\mathrm{EOS}\rangle]$. La sequenza finisce quando il modello emette la fine: dieci stanze o quaranta, il numero non è fissato in anticipo. Un tetto, in pratica, resta: la lunghezza massima della sequenza, 512 token nella configurazione scelta.

Raster2Seq: la pianta scritta come una sequenza di angoli etichettati Immagine della pianta soggiorno camera bagno 1 2 3 4 angoli in senso antiorario, stanze dall’alto a sinistra La stessa pianta, come sequenza di token BOS 1 2 3 4 SEP SEP EOS stanze in numero libero ogni angolo = coordinate + etichetta propria; l’etichetta della stanza si decide a maggioranza Decoder autoregressivo con ancore 1. attenzione causale sugli angoli già scritti + immagine come prefisso 2. guarda pochi punti dell’immagine attorno a un’ancora appresa 3. tre teste: tipo di token, etichetta, scarto dall’ancora Schema semplificato dal paper; la pianta è illustrativa.

La macchina che scrive è un decoder autoregressivo, con l’attenzione mascherata che impedisce a ogni token di guardare avanti: lo stesso meccanismo dei modelli linguistici. Le novità stanno in tre dettagli. Il primo, che gli autori chiamano FeatFusion, è concatenare le caratteristiche dell’immagine davanti agli angoli già generati, così che l’immagine faccia da prefisso a cui ogni passo può guardare. Il secondo sono le ancore: 512 punti del piano, uno per ogni posizione della sequenza, inizializzati a caso e imparati con il resto della rete. Il modello non predice le coordinate da zero, predice uno scarto rispetto all’ancora, e l’ancora serve anche a un’attenzione «deformabile», che invece di guardare l’intera immagine campiona pochi punti attorno a quella posizione. Il terzo è l’ordine: in addestramento le stanze sono ordinate dall’alto in basso e da sinistra a destra, e il modello impara a girare attorno a ciascuna in senso antiorario.

Che cosa fa la maschera causale, perché un decoder genera un token alla volta e che ruolo ha la cache delle chiavi e dei valori: la struttura del Transformer è spiegata nel libro.

Leggi «La struttura del Transformer» nel libro →

L’etichetta, infine, non si assegna alla stanza intera ma a ogni angolo, e a fine stanza si vota a maggioranza. È una scelta dichiaratamente contrapposta ai predecessori: RoomFormer fa la media degli angoli di una stanza, compresi quelli di riempimento che servono a portare tutte le stanze alla stessa lunghezza, e così diluisce l’informazione. L’addestramento somma tre errori:

$$\mathcal{L} = \lambda_{\text{coord}}\,\mathcal{L}_{\text{coord}} + \lambda_{\text{token}}\,\mathcal{L}_{\text{token}} + \lambda_{\text{sem}}\,\mathcal{L}_{\text{sem}},$$

una distanza L1 sulle coordinate, una classificazione del tipo di token (angolo, separatore o fine) e una classificazione semantica per ogni angolo, con $\lambda_{\text{coord}} = 20$ e $\lambda_{\text{sem}} = 1$ nella configurazione di default.

I numeri

Il confronto usa tre dataset con annotazioni e un quarto solo per la prova zero-shot, su dati mai visti in addestramento. Structured3D, un dataset sintetico di nuvole di punti, è convertito dagli autori in immagini binarie di planimetria ricavate dalle annotazioni (lo chiamano Structured3D-B); CubiCasa5K raccoglie piante di case reali, che dopo la separazione delle tavole multiple diventano 6281 immagini; Raster2Graph ne ha quasi undicimila. Tutto a 256 per 256 pixel. Gli avversari (HEAT, PolyRoom, FRI-Net, RoomFormer) erano stati progettati per mappe di densità da scansioni e sono stati messi a punto sulle immagini raster; Raster2Graph è confrontato solo sul proprio dataset, perché richiede annotazioni che gli altri non hanno.

Sulla metrica principale, la F1 delle stanze ricostruite, Raster2Seq è primo ovunque, e anche sugli angoli è in testa.

Raster2Seq sui tre dataset F1 · più alto è meglio
Dataset Stanze Angoli
Structured3D-B 99,6 98,3
CubiCasa5K 88,7 RoomFormer 83,5 59,4
Raster2Graph 97,0 il metodo omonimo 95,0 80,3

Il dettaglio più interessante è però un grafico: finché la pianta è semplice i metodi si equivalgono, e il distacco si apre oltre i 15 poligoni o i 150 angoli, dove RoomFormer e FRI-Net calano; per RoomFormer gli autori lo attribuiscono al budget fisso di domande. La prova su WAFFLE, piante vere prese da internet (chiese, palazzi, una centrale elettrica) su cui nessun modello è stato addestrato, dà con i modelli addestrati su CubiCasa5K un’intersezione sull’unione di 73,9 contro 60,5 di RoomFormer e 56,7 di FRI-Net; le piante annotate di WAFFLE, però, sono circa un centinaio.

Le ablazioni, fatte su Structured3D-B con un addestramento più corto, dicono che ogni pezzo pesa: la F1 delle stanze sale a ogni aggiunta. L’ultimo passo, l’ordinamento, pesa soprattutto sull’orientamento degli angoli, la cui F1 sale da 86,0 a 92,7.

Che cosa aggiunge ogni pezzo F1 delle stanze, Structured3D-B, addestramento più corto
Configurazione F1 stanze
modello base 94,1
con FeatFusion 96,3
con le ancore 97,4
con l’ordinamento 99,6

Dove non vince, e che cosa costa

Non vince su tutto. Su CubiCasa5K la F1 di porte e finestre è 77,8 contro 78,5 di RoomFormer; sugli angoli orientati perde su due dataset, 37,4 contro 38,0 di FRI-Net su CubiCasa5K e 66,6 contro 67,3 di Raster2Graph sul suo dataset; e con mappe di densità in ingresso, lo scenario originale dei concorrenti, i risultati sono competitivi, non superiori: FRI-Net resta davanti sulle stanze (99,1 contro 98,8) e sugli angoli orientati (86,9 contro 84,2), anche se il testo dell’appendice parla di un vantaggio che la sua tabella non mostra. Su CubiCasa5K la metrica sugli angoli orientati resta bassa per tutti, segno che su piante reali e rumorose il problema è tutt’altro che risolto.

Porte e finestre sono il punto debole dichiarato. Gli autori mostrano esempi in cui il modello mette finestre in mezzo alle stanze, e suggeriscono di trattare questi elementi separatamente dai vani in lavori futuri. Il modello non impone vincoli geometrici: su CubiCasa5K, dove anche le annotazioni hanno stanze sovrapposte, le uscite ereditano gli stessi difetti.

La velocità è il prezzo dell’autoregressione. Una pianta richiede 0,52 secondi su una A6000, contro 0,04 di RoomFormer che la produce in un passaggio solo; è in linea con Raster2Graph (0,57). In compenso ha il throughput di addestramento più alto del confronto, 63 immagini al secondo contro 24 di RoomFormer (in tempo totale HEAT finisce comunque prima), e gli esperimenti stanno su una o due schede A6000.

La correzione con un modello linguistico è un esperimento, non un risultato. In appendice le piante prodotte vengono date in JSON a Gemini 2.5 Pro, con l’immagine e un grafo delle adiacenze, chiedendo pareti ortogonali e stanze senza buchi fra loro. La F1 sugli angoli sale da 54,0 a 59,0 e quella sull’orientamento da 33,0 a 45,1, ma quella sulle stanze scende da 83,7 a 81,7, e il test è su 30 piante scelte a caso. Resta interessante per un motivo: senza le etichette semantiche angoli e orientamento perdono circa 3 punti, segno, secondo gli autori, che il formato a sequenza etichettata si presta a essere passato a un altro modello.

Perché conta adesso

Il paper non inventa il paradigma: generare forme come sequenze è una scelta che la visione artificiale ha già fatto altrove, da Pix2Seq per la detection a PolyFormer per la segmentazione, e anche Raster2Graph procedeva per angoli successivi. Il suo contributo è mostrare dove quella scelta paga, cioè sulle piante grandi e irregolari che mettono in crisi i metodi a capacità fissa, e con quali accorgimenti pratici. La posta, per chi lavora sugli edifici, sta negli archivi: piante storiche disegnate a mano, catasti scansionati, annunci immobiliari, che oggi sono solo pixel. Un formato che ricostruisce stanze con il loro nome, e che un altro modello può leggere, correggere o usare per generare un volume 3D, è il tipo di ponte che serve. Il numero che più conta, però, non sta in una tabella: è quanto questi 73,9 su WAFFLE reggano davanti a un fondo d’archivio vero, fuori dai dataset.

I commenti sono riservati agli iscritti.

Accedi per commentare