Chi ha dato un appuntamento per telefono conosce le due strade. Si può dettare l’indirizzo, una parola alla volta, con l’altro che ripete e a volte sbaglia. Oppure si manda la posizione sulla mappa, un punto solo, che arriva intero. La prima strada funziona, ma è lenta e fragile; la seconda tratta il luogo per quello che è, una cosa sola.
I modelli visione-linguaggio, quando devono indicare dove sta un oggetto in un’immagine, oggi dettano. Il riquadro che lo circonda, quattro numeri (angolo in alto a sinistra, angolo in basso a destra), esce come una fila di token, uno dopo l’altro. LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding, uscito su arXiv il 26 maggio 2026 (2605.27365), propone di mandare il pin. Lo firma un gruppo di NVIDIA con Hong Kong Polytechnic University, Princeton, l’Università di Nanchino e l’Università dell’Illinois; primo autore Shihao Wang, autore corrispondente Zhiding Yu. Gli autori annunciano codice, pesi e una demo su GitHub e Hugging Face.
Perché conta adesso
Il grounding, trovare nell’immagine la cosa che una frase descrive, era il mestiere dei rivelatori specializzati: reti spesso addestrate su un elenco chiuso di categorie, veloci e precise, ma poco adatte a capire «la tazza a sinistra del portatile». I modelli visione-linguaggio capiscono la frase, e per questo stanno diventando lo strato di percezione di agenti che usano il computer, di robot, di pipeline che leggono documenti. Ma un agente che deve cliccare un’icona, o un braccio che deve afferrare un oggetto, ha bisogno di coordinate precise e le vuole in fretta.
La dettatura costa su entrambi i fronti. Gli autori distinguono due modi in uso. Il primo scrive le coordinate come testo, cifra per cifra: «1024» diventa «1», «0», «2», «4». È la scelta di Qwen3-VL e di buona parte dei modelli generalisti. Il secondo quantizza ogni coordinata in un token dedicato, e il riquadro costa quattro passi invece di una dozzina: è la scelta di Rex-Omni, il lavoro più vicino a questo. In tutti e due i casi un oggetto bidimensionale viene srotolato in una fila, e le quattro coordinate, che dipendono strettamente l’una dall’altra, vengono imparate e generate quasi come se fossero indipendenti. In una scena con trecento oggetti, i passi di generazione si moltiplicano.
Che cos’è un riquadro di detection, come si misura la sovrapposizione con l’intersezione sull’unione e perché una soglia di 0,95 è molto più severa di una di 0,5: tutto questo è costruito da capo nel libro.
Il riquadro come unità
La via ovvia per accelerare sarebbe la multi-token prediction già usata nei modelli linguistici: prevedere più token per passo, a blocchi di lunghezza fissa, o per mascheramento e ricostruzione come nei modelli a diffusione. Il paper sostiene, e poi misura, che applicata alle coordinate funziona male. Quelle tecniche tagliano la sequenza in pezzi arbitrari: un blocco di sei token può cominciare a metà di un riquadro e finire dentro il nome della categoria successiva. Il modello impara allora correlazioni spurie, nell’esempio del paper la coda del riquadro di una nave legata all’inizio della parola «cat», e l’errore si propaga.
La proposta, che gli autori chiamano Parallel Box Decoding, allinea invece i blocchi alla geometria. Ogni blocco ha lunghezza fissa $L = 6$: il marcatore di apertura, le quattro coordinate normalizzate e discretizzate nell’intervallo da 0 a 1000, il marcatore di chiusura. Le posizioni vuote si riempiono con un token nullo, così che tutti i blocchi abbiano la stessa forma. Esistono quattro tipi di blocco: semantico (il nome dell’oggetto, spezzato su più blocchi se è lungo), riquadro, negativo (l’oggetto richiesto non c’è) e fine. L’uscita diventa una sequenza di blocchi $B = (b_1, \dots, b_N)$, generata così:
$$P(B \mid Z, E) = \prod_{i=1}^{N} P(b_i \mid b_{\lt i}, Z, E),$$
dove $Z$ sono le caratteristiche visive e $E$ la domanda in linguaggio naturale. Fra un blocco e l’altro la generazione resta autoregressiva, e ogni riquadro vede quelli già scritti: secondo gli autori è ciò che limita doppioni e oggetti dimenticati. Dentro il blocco, invece, i token si guardano tutti a vicenda e il riquadro esce intero, in un solo passaggio in avanti.
Due scritture dello stesso riquadro
Il punto delicato è l’addestramento. Insegnare al modello a scrivere tutto in parallelo rischia di rovinargli la capacità di ragionare in sequenza. Gli autori mettono allora nella stessa sequenza di addestramento la risposta due volte: una nella forma classica, token dopo token, e una nella forma a blocchi, dove di ogni blocco resta visibile solo il primo token e gli altri sono mascherati da indovinare. Una maschera d’attenzione tiene separate le due copie, che condividono però l’immagine e la domanda. La perdita è la somma delle due:
$$\mathcal{L} = \mathcal{L}_{\text{ntp}} + \mathcal{L}_{\text{mtp}}.$$
Il risultato è un modello che sa fare entrambe le cose e offre tre modalità. La lenta genera token per token, per quando conta solo la precisione. La veloce genera un riquadro per passo. La ibrida, quella di default in tutti i risultati principali, parte veloce e ripiega sulla lenta, solo per il blocco incriminato, quando qualcosa non torna.
Che cosa non torna, il paper lo descrive con precisione. Il primo guasto è di forma: nelle scene con molte categorie il modello esita al confine fra una classe e l’altra e produce blocchi malformati, con un marcatore di chiusura della categoria in mezzo alle coordinate. Il secondo è di spazio: quando gli oggetti sono allineati a griglia, in file o colonne regolari, la previsione parallela può fermarsi a metà fra due oggetti. Questo si riconosce con una regola semplice: scatta quando la coordinata più probabile ha probabilità sotto 0,7 e, insieme, le cinque candidate più probabili distano fra loro più di 80 unità su 1000. Il blocco viene scartato e riscritto token per token, poi si torna in parallelo.
I numeri
LocateAnything-3B unisce un codificatore visivo MoonViT a risoluzione nativa e un decodificatore Qwen2.5, addestrati su un dataset raccolto per l’occasione: 12 milioni di immagini, 138 milioni di domande, 785 milioni di riquadri annotati. Le domande sono per due terzi di detection generica, per il resto interfacce grafiche, espressioni referenziali, testo, impaginati e punti. La velocità è misurata in riquadri al secondo su una sola H100, con batch di uno e, precisa l’appendice, solo sulle immagini di COCO.
In modalità ibrida il modello produce 12,7 riquadri al secondo, contro 5,0 di Rex-Omni e 1,1 di Qwen3-VL-4B: due volte e mezza il primo, più di dieci volte il secondo. Sulla detection generica la F1 media sulle soglie di sovrapposizione sale rispetto a Rex-Omni, a parità di dimensioni; sulle scene affollate di VisDrone, riprese da drone, passa da 35,8 a 39,9. Su ScreenSpot-Pro, il banco di prova per cliccare nelle interfacce di software professionali, supera GUI-Owl-32B, un modello dieci volte più grande. Negli impaginati di documenti la distanza da Rex-Omni è larga.
| Banco | LocateAnything | Confronto |
|---|---|---|
| Detection generica | ||
| LVIS | 50,7 | 46,9 Rex-Omni |
| COCO | 54,7 | 52,9 Rex-Omni |
| Interfacce grafiche | ||
| ScreenSpot-Pro | 60,3 | 58,0 GUI-Owl-32B |
| Impaginati di documenti | ||
| DocLayNet | 76,8 | 70,7 Rex-Omni |
| M6Doc | 70,1 | 55,6 Rex-Omni |
L’ablazione più pulita è quella che isola il metodo dai dati: tutti i modelli addestrati sul solo COCO. Il Parallel Box Decoding in modalità lenta, alla stessa velocità dei token quantizzati, fa meglio delle due scritture in sequenza; addestrato con la sola perdita classica, invece, torna al livello dei token quantizzati. L’addestramento sui blocchi insegna meglio anche quando poi si genera in sequenza. In modalità veloce guadagna velocità e cede qualcosa in F1; l’ibrida sta a metà. Le tecniche di predizione multipla non allineate ai riquadri restano dietro la modalità veloce su tutti e due gli assi.
| Metodo | F1 | Riquadri al secondo |
|---|---|---|
| Una coordinata alla volta | ||
| Cifre di testo | 49,1 | 1,3 |
| Token quantizzati | 50,1 | 3,9 |
| Parallel Box Decoding | ||
| Modalità lenta | 52,1 50,1 con la sola perdita classica | come i token quantizzati |
| Modalità veloce | 49,6 | 16,9 |
| Modalità ibrida | 51,6 | 13,2 |
| Predizione multipla a blocchi fissi | ||
| SDLM, blocchi da sei | 46,1 | 5,5 |
| Block Diffusion | 44,8 | 4,7 |
E il vantaggio cresce con l’affollamento: passando da 20 a 300 riquadri per immagine la versione parallela sale da 12 a circa 25 riquadri al secondo, mentre per i metodi sequenziali il tempo di generazione cresce nettamente.
Dove perde, e che cosa manca
La precisione migliora soprattutto dove la soglia è severa, e non ovunque. All’intersezione sull’unione di 0,95 LocateAnything stacca Rex-Omni sia su COCO sia su LVIS; alla soglia larga di 0,5 fa invece un po’ peggio.
| Banco e soglia | LocateAnything | Rex-Omni |
|---|---|---|
| COCO | ||
| Soglia 0,95 | 19,3 | 15,9 |
| Soglia 0,5 | 70,1 | 72,0 |
| LVIS | ||
| Soglia 0,95 | 31,1 | 20,7 |
| Soglia 0,5 | 62,3 | 64,3 |
Su Dense200 la F1 media è di fatto pari, 58,7 contro 58,3, e a 0,5 resta sotto (74,0 contro 78,4). Su HumanRef, il test di espressioni referenziali sulle persone, il suo 78,7 resta sotto Rex-Omni (79,9) e SEED1.5-VL (81,6), cosa che il testo del paper non sottolinea. Negli impaginati il rivelatore specializzato DocLayout-YOLO resta davanti su DocLayNet, con 81,1.
Ci sono poi domande che il paper lascia aperte. Quanto spesso scatti il ripiego sulla modalità lenta non è detto, e la velocità è misurata solo su COCO: quanto l’ibrida rallenti su scene diverse resta da vedere. L’appendice mette a confronto le tre modalità, 15,3 riquadri al secondo la veloce e 4,3 la lenta, che è la più precisa nella maggior parte dei banchi. Sulla lettura del testo il distacco è netto, 64,4 contro 39,3 dell’ibrida su SROIE e 43,2 contro 29,1 su HierText: segno che lì il controllo lascia passare molti errori. E le cifre dell’ibrida in appendice non coincidono con quelle delle tabelle principali (su Dense200, 61,3 contro 58,7), senza che il paper lo spieghi. Il batch di uno dice molto della latenza per un agente, poco del rendimento su un server con molte richieste. E il confronto con i modelli generalisti mescola due effetti, il metodo e i 138 milioni di esempi: l’ablazione su COCO separa il primo, ma nessun esperimento dice quanto del vantaggio sugli altri banchi venga dai dati. Gli autori stessi dichiarano un limite: il modello è addestrato soprattutto per imitazione, con fine-tuning supervisionato, e l’apprendimento per rinforzo è secondo loro il passo successivo per ridurre i ripieghi nei casi densi e a coda lunga.
La posta
La lezione che resta va oltre la detection. Parallelizzare la generazione è diventato uno dei cantieri principali, dai modelli a diffusione alla predizione di più token per passo, e di solito si ragiona su blocchi di lunghezza fissa, indifferenti a ciò che contengono. LocateAnything mostra, almeno per i riquadri, che quando l’uscita ha una struttura, conviene tagliare i blocchi lungo quella struttura: si guadagna velocità e, nella stessa mossa, un segnale di addestramento più pulito. Per chi costruisce agenti che devono vedere e agire, la differenza fra dettare un riquadro in dodici passi e mandarlo in uno solo non è un dettaglio da benchmark. È il margine che separa un modello che capisce una scena da uno che fa in tempo a usarla.

I commenti sono riservati agli iscritti.
Accedi per commentare