Chiunque abbia fatto un compito in classe di matematica conosce l’errore più beffardo: copiare male i dati dalla lavagna. Il 3 diventa un 5, il lato opposto a un angolo finisce accanto a un altro. Da lì in poi il ragionamento può essere impeccabile, e il risultato resta sbagliato. Peggio: quando i conti non tornano si ricontrolla il procedimento, riga per riga, ma non il numero copiato. Si pensa di più, e si continua a vedere la stessa cosa.
È il fenomeno da cui parte From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models, uscito su arXiv il 19 maggio 2026 (2605.20177) e accettato a ICML 2026. Lo firmano Juncheng Wu, Hardy Chen, Haoqin Tu, Xianfeng Tang, Freda Shi, Hui Liu, Hanqing Lu, Cihang Xie e Yuyin Zhou, fra UC Santa Cruz, Amazon, l’Università di Waterloo e il Vector Institute. La tesi si riassume in una frase del paper: ragionare più a lungo non compensa una percezione sbagliata.
Il collo di bottiglia sta negli occhi
Da quando DeepSeek-R1 ha mostrato che l’apprendimento per rinforzo con ricompense verificabili (RLVR) allunga e migliora il ragionamento dei modelli linguistici, la stessa ricetta è stata trasferita ai modelli visione-linguaggio: si premiano le risposte giuste ai problemi di matematica visiva, e il modello impara a produrre catene di pensiero più lunghe. Gli autori sostengono che in questi compiti il limite, il più delle volte, non è il ragionamento.
Per misurarlo hanno preso le risposte sbagliate di Qwen3-VL-8B su tre dataset di matematica visiva e le hanno fatte esaminare a Claude Haiku 4.5, con il compito di dire se l’errore nasceva dalla lettura dell’immagine. Il verdetto: l’86,9% degli errori è di percezione. Il giudice non è infallibile: gli autori hanno ricontrollato a mano 40 suoi giudizi, e 33 coincidono con quello umano, l’82,5%, che per loro basta a considerarlo affidabile. Il segnale però è netto, e si accorda con studi diagnostici recenti che isolano la percezione come punto debole.
Che cosa succede dopo il pre-addestramento, dal fine-tuning supervisionato al rinforzo con ricompense verificabili e a GRPO, l’algoritmo che il paper usa in tutte e tre le tappe: è spiegato nel capitolo sul post-training.
Per gli autori la conseguenza riguarda il modo in cui si fa oggi il post-training: la prassi comune è mescolare tutti i dati, di percezione e di ragionamento, e ottimizzarli insieme in un’unica fase. La loro proposta è separarli.
Tre tappe, in quest’ordine
Il post-training viene diviso in tre stadi, ciascuno con il suo dataset: percezione visiva, ragionamento testuale, ragionamento visivo. Tutti e tre usano lo stesso algoritmo, GRPO, con una ricompensa che somma correttezza e formato; per ogni domanda si campionano cinque risposte e ciascuna viene confrontata con la media del proprio gruppo:
$$A_i = \frac{R(x, y_i) – \mu_R}{\sigma_R + \epsilon}.$$
Il ragionamento testuale usa ORZ-Math-13k, problemi di matematica senza immagini. Quello visivo raccoglie esempi da dataset aperti come CLEVR-Math, GeoQA170K, MathPUMA, DocVQA e ArxivQA. La parte nuova è il primo stadio, e sta soprattutto nei dati.
Gli autori partono da DOCCI, circa 15 mila immagini con didascalie molto dettagliate. Dalla didascalia, un modello linguistico (Qwen2.5-72B) ricava domande su un dettaglio minuto o su una relazione spaziale, con la risposta già scritta. Poi viene il filtro, che è l’idea più pulita del lavoro: si tiene una domanda solo se un modello di base la sbaglia guardando l’immagine ma la azzecca leggendo la didascalia,
$$\mathbb{I}[\hat{A}_{\text{img}} \neq A] \wedge \mathbb{I}[\hat{A}_{\text{cap}} = A].$$
Se con la descrizione a parole la risposta arriva, il ragionamento c’è: quello che manca è la vista. Il filtro viene applicato con due modelli, Qwen2.5-VL-7B e Qwen2.5-VL-32B, e il risultato è un insieme di domande difficili per ragioni di percezione e non di logica.
I numeri
Gli esperimenti principali usano due modelli di base, Qwen2.5-VL-7B e Qwen3-VL-8B, allenati con EasyR1 su un server da otto H200. Il confronto chiave è con la ricetta a tappa unica, costruita con gli stessi dati e lo stesso numero totale di passi, 930 (divisi fra le tre tappe in 90, 375 e 465). La valutazione copre quattro benchmark di matematica visiva (MathVista, MathVision, MathVerse nella parte a forte contenuto visivo, WeMath) e quattro di percezione (A-OKVQA, RealWorldQA, MMStar, POPE).
Su entrambi i modelli la ricetta a tappe fa meglio di quella mescolata, in matematica visiva e in percezione. Su Qwen2.5-VL-7B, anzi, la ricetta mescolata fa calare di un soffio la percezione rispetto al modello di base.
| Ricetta | Matematica visiva | Percezione |
|---|---|---|
| Qwen3-VL-8B | ||
| Modello di base | 45,2% | 79,2% |
| Ricetta mescolata | 49,6% | 79,7% |
| A tappe | 51,1% | 80,4% |
| Qwen2.5-VL-7B | ||
| Modello di base | 37,0% | 76,3% |
| Ricetta mescolata | 40,7% | 76,0% |
| A tappe | 42,3% | 77,2% |
Rispetto al modello di base il salto più ampio è su MathVerse (più 12,7 punti per Qwen3, più 11,4 per Qwen2.5), ma lì anche la ricetta mescolata guadagna molto; il paper mette in vetrina WeMath, più 5,2 punti per Qwen3 (da 50,9% a 56,1%) e più 7,4 per Qwen2.5, e RealWorldQA, dove Qwen3 guadagna 3,7 punti.
Il risultato più curioso, però, è un altro. Durante l’addestramento le risposte del modello a tappe si accorciano man mano che procede la tappa di percezione, e nella terza tappa, sul set di validazione, sono lunghe in media 445 token contro 562: il 20,8% in meno, mentre sui benchmark l’accuratezza è più alta. Sui benchmark di test la riduzione è più contenuta ma costante, fra il 6,6 e il 12,6%. Il caso di studio del paper è quello del compito in classe: un triangolo in cui il modello mescolato assegna il lato di lunghezza 73 all’angolo sbagliato, poi ricontrolla l’immagine più volte senza correggersi; il modello a tappe legge bene la figura e chiude in poche righe.
Conta anche l’ordine. Scambiare le prime due tappe non cambia quasi nulla: per gli autori, percezione e ragionamento testuale sono due fondamenta che si possono posare in qualunque sequenza. Rovesciare la sequenza, con il ragionamento visivo per primo e la percezione per ultima, sì. Su Qwen2.5-VL-7B la media in matematica visiva torna a 37,7%, il livello del modello di base, e la percezione scende a 74,2%, sotto il modello di base (76,3%). Su Qwen3-VL-8B il danno è più piccolo: 50,0% in matematica, contro 51,1% dell’ordine giusto e 49,6% della ricetta mescolata. E per la prima tappa il rinforzo funziona meglio del classico fine-tuning supervisionato su didascalie: su Qwen2.5-VL-7B, WeMath fa 38,3% contro 30,1%. Su Qwen3-VL-8B la differenza in matematica si annulla (51,10% contro 51,08%), mentre la percezione resta a favore del rinforzo.
Infine una proposta concettuale. Ordinare i dati per tipo di capacità è un curriculum, ma diverso da quello classico che va dal facile al difficile. Gli autori li combinano, ordinando per difficoltà dentro ciascuna tappa, e per loro i due assi si sommano.
| Ordinamento dei dati | Media |
|---|---|
| Nessuno, ricetta mescolata | 58,6% |
| Solo le tappe | 60,5% |
| Solo la difficoltà | 60,4% |
| Tappe e difficoltà | 63,0% |
Come si salda un encoder visivo a un modello linguistico, e perché la parte che «guarda» e quella che «ragiona» nascono come due modelli distinti: è raccontato nel capitolo sui modelli visione-linguaggio.
Leggi «Il pezzo più piccolo che si può addestrare» nel libro →
Dove il vantaggio si assottiglia
Un dettaglio di configurazione non torna. Il testo dice che nella ricetta mescolata l’encoder visivo resta congelato, come da prassi, e in quella a tappe si allena sempre; la tabella in appendice dice che nelle tappe è congelato nella seconda, e i numeri della ricetta mescolata nel confronto principale coincidono con quelli della sua variante a encoder aperto. Comunque stiano le cose, gli autori ripetono il confronto a parità di configurazione, encoder tutto congelato o tutto aperto: le tappe restano avanti di 0,6–1,8 punti sulla media di sei benchmark. L’effetto regge, ed è dell’ordine di un punto.
Il meccanismo è dimostrato solo in parte. Se il guadagno venisse davvero da occhi migliori, gli errori di percezione dovrebbero calare molto. Secondo lo stesso giudice automatico, sui 3.044 esempi di tre benchmark passano da 857 del modello di base a 805 con la ricetta mescolata e a 781 con le tappe: il 9% in meno rispetto alla base, il 3% rispetto al miscuglio. La direzione è quella attesa, la misura è modesta.
Il confronto con gli altri modelli è meno netto del racconto. Il paper parla di stato dell’arte fra i modelli da 8 miliardi, ma sulla stessa base il concorrente è uno solo, OneThinker-8B: la media in matematica visiva è identica (51,1%), OneThinker fa meglio su MathVision (33,2% contro 28,6%), e il vantaggio complessivo viene dalla percezione (80,4% contro 78,6%). Fra i modelli da 7 miliardi, WeThink-7B ha una media complessiva più alta (60,2% contro 59,8%), fa meglio anche in matematica visiva (43,4% contro 42,3%) e su WeMath resta lontano, 46,6% contro 38,3%.
Il giudice è un modello. Tutte le valutazioni, non solo l’analisi degli errori, passano da Claude Haiku 4.5 come arbitro delle risposte. È una scelta diffusa, ma aggiunge un margine di rumore che su differenze di un punto non è trascurabile. A parziale compenso, la media su tre valutazioni indipendenti dà ragione alle tappe su 14 benchmark su 15 per Qwen3-VL-8B e su 12 su 15 per Qwen2.5-VL-7B. Ma sono tre valutazioni degli stessi modelli, non tre addestramenti: quanto cambi il risultato da un allenamento all’altro resta non misurato. Su un insieme più ampio di benchmark il vantaggio si ritrova anche su due modelli della famiglia InternVL (più 3,8 e più 1,0 punti).
I limiti dichiarati. Tutto è misurato fra 7 e 8 miliardi di parametri; i modelli da 32 miliardi in su restano da provare. La pipeline dei dati ha bisogno di didascalie molto fini, che in molti domini non esistono. E tre tappe potrebbero non essere la divisione giusta: potrebbe essercene una più fine.
Perché conta adesso
L’ultimo anno di ricerca sui modelli visivi ha seguito la strada aperta dai modelli di ragionamento testuali: più pensiero, più token, più rinforzo sulla risposta finale. Questo lavoro non la contraddice, ma le mette accanto una domanda che era rimasta sullo sfondo: che cosa sta guardando il modello prima di mettersi a pensare? La risposta pratica è a basso costo: nessuna architettura nuova, solo dati aperti, un filtro ben congegnato e gli stessi esempi dati in sequenza invece che mescolati. Il guadagno in accuratezza è di un punto o due; quello in lunghezza delle risposte è più interessante, perché dal 7 al 13% di token in meno sui benchmark, a qualità pari o migliore, è calcolo che non si paga in produzione. E l’idea di ordinare il post-training per capacità, oltre che per difficoltà, è abbastanza generale da essere provata anche fuori dalla matematica visiva. Come nel compito in classe: prima di rifare i conti, conviene ricopiare bene i dati.

I commenti sono riservati agli iscritti.
Accedi per commentare