MinerU2.5-Pro: stesso modello da 1,2 miliardi, dati rifatti da capo, primo su un benchmark rifatto anch’esso

Lo Shanghai AI Laboratory non tocca una riga dell'architettura di MinerU2.5 e rifà tutto il resto: da meno di 10 a 65,5 milioni di campioni, una difficoltà misurata facendo litigare tre modelli diversi, le annotazioni difficili corrette confrontando la pagina con il disegno della trascrizione. Su OmniDocBench v1.6 il punteggio passa da 92,98 a 95,69. I numeri, il benchmark rifatto dagli stessi autori e le ablazioni che mancano.

Quando un’intera classe sbaglia lo stesso esercizio, un insegnante esperto non comincia dagli studenti. Guarda il libro. Se il distratto e il secchione inciampano sulla stessa riga, probabilmente quella riga è spiegata male, o di esercizi simili il libro ne ha uno solo, o la soluzione in fondo al volume è sbagliata. Cambiare studente non serve: bisogna rifare il libro.

È il ragionamento da cui parte MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale, uscito su arXiv il 6 aprile 2026 (2604.04771). Lo firma un gruppo numeroso dello Shanghai Artificial Intelligence Laboratory, con contributi di Università di Pechino, Shanghai Jiao Tong e SenseTime; Bin Wang guida il progetto, Conghui He è l’autore di riferimento. Codice nel repository MinerU di OpenDataLab, pesi su Hugging Face.

Tutti sbagliano sulle stesse pagine

Il parsing di documenti trasforma un PDF in testo strutturato, di solito Markdown, con tabelle e formule ricostruite. È infrastruttura: sta a monte dei corpora con cui si addestrano i modelli linguistici e dei sistemi di retrieval che rispondono citando documenti aziendali. Negli ultimi anni le pipeline a moduli separati sono state sostituite da modelli visione-linguaggio che guardano la pagina e scrivono il risultato, e la ricerca si è concentrata sull’architettura e sulla velocità. Risultato: sui benchmark standard i migliori si sono ammucchiati in pochi decimi di punto.

L’analisi incrociata degli autori su grandi quantità di PDF reali, descritta senza numeri, mostra una regolarità: modelli con architetture e dimensioni molto diverse falliscono sugli stessi campioni difficili, con errori a volte identici. Se il difetto attraversa le architetture, sostengono, la causa non è l’architettura: sono i dati di addestramento, che hanno lacune comuni. Due in particolare. La copertura: MinerU2.5 era stato addestrato su meno di 10 milioni di pagine, concentrate sui casi frequenti, con pochissime tabelle annidate o pagine fitte di formule. E un paradosso dell’annotazione: i campioni che insegnerebbero di più sono proprio quelli che nessun modello sa annotare in automatico, e l’errore dell’etichetta passa pari pari nel modello.

Per mettere alla prova l’ipotesi fanno una scelta da esperimento controllato: tengono identica l’architettura di MinerU2.5, 1,2 miliardi di parametri (un encoder visivo NaViT da 675 milioni più un Qwen2 da 0,5 miliardi, con l’impaginato separato dal riconoscimento del contenuto), e ripartono dal suo stesso checkpoint iniziale. Cambiano solo dati e addestramento.

Un motore di dati in tre stadi

Il primo stadio è il campionamento, che il paper chiama DDAS. Pagine e poi singoli elementi (testo, formule, tabelle) vengono raggruppati con K-Means su feature visive. Dai gruppi grandi si campiona meno, da quelli piccoli di più, per raddrizzare la coda lunga; i gruppi fatti di pagine bianche o lingue fuori obiettivo si scartano. E si pesa anche la difficoltà, che però va misurata senza avere le risposte giuste.

È il secondo stadio, il più interessante: la verifica di consistenza fra modelli, CMCV. Su ogni campione girano tre parser eterogenei, MinerU2.5, PaddleOCR-VL e Qwen3-VL-30B, e se ne confrontano le uscite a coppie con la metrica del compito: distanza di edit per il testo, TEDS per le tabelle, CDM per le formule. Poiché il modello da migliorare è MinerU2.5, la classificazione è ancorata su di lui. Facile: MinerU2.5 concorda con almeno uno degli altri, e l’uscita vale come etichetta. Medio: gli altri due concordano fra loro e MinerU2.5 no; il consenso esterno diventa l’etichetta, e per gli autori è il dato più prezioso: indica una lacuna precisa di MinerU2.5, e il fatto che altri due modelli lo risolvano mostra che il campione si può imparare. Difficile: nessuno concorda con nessuno, e un’etichetta affidabile non c’è. Nello schema del paper le proporzioni indicative sono circa 60, 25 e 15 per cento.

Prima, MinerU2.5 e PaddleOCR-VL-1.5 stimavano la difficoltà facendo girare più volte lo stesso modello e misurandone l’incertezza. Così però non si distingue un punto cieco di quel modello da un campione difficile per tutti; e sono due casi che chiedono rimedi diversi.

Il modello resta fermo: cambia il percorso dei dati Bacino di PDF pagine reali Campionamento gruppi + difficoltà Tre modelli leggono la stessa pagina MinerU2.5 PaddleOCR-VL Qwen3-VL-30B Facili · ~60% MinerU2.5 concorda con almeno un altro Medie · ~25% gli altri due concordano, MinerU2.5 no Difficili · ~15% nessuno concorda: etichetta inaffidabile disegna l’uscita e confronta poi annotatori esperti Stadio 1 · 65,5 milioni di campioni etichette dal consenso fra modelli Stadi 2 e 3 · 192 mila fine-tuning mirato, poi GRPO

Correggere guardando il disegno

Il terzo stadio si occupa dei campioni difficili, che usati così com’erano introdurrebbero più rumore che segnale. L’idea ovvia sarebbe far rileggere a un modello la propria trascrizione e chiedergli di correggerla. Gli autori riferiscono, senza cifre, che non funziona: il modello tende a dare ragione a se stesso. La spiegazione che danno è un’asimmetria. Un modello visione-linguaggio sa bene passare dall’immagine al codice, molto meno immaginare che aspetto avrà un codice LaTeX o una tabella HTML una volta impaginati.

La soluzione è togliergli quella fatica: la formula viene compilata e la tabella renderizzata, e il giudice riceve, fianco a fianco, l’immagine originale e il disegno della trascrizione da verificare. Un tag non chiuso, quasi invisibile nel sorgente, nel disegno diventa una tabella crollata. Il giudice-correttore è Qwen3-VL-235B, scelto perché fuori dai tre modelli del confronto, benché della stessa famiglia del 30B. Quello che resta irrisolto va agli annotatori umani, su una pre-annotazione di Gemini 3 Pro e con la precedenza ai casi in cui l’errore è già localizzato.

Il risultato è una piramide: circa 65,5 milioni di campioni facili e medi etichettati in automatico (21 milioni di testo, 14 di impaginato, 13 di formule, 11,5 di tabelle, più 6 milioni di analisi di immagini e grafici) e 192 mila campioni difficili annotati da esperti.

Tre stadi di addestramento

L’addestramento segue la piramide. Il primo stadio passa una volta su tutti i 65,5 milioni: contro i 6,9 milioni per due epoche di MinerU2.5, quasi un ordine di grandezza in più. Il secondo usa i 192 mila campioni difficili mescolati a una quota del primo stadio per non dimenticare, 3,9 milioni in tutto, in proporzioni diverse per compito: 6 a 1 per l’impaginato, dove i difficili abbondano, 1 a 50 per il testo, dove scarseggiano. Il terzo è un allineamento con GRPO in cui la ricompensa è direttamente la metrica di valutazione di ciascun compito: distanza di edit, CDM, TEDS, IoU delle categorie per l’impaginato. Si tengono solo i campioni a ricompensa intermedia, su cui c’è ancora da imparare.

GRPO è un parente di PPO che confronta fra loro più risposte allo stesso input. Che cos’è una ricompensa, e come PPO la usa per spostare un modello a piccoli passi, è spiegato nel capitolo sul post-training.

Leggi «Dopo il pre-addestramento» nel libro →

Anche il metro va rifatto

Su OmniDocBench v1.5 un modello che trascrive perfettamente una formula su tre righe ma la divide in tre blocchi, dove l’annotazione ne prevede uno, può passare dal punteggio pieno a quasi zero: l’accoppiamento fra elementi previsti e annotati è uno a uno, a granularità fissa. Un testo fitto riconosciuto come tabella prende zero. La versione 1.6 lascia ferma l’annotazione e cerca la segmentazione migliore dal lato della previsione. Prova l’accoppiamento diretto, risolto con l’algoritmo ungherese sul costo

$$C_{ij} = 1 – \mathrm{sim}(p_i, g_j),$$

poi quello dopo aver spezzato le previsioni sugli a capo del LaTeX, poi tutte le maniere di riunire i pezzi consecutivi: con $n’$ frammenti gli spazi fra l’uno e l’altro sono $n’-1$, quindi i raggruppamenti possibili sono $2^{n’-1}$. Vince il migliore dei tre. Al vecchio insieme di 1.355 pagine, chiamato Base, si aggiunge un sottoinsieme Hard di 296 pagine prese fra quelle che il motore di dati aveva classificato difficili, escluse da ogni fase di addestramento e annotate da professionisti con verifica incrociata.

I numeri

Sull’insieme completo di OmniDocBench v1.6 MinerU2.5-Pro guadagna 2,71 punti su MinerU2.5 con la stessa rete, e resta davanti ai parser concorrenti. I modelli generalisti restano indietro. È il primo anche sulle formule (CDM 97,29) e sulle tabelle (TEDS 93,42). Non su tutto: sulla distanza di edit del testo Ovis2.6-30B-A3B fa leggermente meglio (0,035 contro 0,036), e sull’ordine di lettura il testo del paper rivendica il primato, ma la sua stessa tabella dà a Youtu-Parsing 0,116 contro 0,120 (qui più basso è meglio).

Parsing di documenti, la classifica OmniDocBench v1.6, insieme completo · più alto è meglio
Modello Punteggio
Parser di documenti
MinerU2.5-Pro 95,69
GLM-OCR 95,15
PaddleOCR-VL-1.5 94,87
MinerU2.5 92,98 stessa rete, dati vecchi
Modelli generalisti
Ovis2.6-30B-A3B 93,62
Gemini 3 Pro 92,85
Qwen3-VL-235B 89,78
GPT-5.2 86,52

La distribuzione del vantaggio dice più della media. Sulla parte Base i primi tre stanno in mezzo punto, e GLM-OCR è davanti: 96,19 contro 96,12. Tutto il distacco si forma sulla parte Hard, 94,08 contro il 92,01 sia di GLM-OCR sia di PaddleOCR-VL-1.5. L’ablazione per stadi assegna il guadagno più grande al primo, i dati in scala: +1,31. Il secondo aggiunge 0,96, soprattutto sulle tabelle (TEDS da 90,37 a 92,87); GRPO chiude con 0,45, soprattutto sulle formule.

Che cosa resta da verificare

Il metro l’hanno rifatto gli stessi che vincono. OmniDocBench nasce nello stesso gruppo e la v1.6 è proposta in questo paper. Le correzioni all’accoppiamento sembrano ragionevoli: gli stessi autori notano che fanno risalire anche Gemini. Ma il sottoinsieme Hard, dove si forma tutto il distacco, è scelto con la stessa definizione di difficoltà che ha guidato l’addestramento, ancorata alle debolezze di MinerU2.5 e costruita anche con PaddleOCR-VL. Le pagine sono escluse dal training, il tipo di pagina no. Un vantaggio di campo è plausibile; quanto pesi, il paper non lo misura.

Le ablazioni non separano gli ingredienti. Si vede quanto rende ogni stadio di addestramento, non quanto rendano il campionamento, la verifica fra modelli o la correzione per confronto visivo. Nel primo stadio aumentano insieme quantità e qualità dei dati, e non si sa quale delle due pesi di più.

Una parte dei dati è distillazione. Le etichette dei campioni medi sono il consenso di PaddleOCR-VL e Qwen3-VL, quelle dei difficili passano da Qwen3-VL-235B e Gemini 3 Pro prima degli esperti. È legittimo, ma il tetto di queste etichette è quello dei modelli che le producono, e il costo dei 192 mila campioni annotati a mano non è riportato.

Gli autori dichiarano a loro volta tre limiti: l’accoppiamento fra elementi resta ambiguo quando la stessa pagina si può rappresentare in modi diversi e ugualmente corretti, una lista bilingue come testo o come tabella; mancano insiemi di valutazione per domini verticali come finanza, diritto e medicina; e il parsing di contenuto non dice nulla della struttura: la gerarchia fra titoli e testo, il passaggio che rimanda a una figura, il paragrafo che prosegue alla pagina dopo.

Perché conta

Finora la gara nel parsing di documenti si è fatta soprattutto sull’architettura: più token per passo, decodifica a diffusione, compressione visiva. MinerU2.5-Pro sostiene che a questo punto la leva più lunga è altrove, e lo mette alla prova nel modo più pulito: senza cambiare la rete. Il margine va letto con cautela, ma il metodo si può copiare: misurare la difficoltà con il disaccordo fra modelli diversi, e correggere un’etichetta mostrando al correttore l’aspetto che avrà. Per chi ogni giorno trasforma PDF in dati per un sistema di retrieval, il segnale pratico è che un modello da 1,2 miliardi di parametri, con pesi aperti, nel confronto del paper supera generalisti da centinaia di miliardi proprio su tabelle e formule.

I commenti sono riservati agli iscritti.

Accedi per commentare