Chi ha cercato un’auto usata conosce il trucco del piazzale: la macchina da vendere sta parcheggiata accanto a due più vecchie e più ammaccate. Nessuna bugia, solo una scelta dei vicini. Nei rapporti tecnici dei modelli di intelligenza artificiale il piazzale è la tabella dei confronti, e l’OCR ne ha appena offerti due esempi nello stesso giorno.
Il 17 settembre Tencent ha pubblicato su arXiv il rapporto tecnico di WeVisDoc, con i pesi su Hugging Face in due taglie da 2 e 4 miliardi di parametri. Lo stesso giorno Elastic ha presentato sul suo blog jina-ocr-v1, firmato «Jina AI by Elastic», il cui rapporto tecnico era su arXiv dall’inizio del mese. Fanno la stessa cosa: ricevono l’immagine di una pagina (una scansione, una foto, una slide) e restituiscono Markdown, con le formule in LaTeX e le tabelle in HTML. Sono modelli visione-linguaggio specializzati in un solo mestiere, e tutti e due lavorano end-to-end: un modello solo legge la pagina intera, senza un rilevatore di layout a monte.
Come un modello visione-linguaggio trasforma un’immagine in token, e perché ogni pixel in più costa, è spiegato nel libro.
Che cosa portano
WeVisDoc è Qwen3-VL-Instruct (in versione da 2 e da 4 miliardi) rifinito sulle pagine, e la sua idea sta nei dati. Una prima fase allarga la copertura: documenti di ogni tipo e degradazioni sintetiche che sporcano l’immagine senza rompere la struttura. La seconda misura dove il modello uscito dalla prima sbaglia ancora, su un campione tenuto da parte e diviso in gruppi di pagine simili per aspetto e struttura, e costruisce esempi mirati proprio lì. Il guadagno si vede soprattutto sulle pagine rovinate: sulla prova di PureDocBench fatta con documenti degradati davvero, il modello da 4 miliardi sale di 4,03 punti rispetto alla prima fase. I risultati dichiarati sono medie su tre esecuzioni.
jina-ocr-v1 parte invece da DeepSeek-OCR: un decoder a miscela di esperti da 3 miliardi di parametri, di cui circa 570 milioni attivi per ogni token, e un encoder visivo, per 3,4 miliardi in tutto. In più ha una testa di decodifica speculativa (FastMTP) che propone tre token alla volta e li fa verificare al modello, senza perdita di qualità. Il suo argomento è la velocità: 2,57 pagine al secondo su una A100, il valore più alto fra i quattordici sistemi che gli autori hanno misurato. Elastic dichiara oltre cento lingue e la scrittura a mano, compreso il corsivo inglese, con l’avvertenza che una grafia disordinata resta difficile come per un lettore umano.
La classifica, e le tabelle di ciascuno
OmniDocBench, di OpenDataLab, è il banco di prova che quasi tutti i rapporti citano: nella versione 1.6 conta 1651 pagine di dieci tipi (articoli scientifici, rapporti finanziari, giornali, libri di testo, appunti a mano). Il punteggio Overall fa la media fra testo, formule e tabelle. Papers with Code ne raccoglie i risultati dichiarati dagli autori, e la classifica è questa.
| Modello | Parametri | Overall |
|---|---|---|
| TeleOCR China Telecom, ex NaviDC-OCR | 1,2 | 96,87 |
| OvisOCR2 | 0,85 | 96,58 |
| PaddleOCR-VL-1.6 Baidu | 0,96 | 96,33 |
| MinerU2.5-Pro | 1,2 | 95,69 |
| WeVisDoc-4B Tencent | 4,4 | 95,38 |
| HPD-Parsing | 1,1 | 94,91 |
| HunyuanOCR-1.5 | 1,1 | 94,74 |
| Infinity-Parser2-Pro | 35,1 | 93,95 |
| Unlimited-OCR | 3,3 0,5 attivi | 93,92 |
| MonkeyOCRv2-B-Parsing | 0,88 | 91,57 |
| jina-ocr-v1 Elastic | 3,4 0,57 attivi nel decoder | 91,14 |
In testa c’è TeleOCR, un modello da 1,2 miliardi di China Telecom rinominato così il 10 settembre (prima si chiamava NaviDC-OCR), che lavora in due tempi. WeVisDoc-2B, fuori dalla raccolta perché Papers with Code tiene un risultato per rapporto, dichiara 95,06.
Ora le tabelle dei due nuovi. WeVisDoc si dice «primo fra i parser end-to-end confrontati» in tutte e quattro le prove, e nella sua tabella lo è: diciannove concorrenti, tutti sotto. Manca però OvisOCR2, anch’esso end-to-end, da 0,85 miliardi, su Hugging Face da metà luglio e nella classifica ufficiale del benchmark dall’11 settembre (con 96,47 nella misura di OpenDataLab). Nel suo rapporto dichiara 96,58, 1,2 punti sopra WeVisDoc-4B. Per onestà va detto il resto: su PureDocBench, che mette insieme pagine pulite e pagine degradate, OvisOCR2 dichiara una media di 75,06, sotto il 75,54 di WeVisDoc-4B. Lì il primato regge sulla media e sulle due prove con pagine degradate, per quanto mezzo punto misurato da due gruppi diversi possa reggere. Sulle pagine pulite no: OvisOCR2 dichiara 81,55 contro 79,81.
Il rapporto di jina-ocr-v1 si colloca «terzo fra i modelli specializzati con un punteggio v1.6 pubblicato». La sua tabella di modelli specializzati ne mette in fila quattro, compreso sé stesso. Nella classifica ufficiale di OpenDataLab, da cui il rapporto dice di aver trascritto i numeri, oggi i modelli specializzati sopra 91,14 sono quattordici. Il suo vero argomento, del resto, sta altrove: la velocità e le lingue.
Che cosa si può usare in azienda
Qui i due modelli si separano davvero. WeVisDoc ha licenza Apache 2.0: si scarica, si modifica e si usa anche a fini commerciali, conservando l’avviso di licenza. jina-ocr-v1 su Hugging Face è CC BY-NC 4.0: ricerca e usi non commerciali. Per installarlo in azienda bisogna contrattare una licenza con Elastic, oppure usarlo come servizio: dall’API di Jina (a consumo, per token, con 10 milioni di token gratuiti per provarlo) o compreso nel servizio di inferenza di Elastic Cloud. I primi quattro della classifica sono tutti Apache 2.0, e nessuno arriva a un miliardo e mezzo di parametri.
Resta la lingua. OmniDocBench etichetta le pagine come inglesi, in cinese semplificato o tradizionale, miste inglese-cinese, oppure «altro»: nessuna lingua europea oltre all’inglese ha una voce propria. I metadati della scheda di WeVisDoc indicano inglese e cinese; fra gli esempi di Elastic ci sono francese, tedesco, ceco, turco, greco e ucraino, l’italiano no. Per un archivio di fatture o contratti italiani la classifica dice poco, e la prova va fatta sulle proprie pagine. Con un’avvertenza pratica: in locale né WeVisDoc né jina-ocr-v1 leggono i PDF, le pagine vanno prima convertite in immagini.
I primi cinque stanno in un punto e mezzo, da 96,87 a 95,38: su OmniDocBench la distanza fra i migliori si misura ormai in decimi. Si allarga sulle pagine rovinate: nella stessa tabella di WeVisDoc, sulla prova con i documenti degradati davvero, anche i primi cinque stanno in oltre cinque punti, da 63,66 a 69,08. Davanti a un rapporto tecnico, allora, la domanda utile non è chi sia arrivato primo, ma chi sia stato parcheggiato accanto. Chi deve scegliere un OCR per il proprio archivio ha già MinerU2.5-Pro e Unlimited OCR fra le schede di paithon; da oggi ne ha altri due, con licenze molto diverse.

I commenti sono riservati agli iscritti.
Accedi per commentare