GLiNER2.5: Fastino smette di elencare gli span, e i numeri migliorano a metà

Il 24 agosto Fastino ha pubblicato sul proprio blog l’annuncio di GLiNER2.5, nuova versione di una famiglia di modelli per l’estrazione di informazioni: trovare in un testo nomi, date, organizzazioni, le relazioni fra loro, e classificare il documento, il tutto secondo uno schema che l’utente dichiara. Lo firmano Mary Newhauser e Urchade Zaratiana.

Che cosa dichiara Fastino

La novità è nell’architettura. Le versioni precedenti di GLiNER trovavano le entità elencando i frammenti candidati del testo, fino a una larghezza massima, e dando un punteggio a ciascuno: come cercare un nome in una pagina provando tutte le finestre di una, due, tre parole. In GLiNER2 il tetto era di solito intorno alle dodici parole, e quello che lo superava il modello non lo valutava affatto. GLiNER2.5 fa invece quello che fa chi sottolinea a matita: per ogni voce dello schema, spiega l’annuncio, il modello produce un punteggio di inizio e uno di fine su ogni confine fra token, più un punteggio «interno» sui token stessi. Fra i confini più promettenti si formano le coppie inizio-fine, e una seconda testa le rivaluta. Niente elenco, niente larghezza massima: secondo Fastino il calcolo cresce linearmente con la lunghezza del documento, a schema e numero di candidati fissati, e un’entità può essere lunga quanto serve.

Prima: elencare i frammenti ogni finestra, fino a una larghezza massima GLiNER2.5: segnare inizio e fine inizio e fine sui confini, nessuna larghezza massima

I modelli sono tre, tutti su Hugging Face con licenza Apache 2.0: gliner2.5-base-v1 (0,2 miliardi di parametri, su DeBERTa-v3-base), gliner2.5-multi-v1 (0,3 miliardi, su mDeBERTa-v3-base) e gliner2.5-small-v1 (74 milioni, su DeBERTa-v3-xsmall); secondo le schede su Hugging Face il base e il piccolo sono solo inglesi. L’addestramento è arrivato a sequenze di 4.096 parole. Gli esempi non vengono da dataset esistenti ma da dati sintetici prodotti dal Fastino Data Agent, l’agente di generazione dati dell’azienda.

Sui risultati, l’annuncio riporta un F1 macro medio, in zero-shot su 16 dataset pubblici di classificazione ed estrazione, per il modello base e per il multilingue, ciascuno contro il suo predecessore GLiNER2. I salti grandi sono su singoli compiti: XNLI per il multilingue, il NER generale (Few-NERD) per il base.

GLiNER2.5 contro GLiNER2 F1 macro, zero-shot · più alto è meglio
Modello e prova GLiNER2.5 GLiNER2
Media sui 16 dataset
base 54,87 53,34
multilingue 56,17 56,09
Singoli compiti
XNLI, multilingue 62,30 37,55
Few-NERD, base 55,14 47,22

Che cosa manca per verificarlo

Letti per intero, e l’annuncio ha il merito di pubblicare le tabelle dataset per dataset, i numeri dicono una cosa più modesta della presentazione («l’aggiornamento più significativo» dell’architettura GLiNER): sulla media il multilingue è praticamente fermo (8 centesimi di punto), e sulla media dei compiti di estrazione, il mestiere per cui GLiNER è nato, scende da 47,56 a 46,40; il guadagno complessivo viene dalla classificazione, trainata da XNLI. Su alcuni dataset arretra, come la sentiment analysis su IMDb (85,96 contro 89,42) e Rotten Tomatoes (74,67 contro 78,11). Il modello piccolo non ha nessun numero. Non ci sono misure di velocità, nonostante l’efficienza sia nel titolo. Non c’è un paper su GLiNER2.5: l’annuncio rimanda ad arXiv solo per l’agente che genera i dati sintetici, di cui descrive il procedimento (una griglia di domini e compiti) ma non quanti esempi né in quali lingue; la scheda del modello cita il paper di GLiNER2, del 2025.

Sui documenti più lunghi della finestra la libreria spezza il testo in blocchi sovrapposti, e questo l’annuncio lo dice. La scheda del modello aggiunge il limite che l’annuncio tace: un’entità o una relazione si conserva solo se i suoi due estremi cadono nello stesso blocco. La lunghezza illimitata vale, quindi, dentro la finestra.

Perché interessa in Italia

Estrarre dati strutturati da contratti, fatture, verbali e pratiche è fra i lavori che aziende e pubblica amministrazione chiedono all’AI, spesso passando da un LLM generalista via API. Modelli da decine o poche centinaia di milioni di parametri, con licenza che ammette l’uso commerciale, permettono di tenere il documento su una macchina propria, che per dati personali non è un dettaglio. Il limite, per noi, è la lingua: base e piccolo sono dichiarati solo inglesi, e l’annuncio non elenca le lingue del multilingue né riporta un risultato sull’italiano. La prova multilingue che l’annuncio mette in evidenza è un NER in rumeno (RONEC, 40,13 contro 38,86), lingua che secondo Fastino non era fra quelle dell’addestramento. Prima di sostituire qualcosa, va provato sui propri documenti in italiano.

I commenti sono riservati agli iscritti.

Accedi per commentare