Harrier: Microsoft apre tre modelli di embedding multilingue, senza un paper che li racconti

Il 30 marzo Microsoft ha pubblicato su Hugging Face harrier-oss-v1, una famiglia di tre modelli di text embedding multilingue: modelli che non scrivono testo, ma lo trasformano in un vettore di numeri, così che due frasi con lo stesso significato finiscano vicine. È il pezzo meno visibile di un motore di ricerca semantico o di un sistema RAG, e quello da cui dipende se il documento giusto arriva al modello che risponde. Il 7 aprile l’ha annunciata con un post sul blog di ingegneria di Bing.

Che cosa dichiara Microsoft

Le taglie sono tre. La più piccola ha 270 milioni di parametri e produce vettori a 640 dimensioni; la media ne ha 0,6 miliardi e vettori a 1.024; la grande ne ha 27 miliardi e vettori a 5.376. Tutte e tre accettano fino a 32.768 token in ingresso. Sono modelli decoder-only, cioè della stessa famiglia dei modelli linguistici generativi, usati però per leggere: come rappresentazione del testo si prende lo stato dell’ultimo token, poi normalizzato. I file di configurazione indicano un’architettura Gemma 3 per la taglia grande e per la piccola, Qwen 3 per la media; né la scheda né l’annuncio nominano il modello di partenza.

Il numero su cui l’annuncio si regge è il punteggio sul Multilingual MTEB v2, il benchmark di riferimento per gli embedding, una media su 131 compiti. La versione da 27 miliardi fa 74,3, quella media 69,0, la piccola 66,5. Secondo Microsoft sono risultati da stato dell’arte «alla data del rilascio»: il post dà 72,3 al primo in classifica di allora e avverte che la posizione può cambiare con i nuovi invii. La scheda descrive l’addestramento in due righe: obiettivi contrastivi su una grande miscela di dati multilingue e, per le taglie minori, distillazione da modelli più grandi. Il post aggiunge qualche cifra: oltre due miliardi di esempi debolmente supervisionati per il pre-addestramento contrastivo e più di dieci milioni di qualità per la rifinitura, raccolti da più fonti e in parte generati con GPT-5; il modello di punta ha poi fatto da insegnante per i più piccoli.

MTEB v2 multilingue, punteggi dichiarati 270 milioni vettori da 640 66,5 0,6 miliardi vettori da 1.024 69,0 27 miliardi vettori da 5.376 74,3 0

Che cosa manca per verificarlo

Non c’è un paper né un rapporto tecnico. Il post porta sei firme, fra cui Liang Wang e Furu Wei, e si richiama ai precedenti modelli di embedding di Microsoft, come la serie E5; ma resta un annuncio: non elenca i dataset, non dice in che proporzione ci siano le lingue, non chiarisce il modello di partenza. Scheda e post danno solo la media MTEB, senza il dettaglio per compito e per lingua: non si sa, per esempio, quanto il modello vada bene in italiano rispetto all’inglese. In compenso la scheda pubblica i prompt usati per ogni compito della valutazione e rimanda al repository di MTEB per riprodurla, e avverte che versioni diverse di transformers e PyTorch possono dare scarti trascurabili ma non nulli. La valutazione, insomma, si può rifare da sé; l’addestramento no.

C’è anche un vincolo d’uso da non perdere: ogni query va preceduta da un’istruzione di una frase che descrive il compito («data una ricerca sul web, trova i passaggi pertinenti che rispondono alla domanda»), altrimenti, avverte la scheda, le prestazioni calano. I documenti invece si indicizzano senza istruzione.

Perché interessa in Italia

La licenza dichiarata è MIT, che non limita l’uso commerciale, e l’italiano è fra le lingue elencate: per chi costruisce ricerca interna o RAG su documenti in italiano, contratti, normativa, archivi aziendali, è un’opzione da mettere alla prova accanto a quelle che usa già, sul proprio corpus e non sulla classifica. Prima di portarlo in un prodotto va chiarito un punto che la scheda non tocca: se il modello grande parte davvero da Gemma 3, come suggerisce la configurazione, sui pesi potrebbero valere anche i termini d’uso di Gemma. Poi c’è il conto: in BF16 i pesi del modello grande pesano circa 54 GB; e un vettore da 5.376 dimensioni occupa più di otto volte quello da 640 della taglia piccola, in un indice che magari conta milioni di documenti. Il salto da 66,5 a 74,3 è reale sulla carta; se valga una GPU da data center e un indice otto volte più grande lo dice solo una prova sui propri dati.

I commenti sono riservati agli iscritti.

Accedi per commentare