Qwen2.5, la famiglia che copre ogni taglia

Mentre l'attenzione era sui modelli che ragionano, alla fine del 2024 Alibaba pubblica sette modelli aperti di ogni dimensione, dal mezzo miliardo ai 72 miliardi di parametri, più varianti dedicate a codice e matematica. La scommessa non è un modello, ma una famiglia.

A fine 2024, mentre gran parte del settore guarda ai modelli che «pensano» prima di rispondere, il team Qwen di Alibaba pubblica un rapporto tecnico dal titolo poco spettacolare — Qwen2.5 Technical Report — e con esso non un modello, ma sette: da mezzo miliardo di parametri fino a settantadue miliardi, tutti con i pesi aperti. Per diversi mesi alcune di queste taglie restano in cima alle classifiche dei modelli aperti. La notizia non è un record su un benchmark. È la strategia: coprire ogni dimensione, invece di puntare tutto su un campione.

Una famiglia, non un modello

La maggior parte dei laboratori presenta un modello di punta e, in coda, un paio di versioni ridotte. Qwen2.5 ribalta la logica: pubblica una scala completa di taglie — 0,5, 1,5, 3, 7, 14, 32 e 72 miliardi di parametri — pensate perché ognuno scelga il gradino giusto per il proprio vincolo, che sia un telefono, una singola GPU o un server.

È la differenza tra un negozio che vende solo la taglia XL e una sartoria che ti prende le misure. Il modello da 0,5 miliardi gira su un dispositivo tascabile e serve compiti semplici a costo quasi nullo; quello da 72 compete con i grandi sistemi chiusi ma pretende hardware serio. In mezzo c’è tutta la gradazione, così che la scelta diventa una questione di budget e latenza, non un aut-aut.

La granularità non è un vezzo. In produzione la domanda giusta non è «qual è il modello migliore» ma «qual è il più piccolo che risolve il mio problema», perché ogni miliardo di parametri in più si paga in memoria, in tempo di risposta e in bolletta. Avere sette gradini ravvicinati significa poter salire di uno solo quando serve davvero, invece di raddoppiare la spesa per guadagnare un punto di accuratezza che magari all’utente finale non cambia niente.

Diciotto trilioni di token

Sotto il cofano l’architettura è deliberatamente ordinaria: transformer densi con gli accorgimenti ormai standard — attenzione a gruppi di query per contenere la memoria, codifica posizionale rotatoria per gestire contesti lunghi. La leva su cui il team spinge davvero è di nuovo i dati. Il corpus di pre-addestramento passa dai circa 7 mila miliardi di token della generazione precedente a 18 mila miliardi, con un lavoro pesante di filtraggio della qualità e un rinforzo mirato su codice e matematica.

Vale la vecchia regola della cucina: puoi avere la pentola migliore del mondo, ma se gli ingredienti sono mediocri il piatto lo sarà. Gran parte del salto di qualità tra una generazione e l’altra, ammette il rapporto, viene da qui — da come i dati sono selezionati e bilanciati, più che da trovate architetturali. Sul fronte del contesto, i modelli aperti più grandi arrivano a 128 mila token, mentre una variante disponibile solo via API, Qwen2.5-Turbo, viene spinta fino a un milione di token: abbastanza per tenere in memoria un libro intero.

Multilingue per davvero

Il punto in cui Qwen si distingue di più è la copertura linguistica. La famiglia dichiara il supporto a oltre 29 lingue: oltre all’inglese e al cinese, le principali lingue europee — italiano compreso — più arabo, giapponese, coreano, thai, vietnamita e altre. Non è un dettaglio da brochure. Molti modelli aperti nascono anglocentrici e «inciampano» appena si esce dall’inglese; una famiglia addestrata fin dall’inizio su un corpus davvero multilingue riduce quel divario, e per chi lavora in una lingua diversa dall’inglese cambia la qualità di ciò che ottiene ogni giorno.

La famiglia Qwen2.5 sette taglie aperte, da 0,5 a 72 miliardi di parametri 0,5B 1,5B 3B 7B 14B 32B 72B modelli base aperti Instruct assistente allineato Coder specializzato sul codice Math ragionamento matematico licenza per lo più Apache 2.0 · oltre 29 lingue · fino a 128K token

La stessa base aperta, in sette taglie, si dirama in versioni istruite e in rami specializzati per codice e matematica: una famiglia, non un singolo modello.

I rami specializzati: codice e matematica

Oltre alle versioni generaliste — quella «base» grezza e quella «instruct» trasformata in assistente — il team pubblica due rami dedicati: Qwen2.5-Coder, addestrato a lungo su una gran mole di codice, e Qwen2.5-Math, tarato sul ragionamento matematico. È la logica del medico specialista accanto al medico di base: per scrivere software o risolvere problemi di algebra, un modello che ha visto quasi solo quel tipo di materiale spesso batte un generalista molto più grande. E siccome sono aperti, chiunque può metterli in produzione senza pagare per token a un fornitore esterno.

Come diventa un assistente

Dal modello grezzo all’assistente utilizzabile c’è il post-training. Qwen2.5 lo affronta con oltre un milione di esempi di fine-tuning supervisionato, seguiti da due giri di reinforcement learning: prima una fase «offline» che allinea il modello a preferenze già raccolte, poi una fase «online» in cui il modello genera, viene valutato e si corregge in corsa. Le due fasi si completano come lo studio a casa e la pratica sul campo: la prima insegna il comportamento giusto sugli esempi noti, la seconda mette il modello alla prova su casi nuovi e ne raffina le risposte dove sbaglia.

Nessuna singola trovata spettacolare: molte scelte solide impilate una sull’altra. È poi il modo in cui questi sistemi migliorano davvero, una generazione dopo l’altra.

È una filosofia diversa da quella dei modelli che fanno notizia per un’unica idea forte. Qui il progresso è incrementale e verificabile, il tipo di lavoro che non finisce sui titoli ma che, taglia dopo taglia, sposta l’asticella di ciò che chiunque può avere gratis sul proprio hardware.

Perché ti riguarda

Il valore di Qwen2.5 non è vincere un benchmark, ma togliere una scusa. Con una famiglia così completa e con i pesi per lo più sotto licenza Apache 2.0 — quella davvero permissiva, senza le clausole d’uso di altri modelli «aperti» — chi costruisce prodotti può scegliere la taglia che il proprio budget regge e mandarla in produzione senza chiedere permesso a nessuno. Per il pubblico italiano conta il fatto che la nostra lingua sia trattata come cittadina di prima classe, non come un ripensamento. La prossima volta che valuti se un assistente ti serve tutto intero o basta una versione piccola sul tuo server, questa è una delle famiglie da mettere sul tavolo.

Per approfondire

Il rapporto: Qwen Team, Alibaba, Qwen2.5 Technical Report, dicembre 2024 — arxiv.org/abs/2412.15115. I pesi delle sette taglie, insieme ai rami Coder e Math, sono distribuiti su Hugging Face; la maggior parte con licenza Apache 2.0.

I commenti sono riservati agli iscritti.

Accedi per commentare