Il 26 agosto Z.ai, la società cinese che sviluppa la famiglia GLM, ha pubblicato sul proprio blog l’annuncio di GLM-5.3-Flash, con un titolo che è già una tesi: «frontier intelligence, flash cost». È un modello da 320 miliardi di parametri totali, di cui 18 attivi per ogni token, e secondo l’azienda è il primo della serie GLM-5 a essere nativamente multimodale: lavora su immagini, documenti e interfacce oltre che sul testo. I pesi sono su Hugging Face, sotto l’organizzazione zai-org, e la scheda del modello indica la licenza MIT.
Che cosa dichiara Z.ai
La promessa principale riguarda il rapporto fra prezzo e capacità. Z.ai scrive che GLM-5.3-Flash supera il suo predecessore GLM-5.2 «a un decimo del prezzo» e si avvicina a Claude Opus 4.8 nei benchmark di programmazione e da agente. Sull’Artificial Analysis Intelligence Index, versione 4.1.1, dichiara un punteggio di 57 con un costo di 0,045 dollari per compito, a prezzo scontato. Fra i numeri citati nel testo ci sono il confronto con GLM-5.2 su DeepSWE v1.1 e quello con Opus 4.8, al massimo livello di sforzo, sul benchmark interno Z.ai Code Bench.
| Benchmark | GLM-5.3-Flash | Confronto |
|---|---|---|
| DeepSWE v1.1 | 63,4 | 46,2 GLM-5.2 |
| AutomationBench | 48,8 | 26,2 |
| Z.ai Code Bench, interno | 29,0 | 29,5 Opus 4.8, sforzo massimo |
La tabella completa dell’annuncio mostra anche dove resta indietro: su NL2Repo Opus 4.8 fa 69,7 contro 56,3, su DeepSWE GPT-5.6 Terra arriva a 69,6.
Il risparmio, secondo l’annuncio, parte dall’architettura. Rispetto a GLM-4.5 i parametri totali sono simili, ma quelli attivi e il numero di strati quasi si dimezzano. L’attenzione è ibrida: una parte lineare per le dipendenze locali e una parte sparsa che recupera il contesto globale attraverso un indicizzatore leggero, alleggerito a sua volta da una tecnica chiamata IndexPool, che fonde con una media pesata quattro vettori chiave dell’indicizzatore in uno. Il contesto arriva a un milione di token. Rispetto al fratello maggiore GLM-5.3, l’azienda dichiara un calcolo di attenzione 3 volte più basso e una cache KV 4,4 volte più piccola, misurati strato per strato per confrontare modelli di taglia diversa; ammette che la cache resta un po’ più grande di quelle di Kimi-K3 e DeepSeek-V4-Flash. Il pre-addestramento usa un corpus multimodale di 30.000 miliardi di token.
C’è poi un capitolo di politica industriale. Prima dell’uscita il modello è stato provato in forma anonima, con il nome ox-alpha, su OpenCode e OpenRouter, e secondo Z.ai è diventato rapidamente il modello più popolare della settimana: tutto quel traffico, sottolinea l’azienda, servito su chip cinesi. Il motore di inferenza, costruito su SGLang, avrebbe triplicato le prestazioni rispetto alla prima versione sullo stesso hardware, fino a costi per token «paragonabili» a quelli delle GPU Nvidia.
Che cosa manca per verificarlo
Per questo modello non c’è un paper dedicato: c’è un post di blog, e la scheda su Hugging Face rimanda al rapporto tecnico di GLM-5, uscito a febbraio. Quasi tutti i benchmark li ha eseguiti Z.ai, con configurazioni scelte da Z.ai e dichiarate in nota (Terminal-Bench 2.1 e Agents’ Last Exam girano dentro l’harness di Claude Code); fa eccezione GDPval-AA, valutato da Artificial Analysis. Restano da replicare da parte di terzi, e Code Bench è un test interno. Il costo per compito dell’indice di Artificial Analysis è «scontato», e non è detto quanto durerà lo sconto. I chip cinesi non hanno un nome, e il confronto con Nvidia non ha una tabella. Nell’annuncio, infine, non si parla di lingue: se l’italiano regga come l’inglese e il cinese resta da provare.
Perché interessa a chi lavora in Italia
La licenza MIT è fra le più permissive: uso commerciale e modifiche consentiti. E i 18 miliardi attivi rendono la generazione relativamente leggera. Ma leggero non vuol dire piccolo: tutti i 320 miliardi devono stare in memoria, e a conti nostri sono circa 640 GB in BF16 e circa la metà in 8 bit (la scheda su Hugging Face indica tensori FP8), cioè comunque un nodo da più GPU, non una workstation. Per un’azienda che vuole tenere i dati in casa è un’opzione concreta, con SGLang, vLLM e TokenSpeed già supportati secondo Z.ai; per tutti gli altri la strada resta l’API. In entrambi i casi, i numeri da guardare saranno quelli che arriveranno da chi non l’ha costruito.

I commenti sono riservati agli iscritti.
Accedi per commentare