Il 9 agosto è comparsa su Hugging Face, sotto l’account meta-models, la scheda di Muse Glimmer-30B, firmata dal Meta Superintelligence Lab. È un transformer denso da circa 29,6 miliardi di parametri, encoder visivo compreso, distillato da Muse Spark e descritto come «costruito apposta per compiti agentici autonomi su hardware consumer». Accetta testo e immagini, risponde in testo, ha un contesto di oltre 131.000 token e una data di conoscenza ferma al 4 gennaio 2026.
Che cosa dichiara Meta
La promessa della scheda è pratica: un agente che pianifica, chiama strumenti, legge schermate e si riprende dagli errori, tutto in locale, senza cloud né rete. Per farcelo stare, Meta distribuisce due versioni quantizzate a circa 4 bit. La più piccola, K-Quant-17GB, porta il modello linguistico sotto i 20 GB e, secondo la scheda, lascia spazio in 24 GB di memoria video per la cache, l’encoder visivo e il piccolo modello che accelera la generazione. La perdita dichiarata è dell’1,0% di media su 15 benchmark, dello 0,2% per la variante da 32 GB.
L’acceleratore è un drafter basato su DFlash, una rete di cinque strati che propone blocchi di 16 token alla volta, poi verificati in parallelo dal modello principale: è lo speculative decoding, che non cambia l’output ma il tempo per ottenerlo. I guadagni dichiarati, misurati sulla variante da 24 GB con batch da uno e decodifica greedy (ExecuTorch sui Mac, llama.cpp sulla scheda Nvidia), vanno da 1,5 volte su un MacBook con M4 Max a 3,1 volte su una RTX 5090.
Sui benchmark, la tabella mette Glimmer accanto a Gemma4-31B e Qwen3.6-27B, tutti in modalità di ragionamento. Il quadro non è quello di un vincitore su tutto, e la tabella ha il merito di mostrarlo: su 22 righe a punteggio singolo Glimmer è primo in 12, Qwen3.6 in 8, Gemma4 in 2. Va forte su gran parte dei test agentici generali, dove vince 5 righe su 8, e su SWE-Bench Pro; resta dietro di poco su SWE-Bench Verified e di parecchio su TerminalBench 2.1 e OSWorld-Verified, cioè proprio sull’uso del terminale e del computer.
| Benchmark | Glimmer | Avversario |
|---|---|---|
| MCP Atlas | 75,5 | 62,5 Qwen3.6 |
| SWE-Bench Pro | 51,2 | 50,2 |
| SWE-Bench Verified | 76,0 | 77,2 |
| TerminalBench 2.1 | 51,7 | 60,7 |
| OSWorld-Verified | 65,9 | 75,6 |
Che cosa manca per verificarlo
I numeri sono tutti di Meta, su avversari scelti da Meta, e la metodologia sta in un rapporto a parte. Le velocità sono medie su un insieme di prompt, definito «vario», che la scheda non descrive. La perdita da quantizzazione è una media su 15 benchmark non elencati, e una media può nascondere un compito che peggiora molto. La scheda non rimanda a un paper sul modello: i due riferimenti arXiv riguardano l’encoder visivo e DFlash. I dati di addestramento includono «informazioni dai prodotti e servizi di Meta», senza altri dettagli.
Perché interessa a chi lavora in Italia
Il punto concreto è la licenza. I Llama uscivano con una licenza propria di Meta; Glimmer esce in Apache 2.0, pesi completi in BF16 compresi. Accanto però c’è un file di policy d’uso con un lungo elenco di divieti, e come le due cose si combinino è una domanda da girare a un legale prima di costruirci un prodotto. Il secondo punto è il luogo: un agente che gira su una scheda da 24 GB tiene i dati in ufficio, e per chi deve rispondere al GDPR non è poco. Resta un’incognita che riguarda noi: la scheda dice che il modello è addestrato su dati in oltre cento lingue, ammette che fuori da un insieme «fortemente supportato» le prestazioni possono calare, e quell’insieme non lo elenca. Se l’italiano ne faccia parte, per ora, si scopre solo provando.

I commenti sono riservati agli iscritti.
Accedi per commentare