Il 2 agosto il Qwen Team di Alibaba ha presentato Qwen3.8-Max, che definisce il modello più capace della famiglia Qwen. È un mixture-of-experts da 2,4 trilioni di parametri, 95 miliardi dei quali attivi per ogni token, costruito sull’architettura di Qwen3.5. È disponibile via API su QwenCloud con l’identificativo qwen3.8-max, e l’annuncio prometteva una prima volta per la serie: i pesi aperti di un modello di classe Max, «la settimana prossima», su Hugging Face e ModelScope.
Che cosa dichiara il Qwen Team
L’annuncio insiste su due parole del titolo, coding e cowork: compiti lunghi portati a termine da soli, raccontati con tre esecuzioni autonome. Nella prima il modello ha costruito da zero un progetto su GitHub, oh-my-cli, lavorando circa sedici giorni e accumulando, al 30 luglio, 265 commit, 127 pull request e 151 issue. Nella seconda ha riprodotto un paper sulla selezione dei dati di addestramento in circa 125 ore, confermandone i sei risultati principali e proponendo una variante che su AIME24 guadagna 2,7 punti sul metodo del paper, nella sua riproduzione. Nella terza, in 24 ore, ha affrontato una gara su Tianchi, la piattaforma di Alibaba Cloud (riconoscere che cosa vuole un cliente da chat e screenshot), superando 458 squadre umane su 526.
Una tabella finale mette Qwen3.8-Max accanto a Claude Opus 4.8, Claude Fable 5 e GPT-5.6 Sol su 31 test, e una seconda aggiunge Gemini 3.1 Pro su 55 test multimodali. Non ne esce un vincitore su tutto, e a merito dell’annuncio la tabella lo mostra: su SWE-bench Pro Qwen3.8-Max segna 67,7 contro l’80,0 di Fable 5, su Terminal Bench 2.1 resta sotto GPT-5.6 Sol, su PaperBench è primo con 93,0. Sul predecessore Qwen3.7-Max, invece, migliora in tutti e 31 i test, quasi sempre di molto.
Che cosa manca per verificarlo
Le note a piè di tabella sono la parte più istruttiva. Otto test sono dichiarati interni (fra cui QwenSWEBench e CoWorkBench), quindi nessuno fuori da Alibaba può rifarli, e su altri anche i punteggi dei concorrenti li ha misurati il team: su SkillsBench, per esempio, «tutti i risultati vengono dai nostri test». Su Terminal Bench 2.1 Qwen3.8-Max è misurato con Claude Code, media di dieci esecuzioni; per gli altri si riporta il miglior risultato pubblicato, con harness diversi: non è lo stesso esperimento. Su SWE-bench Pro il team ha corretto i compiti che giudicava difettosi e rimisurato tutti. Per Fable 5 si avverte che i risultati «possono includere ripieghi» (fallbacks), senza altri dettagli. Alcuni punteggi sono assegnati da un modello giudice: PaperBench da Claude Opus 4.6, due test professionali da Gemini 3.1 Pro. E nella gara su Tianchi il grafico interattivo dell’annuncio mostra Fable 5 davanti, con l’88,4% delle squadre superate contro l’87,1%. I casi di studio, infine, sono singole esecuzioni scelte da chi vende il modello; di oh-my-cli, almeno, la traccia completa è pubblica su GitHub.
Perché interessa a chi lavora in Italia
Il punto concreto sono i pesi, usciti su Hugging Face come Qwen3.8-2.4T-A95B, e la scheda ufficiale chiarisce che non sono il modello dell’API: quello aperto è solo testo, funziona solo in modalità di ragionamento, ha un contesto nativo di 262.144 token, estendibile a circa un milione, mentre la versione cloud aggiunge visione, risposte senza ragionamento, contesto da un milione di default e strumenti integrati. La licenza non è Apache ma una propria, la «Qwen3.8-Max License»: ricalca la MIT, con due condizioni che scattano oltre soglie da grande azienda (per esempio 100 milioni di utenti mensili). Per chi deve tenere i dati in casa, un modello di questa taglia su macchine proprie è una notizia; ma anche in FP8, la versione pubblicata accanto, i soli pesi occupano circa 2,5 terabyte: roba da data center, non da workstation.
Per chi invece userebbe l’API, l’esempio di codice ufficiale elenca tre regioni, Pechino, Singapore e Virginia, e nessuna in Europa: un dettaglio che conta per chi risponde al GDPR di dove finiscono i dati. L’endpoint compatibile con le API di Anthropic e OpenAI rende la prova semplice: con Claude Code o Codex basta cambiare indirizzo e modello. Resta da capire, con valutazioni indipendenti, quanto dei racconti di sedici giorni di lavoro autonomo regga fuori dalla vetrina.

I commenti sono riservati agli iscritti.
Accedi per commentare