Gemma 4, il rapporto tecnico: modelli aperti che vedono e ascoltano, e un 12B senza encoder

Google DeepMind pubblica il rapporto tecnico di Gemma 4, cinque modelli a pesi aperti da 2,3 a 31 miliardi di parametri, con licenza Apache 2.0, modalità di ragionamento e audio e immagini in ingresso. La novità più curiosa è il 12B, che butta via gli encoder e manda i pixel e il suono grezzo direttamente al modello linguistico. Cosa c'è di nuovo, quanto vale sui numeri del paper, e cosa il rapporto non dice.

Chi ha tradotto per un convegno lo sa: il modo classico di far capire un discorso in un’altra lingua è mettere un interprete in cabina. L’oratore parla, l’interprete ascolta, ripensa, riformula, e al pubblico arriva una versione già digerita. Funziona, ma la cabina costa, occupa spazio, e ogni sala ne vuole una sua. L’alternativa è che il pubblico impari abbastanza della lingua dell’oratore da seguirlo direttamente, magari con un glossario in mano. Meno filtri, meno apparato, e il rischio di perdersi qualcosa per strada.

Per anni i modelli multimodali hanno lavorato con la cabina. Un’immagine passa prima da un encoder visivo, una rete a sé addestrata a riassumere i pixel; un audio passa da un encoder acustico; solo il riassunto arriva al modello linguistico. Il rapporto tecnico di Gemma 4, firmato dal Gemma Team di Google DeepMind, datato 19 giugno 2026 e su arXiv dal 2 luglio (2607.02770, seconda versione il 24 luglio), contiene un esperimento che toglie la cabina: il modello da 12 miliardi di parametri riceve i pezzi di immagine e i frammenti di suono quasi grezzi, con un glossario minimo in mano. Il resto del rapporto racconta una famiglia di modelli aperti più convenzionale, e per questo interessante per chi i modelli li deve far girare davvero.

Cinque taglie, una licenza nuova

La famiglia comprende quattro modelli densi e un Mixture-of-Experts. I densi sono E2B ed E4B, pensati per il telefono, con 2,3 e 4,5 miliardi di parametri «effettivi» su 5 e 8 totali (la differenza sono embedding per livello, ereditati da Gemma 3n); poi il 12B e il 31B. Il MoE si chiama 26B-A4B: 26 miliardi di parametri in tutto, circa 3,8 miliardi accesi per ogni token. Tutti leggono testo e immagini; E2B, E4B e 12B anche l’audio. Il vocabolario ha 262 mila voci, i dati di addestramento si fermano a gennaio 2025.

Il dettaglio che per molti conterà più di ogni benchmark sta in una riga dell’introduzione: i modelli sono rilasciati con licenza Apache 2.0. Una licenza standard e permissiva toglie a chi costruisce prodotti una voce dalla lista delle cose da far leggere all’ufficio legale.

Le altre novità dichiarate sono quattro: una modalità di ragionamento (il modello scrive una traccia di pensiero prima di rispondere, attivata con un token di controllo nel turno di sistema), una testa di bozza per la generazione speculativa, versioni quantizzate addestrate apposta per restare precise a pochi bit, e una serie di scelte per tenere a bada la memoria sui contesti lunghi.

La memoria dei contesti lunghi

Quando un modello legge un documento lungo, deve tenere da parte, per ogni token già letto e per ogni livello, una chiave e un valore: è la KV cache, e cresce linearmente con la lunghezza del testo. In prima approssimazione occupa

$$M_{KV} = 2 \cdot L \cdot T \cdot n_{kv} \cdot d_h \cdot b$$

dove $L$ è il numero di livelli, $T$ i token del contesto, $n_{kv}$ le teste chiave-valore, $d_h$ la loro dimensione e $b$ i byte per numero. Il 2 davanti c’è perché si conservano due cose, chiavi e valori.

Che cosa sia la KV cache, perché l’attenzione a finestra scorrevole la accorci e come si alternano livelli locali e globali: il libro lo spiega passo per passo.

Leggi «L’attenzione in pratica» nel libro →

Gemma 4 attacca la formula su tre fronti. Il primo è ereditato da Gemma 3: su sei livelli, cinque guardano solo una finestra locale di testo e uno solo guarda tutto (quattro a uno nel modello più piccolo). Il secondo è nuovo, e piuttosto radicale: nei livelli globali dei modelli più grandi le chiavi fanno anche da valori, cioè il paper pone letteralmente values = keys, citando uno studio del 2026 che si chiede se al Transformer servano davvero tre proiezioni. In quei livelli il 2 della formula diventa, di fatto, un 1. Il terzo è una codifica di posizione, $p$-RoPE con $p = 0{,}25$, applicata ai soli livelli globali. I due modelli piccoli, in più, condividono la cache fra livelli (in rapporto 20/35 in E2B e 18/42 in E4B). Il paper riporta l’effetto combinato di queste scelte come una riduzione della KV cache globale fino al 37,5%, senza scomporre quanto venga da ciascuna.

Il risultato si vede nella tabella della memoria, che riguarda il solo testo. Il 31B in bf16 pesa 64 GB; quantizzato nel formato Q4_0 scende a 19,2 GB, e la KV cache in int8 per un contesto di 32 mila token aggiunge 1,1 GB. Il più piccolo, E2B, nella quantizzazione per dispositivi mobili sta in 0,8 GB. Sulla carta, sono numeri che fanno stare il 31B quantizzato su una sola scheda grafica da 24 GB, e l’E2B su un telefono; il paper non riporta prove su hardware specifico.

Via la cabina: il 12B senza encoder

Gli altri modelli della famiglia usano encoder tenuti congelati durante il pre-addestramento: un Vision Transformer da 150 milioni di parametri per i piccoli e da 550 milioni per i grandi, e per l’audio (solo E2B ed E4B) un encoder da 305 milioni derivato da Universal Speech Model, che rispetto a Gemma 3n ha perso il 55% dei parametri (da 680 a 305 milioni). Il 12B invece è addestrato da zero con un’impostazione diversa.

Con la cabina e senza: due modi di far entrare immagini e suono E2B · E4B · 26B-A4B · 31B encoder separati, congelati immagine audio encoder ViT 150M o 550M Conformer 305M (E2B, E4B) modello linguistico riceve un riassunto Gemma 4 12B senza encoder, addestrato da zero pezzi 48×48 px finestre da 40 ms = 640 numeri una matmul 35M param. proiezione modello linguistico legge i pezzi quasi grezzi Fonte: Gemma 4 Technical Report, § 2.1–2.3

Per le immagini, il 12B prende pezzi da 48×48 pixel a colori e al posto dell’encoder visivo da 550 milioni di parametri usa una sola moltiplicazione di matrici da 35 milioni, più embedding di posizione bidimensionali sommati prima di una normalizzazione. Per l’audio, l’encoder viene «interamente scartato»: il suono campionato a 16 kHz si taglia in finestre da 40 millisecondi, cioè vettori da 640 numeri, che vengono proiettati direttamente nello spazio del modello.

Il vantaggio dichiarato è pratico: niente encoder separati da caricare, meno frammentazione della memoria. Il prezzo è che tutto il lavoro di interpretazione ricade sul modello linguistico, che deve imparare da sé ciò che prima arrivava già masticato. Secondo il paper l’audio regge anche senza encoder: sul riconoscimento vocale del benchmark FLEURS il 12B sbaglia il 3,0% delle parole in italiano e il 6,3% in inglese; nella traduzione del parlato verso l’inglese (CoVoST) ottiene 43,3 punti BLEU dall’italiano, alla pari con l’E4B che ha l’encoder (43,0) ma è molto più piccolo; sulle altre lingue i due si alternano di qualche decimo. Sulla visione il 12B fa meglio dell’E4B e resta dietro al 26B-A4B, come ci si aspetterebbe dalla taglia.

I numeri

Il confronto principale del paper è con la generazione precedente, Gemma 3 27B. Il 31B, di taglia simile, lo stacca ovunque; e sui contesti lunghi, misurati senza ragionamento, il salto è netto.

Il 31B contro Gemma 3 27B percentuali dal rapporto tecnico · più alto è meglio
Benchmark Gemma 3 27B Gemma 4 31B
AIME 2026, senza strumenti 20,8% 89,2%
LiveCodeBench v6 29,1% 80,0%
GPQA Diamond 42,4% 84,3%
MMLU Pro 67,6% 85,2%
RULER a 128 mila token, senza ragionamento 66,0% 96,4%

Il MoE 26B-A4B, con meno di 4 miliardi di parametri attivi, sta a pochi punti dal 31B sul ragionamento (88,3% sull’AIME, 82,3% su GPQA), ma perde terreno sui compiti agentici e sui contesti lunghi (14% contro 36% su Terminal Bench Hard).

C’è poi la classifica umana. Su Arena Text, dove persone confrontano alla cieca le risposte di due modelli, al 19 giugno 2026 il 31B è al 43° posto con 1451 punti Elo (±8), il primo modello denso aperto in classifica; il 26B-A4B è al 61° con 1438. Fra i modelli aperti riportati nella tabella, davanti ci sono solo Mixture-of-Experts da 744 miliardi a 1,6 trilioni di parametri totali, il primo dei quali, GLM 5.1, arriva a 1475. Gemma 3 27B stava al 157° posto.

L’audio dei piccoli migliora rispetto a Gemma 3n: l’E2B guadagna il 12% relativo in traduzione e il 17% in trascrizione, con l’encoder audio che su disco passa da 390 a 87 MB. Anche l’encoder visivo da 150 milioni, quantizzato a 8 bit, dimezza la memoria (da 400 a 200 MB) e, rispetto a Gemma 3n, taglia la latenza sul dispositivo del 44% su hardware recente.

Che cosa voglia dire addestrare un modello sapendo che girerà a 4 bit, e perché la quantizzazione dopo l’addestramento perde di più: nel libro.

Leggi «Meno bit» nel libro →

Quello che il rapporto non dice

È un rapporto tecnico di un’azienda, non un paper di ricerca, e si vede in quello che manca. Il primo vuoto è il più vistoso: la testa di bozza per la generazione speculativa è descritta con cura (un piccolo Transformer a quattro livelli che legge la cache del modello principale; nei modelli piccoli la proiezione sul vocabolario scende da 262 mila a 4096 colonne grazie a cluster di token), ma non c’è un solo numero su quanto acceleri la generazione. Lo stesso per la quantizzazione dei pesi: l’impatto sulla qualità è definito «minimo», senza una tabella che lo misuri.

Il secondo è l’assenza di ablazioni. Non si sa quanto del 37,5% di cache risparmiata venga dalle chiavi riusate come valori e quanto dal resto, né come andrebbe il 12B se avesse gli encoder: l’esperimento più interessante del rapporto non ha il suo gruppo di controllo. Della ricetta di post-addestramento, e in particolare di come sia stata insegnata la modalità di ragionamento, si dice solo che è «simile a Gemma 3» con l’aggiunta del pensiero. La composizione dei dati di pre-addestramento non è quantificata.

Il terzo riguarda i confronti. Sui benchmark statici Gemma 4 è messo a fianco solo di Gemma 3, e con una asimmetria: i modelli nuovi sono valutati in modalità di ragionamento, il vecchio 27B no. Parte del salto su AIME e LiveCodeBench è quindi, verosimilmente, effetto del pensare prima di rispondere, non solo di un modello migliore. Lo si vede nella frase del paper secondo cui E2B «eguaglia grosso modo» Gemma 3 27B con dieci volte meno parametri: vero sulla matematica (37,5% contro 20,8%), meno vero su MMLU Pro, dove resta sotto (60,0% contro 67,6%). E i dieci volte meno contano i parametri effettivi: quelli totali sono 5 miliardi. Il confronto con gli altri modelli aperti c’è solo nella classifica Arena, che misura la preferenza umana e non la correttezza.

Perché conta adesso

Nella classifica riportata dal paper, i modelli aperti in testa sono tutti Mixture-of-Experts da centinaia di miliardi di parametri, che si scaricano liberamente ma che per girare chiedono un armadio di schede grafiche. Gemma 4 lavora sulla fascia di sotto, quella dei modelli che stanno su una sola scheda o su un telefono, e lo fa con licenza Apache 2.0. Per un’azienda italiana che vuole tenere i dati in casa, un modello da 31 miliardi che in 4 bit occupa una ventina di gigabyte, capisce immagini e documenti e sta a una ventina di punti Elo da modelli oltre venti volte più grandi per parametri totali è un’opzione concreta, non una curiosità da classifica.

Il 12B senza encoder è la parte da seguire nei prossimi mesi. Se l’idea tiene anche a taglie maggiori, la cabina dell’interprete smette di essere un pezzo obbligato dei modelli multimodali. Per ora il rapporto mostra che si può fare; quanto costi, rispetto a tenerla, lo dovranno misurare altri.

I commenti sono riservati agli iscritti.

Accedi per commentare