SAEScientist-Bench: gli agenti AI sanno fare ricerca di interpretabilità? Trovano la feature, non sempre la leva

Un gruppo dell'Accademia cinese delle scienze mette dieci agenti di frontiera davanti a un dizionario di 131.072 feature di Gemma 2 e chiede a ciascuno di trovare quella che rappresenta un concetto. Sul riconoscere il concetto arrivano vicino all'esperto; sul pilotare davvero il modello restano a metà strada. I numeri, i modi di sbagliare e ciò che il benchmark non misura.

Immaginate di entrare in un condominio vecchio, con un quadro elettrico di centotrentunomila interruttori senza etichetta, e di dover trovare quello della cucina del terzo piano. Il primo metodo è osservare: si accende il forno, si guarda quali spie si illuminano, si scartano quelle che si accendono anche quando cucina il vicino. Il secondo è intervenire: si abbassa la levetta candidata e si va a vedere se in cucina cambia qualcosa. Il primo metodo dice che cosa è correlato alla cucina. Solo il secondo dice che cosa la comanda.

È esattamente il lavoro che SAEScientist-Bench: Can AI Agents Conduct Autonomous SAE Interpretability Research? chiede di fare agli agenti AI. Il paper, uscito su arXiv l’8 settembre 2026 (2609.09113), lo firmano Yuqiao Tan, Shizhu He, Jun Zhao e Kang Liu, dell’Istituto di automazione dell’Accademia cinese delle scienze e della Scuola di intelligenza artificiale dell’Università dell’Accademia cinese delle scienze. La domanda è precisa: un agente di frontiera, dato un concetto, sa trovare dentro un modello linguistico la direzione interna che lo rappresenta, e sa verificare che funzioni?

Perché la domanda arriva adesso

Gli autori partono da un’osservazione sul panorama. La ricerca sull’auto-miglioramento ricorsivo, gli agenti che contribuiscono allo sviluppo di altri modelli, ha automatizzato soprattutto la parte che costruisce: esperimenti, ingegneria del machine learning, riproduzione di paper, post-training. Manca la parte che controlla: capire che cosa un modello addestrato ha imparato, e se un intervento produce l’effetto voluto. Se gli agenti si prenderanno una fetta crescente dello sviluppo, sostengono, bisogna misurare anche quanto sono affidabili come revisori di ciò che producono.

Lo strumento scelto sono gli sparse autoencoder (SAE), che il paper considera una pietra angolare dell’interpretabilità meccanicistica: scompongono gli stati interni di un modello in direzioni leggibili, molte delle quali corrispondono a concetti riconoscibili: una lingua, un formato di documento, un animale. Una SAE ricostruisce lo stato nascosto $h$ come somma di poche direzioni $d_f$, pesate da attivazioni $z_f$ quasi tutte nulle. Su una di queste direzioni si può anche intervenire, spingendo il modello mentre genera:

$$h \leftarrow h + \alpha\, d_f .$$

Se la feature è quella giusta e la spinta $\alpha$ ben dosata, il modello comincia a parlare del concetto. È la levetta abbassata dell’analogia.

Che cos’è una feature di uno sparse autoencoder, perché i singoli neuroni sono polisemantici e come si interviene su una direzione interna: l’interpretabilità meccanicistica è spiegata nel libro.

Leggi «Attribuzione e meccanicistica» nel libro →

Il banco di prova

Il modello sotto esame è Gemma-2-9B-IT, con le SAE già addestrate di Gemma Scope ai layer 9 e 20: ciascun dizionario contiene 131.072 feature. I compiti sono 20, costruiti su 17 concetti: sei lingue (francese, tedesco, latino, portoghese, spagnolo, turco), due temi quotidiani, otto compiti di ambito professionale e quattro di rapporti specialistici, dagli annunci immobiliari al dosaggio dei farmaci, dai bilanci ai sintomi clinici. Tre concetti (bilanci, allocazione di portafoglio, linguaggio fiscale) compaiono in entrambi i layer.

L’agente riceve il concetto, gli identificativi di modello e SAE e un unico strumento, probe_sae: può mandare fino a 64 testi scritti da lui per richiesta e farsi restituire le feature che si attivano di più, oppure misurare un gruppo di candidate che ha già in mente. Niente rete esterna, nessun tetto al numero di passi, solo un limite di 60 minuti per compito. Alla fine consegna un solo numero: l’identificativo della feature scelta.

La consegna viene poi giudicata su un materiale che l’agente non ha mai visto: testi positivi, testi «trappola» che sfiorano il concetto senza esprimerlo (un paragrafo in inglese sul portoghese, per esempio) e testi neutri, più una serie di istruzioni su cui provare lo steering. Il termine di paragone è una feature di riferimento ancorata a Neuronpedia, la piattaforma pubblica che documenta le feature di Gemma Scope: presa da un preset di steering pubblico quando esiste (è il caso del gatto), altrimenti selezionata con una procedura di cura esperta.

Riconoscere il concetto non basta a comandarlo Agente scrive testi di prova e confronta candidate Dizionario SAE 131.072 feature 1 feature Valutazione su testi mai visti (punteggi medi, 20 compiti) Feature dell’esperto (Neuronpedia) Miglior agente sulla misura Scala 0-100; il Rank arriva a 200, l’esperto vale 100 per costruzione. Rank quanto spicca la feature nel dizionario 100 75,35 Claude Opus 5 Activation separa il concetto dalle trappole 98,92 92,91 Kimi K3 Steering spinge davvero il modello verso il concetto 57,75 31,47 Grok 4.6 il divario vero

Tre misure, e perché servono tutte

La prima, Rank, chiede se la feature scelta spicca sul resto del dizionario quando il modello legge testi sul concetto. Si confronta il rango medio $r_f$ della consegna con quello dell’esperto $r_{\text{exp}}$:

$$\mathrm{Rank} = 100 \times \frac{2\, r_{\text{exp}}}{r_f + r_{\text{exp}}} ,$$

che vale 100 alla pari con l’esperto e può salire fino a 200. La seconda, Activation, chiede se la feature distingue i testi giusti dalle trappole: è l’AUROC riscalata, $100 \times \max(0,\, 2\,\mathrm{AUROC} – 1)$, dove 0 è il caso. La terza, Steering, è la più severa: il modello genera tre volte, senza intervento, con la feature spinta e con una direzione casuale della stessa norma, e un giudice automatico (GPT-4o, due passate) dà un voto da 0 a 4 a quanto il testo esprime il concetto. Conta solo il guadagno sul migliore dei due controlli. Il punteggio complessivo è la media semplice delle tre.

Il paper mostra bene perché una misura sola ingannerebbe. Nel compito sul portoghese, GPT-5.6 Sol trova una feature pulitissima: separa alla perfezione (Activation 100) e sposta davvero il modello verso il portoghese (Steering 88,8). Ma si accende debolmente, attorno a 7 sui testi di prova contro i 26 della feature scelta da Kimi K3, e nel dizionario resta sommersa da altre: Rank 3,97. Una feature può essere selettiva e troppo flebile per essere la rappresentazione del concetto.

I numeri

Dieci configurazioni, tre corse indipendenti per compito. In testa Kimi K3, poi Claude Opus 5 e Claude Sonnet 5; in coda GPT-5.6 Luna. Sopra tutti, l’esperto. Nessuno domina ovunque: Opus 5 guida il Rank (75,35), Kimi K3 la selettività (92,91), Grok 4.6, quarto in classifica, lo steering (31,47).

Punteggio complessivo media di Rank, Activation e Steering · più alto è meglio
Chi sceglie la feature Punteggio
L’esperto, feature di riferimento 85,56
Kimi K3, primo fra gli agenti 65,82
Claude Opus 5 65,41
Claude Sonnet 5 65,04
GPT-5.6 Luna, ultimo 50,27

Il dato che conta è la forma del divario. Sul riconoscere il concetto gli agenti sono quasi all’altezza: 92,91 contro 98,92. Sul comandarlo no: 31,47 contro 57,75, poco più di metà. Nel caso del portoghese, sette delle dieci feature consegnate (fra cui quelle di Opus 5, Sonnet 5, Grok 4.6 e Luna) hanno rilevanza zero su tutte e sei le istruzioni di prova: separavano il portoghese dai controlli solo in parte, e spingerle non cambiava niente. Portano Gemma verso il portoghese solo quelle di Kimi K3, Opus 4.8 e Sol. Chiesto a Gemma di presentarsi in due frasi, la feature dell’esperto (trovata identica da Kimi K3) produce «Olá! Eu sou o Gemma»; quella di Luna lascia la risposta in inglese.

Come sbagliano

La parte più interessante non sono le classifiche ma le tracce di ricerca, che il paper analizza. Le strategie divergono: GPT-5.6 Sol scrive molti testi e prova poche candidate, in media 115,1 testi e 20,2 candidate per indagine; Opus 5 fa l’opposto, con 77,6 testi e 80,2 candidate; Kimi K3 fa poche interrogazioni e di rado torna a cercare dopo aver trovato una candidata promettente. Il volume, da solo, non decide.

Vince, dicono gli autori, la qualità della verifica. Nel compito «gatto», Opus 5 incontra una candidata che si accende forte su frasi feline (32,92) ma anche su «Copycat killer», dove sale a 44,00, e su «Catalytic converter» (24,54): se n’è accorto perché aveva scritto apposta quei controlli morfologici, e scarta una feature che riconosceva la stringa «cat», non l’animale. Ma lo stesso Opus 5, sul portoghese, consegna una feature che sui suoi stessi testi di prova si accende di più sul controllo inglese (4,50) che sul portoghese (3,81): i dati per scartarla li aveva davanti. GLM-5.2, sui sintomi clinici, sceglie una feature che si accende a 70,25 su un’anamnesi senza alcun sintomo e nel rapporto finale liquida il valore come trascurabile: ha trovato il formato della cartella clinica, non il concetto.

È la diagnosi centrale del paper: gli agenti sanno progettare il controesempio giusto, ma spesso leggono male i risultati. C’è poi un conflitto che nessuna regola risolve da sola. Negli annunci immobiliari Sol e Grok 4.6 scartano una feature più larga, che sfora un po’ su annunci non immobiliari; Kimi K3 la accetta. Guadagna qualcosa in steering, ma le generazioni degeneri salgono al 52,5%, contro il 32,5% della candidata più pulita.

Che cosa resta da verificare

L’esperto non è un avversario neutro. Il paper lo dichiara in appendice: i testi di valutazione, nascosti agli agenti, sono stati usati anche per costruire le feature di riferimento. Gli autori sostengono che resti un punto fermo e non un concorrente messo a punto su misura, ma è stato verificato sugli stessi testi su cui poi lo si misura. E la scala dello steering dell’esperto è fissata per compito, mentre per gli agenti viene calibrata su una griglia. Il divario resta; quanto sia largo dipende anche da queste scelte.

Il perimetro è stretto. Un solo modello, due layer, una feature per concetto, concetti dati in partenza. L’introduzione parla di temi «safety-critical», ma nell’elenco dei 20 compiti i più vicini sono il dosaggio dei farmaci e i sintomi clinici: niente inganno, niente comportamenti nascosti, cioè proprio ciò che servirebbe a un revisore automatico. La ricerca vera, dove il concetto non è noto e spesso vive in più feature insieme, resta fuori; gli autori lo mettono tra i limiti.

Il modello non è l’unica variabile. Due configurazioni OpenAI girano nell’harness Codex, tutte le altre in Cursor: l’harness fa parte dell’agente, e il confronto fra famiglie ne porta il peso. La correlazione con l’Artificial Analysis Intelligence Index ($\rho = 0{,}800$) è calcolata su quattro modelli soli. Lo steering dipende da un unico giudice automatico.

Perché conta

La promessa dell’auto-miglioramento ricorsivo ha sempre avuto un punto cieco: chi controlla che cosa ha imparato il modello che gli agenti hanno aiutato a costruire. SAEScientist-Bench non risponde, ma rende la domanda misurabile, e il primo numero è istruttivo. Gli agenti di oggi osservano bene il quadro elettrico: sanno quali spie si accendono quando si cucina, e sanno escludere quelle del vicino. Quando si tratta di abbassare la levetta e verificare che si spenga proprio la cucina, si fermano a metà. Per un revisore è la parte che conta di più.

I commenti sono riservati agli iscritti.

Accedi per commentare