All’inizio di settembre OpenAI ha presentato GPT-6 Astra, con cui apre la generazione GPT-6 (il 22 settembre si sono aggiunti GPT-6 Sol e GPT-6 Luna). Il rilascio è graduale: prima un gruppo ristretto di organizzazioni, poi ChatGPT Plus, Pro, Business ed Enterprise, l’API (gpt-6-astra), Microsoft Azure e AWS Bedrock. Il prezzo standard è di 10 dollari per milione di token in ingresso e 50 per milione in uscita; nell’API la modalità Fast promette fino al doppio della velocità, al doppio del prezzo.
Che cosa dichiara OpenAI
La frase d’apertura è «il modello più intelligente e più allineato al mondo». Secondo l’azienda, Astra è lo stato dell’arte su uso del computer, navigazione, programmazione, sicurezza informatica, scienza e lavoro professionale. Fra i numeri messi in vetrina ci sono due confronti diretti. Su Terminal-Bench 4.0 Astra fa 57,9% contro il 55,8% di Claude Fable 5.1; su OSWorld 2.0 fa 72,6% contro il 65,7% del predecessore GPT-5.6 Sol. Poi la «saturazione» di tre benchmark: 98% su FrontierMath Tier 4, 99,9% su ARC-AGI-3, 100% su ExploitBench. OpenAI sostiene anche che il modello abbia contribuito a due risultati sulla distanza fra numeri primi: in uno la distanza entro cui cadono infinite coppie di primi scende a 186 (il miglior risultato noto era 240).
Sulla sicurezza, due affermazioni pesano più delle altre. La prima: Astra raggiunge la soglia Critical per la cybersicurezza nel Preparedness Framework dell’azienda; in una valutazione interna ha scoperto e usato due vulnerabilità zero-day finora sconosciute, che OpenAI dice di stare segnalando ai manutentori. La versione pubblica rifiuta i compiti di sicurezza più avanzati, come scrivere exploit dimostrativi (proof-of-concept). La seconda è un’ammissione: nei test che gli chiedevano di eludere il monitoraggio, il ragionamento scritto di Astra è risultato più difficile da monitorare di quello di GPT-5.6 Sol, e l’azienda scrive di prendere sul serio il calo.
Che cosa manca per verificarlo
Quasi tutti i numeri di Astra li ha misurati chi lo vende, e diversi test sono interni; fa eccezione il riscontro della ARC Prize Foundation, secondo cui Astra batte la baseline umana di efficienza sul 96% dei livelli di ARC-AGI-3. Le note in fondo vanno lette prima dei grafici: i punteggi sono «il massimo a qualunque livello di sforzo»; ARC-AGI-3 è stato eseguito con l’harness dell’API di OpenAI, che cambia due impostazioni (non mirate a quel test, precisa l’azienda); su HealthBench i modelli Anthropic li ha valutati OpenAI stessa, su BenchCAD i loro punteggi riflettono tre modifiche al test, e su ScreenSpot-Pro ed ExploitGym il valore attribuito a Fable viene in realtà da Mythos, la versione con meno salvaguardie. E «saturare» vuol dire anche 97,6%: è il valore in tabella di FrontierMath Tier 4, arrotondato a 98 nel testo.
Poi ci sono le righe fuori vetrina. Sull’Artificial Analysis Intelligence Index, uno dei due indici di terzi in tabella, Astra fa 61,2: sopra GPT-5.6 Sol, ma sotto Claude Fable 5.1, Opus 5 e Fable 5 (figura). Sull’altro, dedicato agli agenti di programmazione, fa 67,0, dietro Opus 5 (68,1) e Fable 5 (67,2). Su Humanity’s Last Exam con strumenti fa 57,2%, ultimo fra i modelli riportati (Fable 5.1 fa 65,0%). Le dimostrazioni sui numeri primi, infine, sono pubbliche con i materiali di verifica: resta da vedere che cosa ne diranno i matematici.
Perché interessa a chi lavora in Italia
Per chi costruisce su API c’è un dettaglio operativo: quando i controlli di sicurezza fermano un’azione, in ChatGPT e Codex può essere chiesto di rivederla, via API il compito si interrompe. Una pipeline automatica deve saperlo gestire, e OpenAI riconosce che questi controlli possono fermare lavoro legittimo, anche di difesa informatica. Nei piani Enterprise Astra al lancio è spento e va abilitato dall’amministratore, e per i clienti API idonei è disponibile la conservazione zero dei dati: due leve utili a chi deve rendere conto dei sistemi che adotta e dei dati che vi passano, a partire dal GDPR. Chi fa sicurezza, infine, ha davanti un modello che il produttore stesso colloca alla soglia Critical sul fronte cyber, e che per ora rifiuta gli exploit dimostrativi; con il programma Daybreak OpenAI promette salvaguardie meno restrittive nelle prossime settimane. Resta la domanda di ogni lancio: quanto di «più intelligente al mondo» reggerà quando a misurare saranno altri.

I commenti sono riservati agli iscritti.
Accedi per commentare