Il 24 luglio Anthropic ha rilasciato Claude Opus 5, disponibile da subito su tutte le sue piattaforme e via API con l’identificativo claude-opus-5. Il prezzo non cambia rispetto a Opus 4.8: 5 dollari per milione di token in ingresso, 25 per milione in uscita. C’è anche una modalità Fast, che secondo l’azienda gira a circa 2,5 volte la velocità normale e costa il doppio. Su Claude Max diventa il modello predefinito.
Che cosa dichiara Anthropic
La frase con cui si apre l’annuncio è che Opus 5 «si avvicina all’intelligenza di frontiera di Claude Fable 5 a metà prezzo». Seguono confronti su benchmark, presentati in funzione dello sforzo impostato e del costo per compito. Secondo Anthropic, su Frontier-Bench v0.1 Opus 5 supera tutti gli altri modelli e più che raddoppia il risultato di Opus 4.8 spendendo meno; su CursorBench 3.2, al massimo sforzo, resta entro lo 0,5% del punteggio migliore di Fable 5 a metà del costo; su ARC-AGI 3 il suo punteggio è il triplo di quello del secondo modello; su Zapier AutomationBench il suo tasso di successo è circa 1,5 volte quello del secondo a parità di costo; su OSWorld 2.0, il benchmark di uso del computer, batte il miglior risultato di Fable 5 a poco più di un terzo del costo.
Sul fronte scientifico l’azienda dichiara risultati migliori di Opus 4.8 su tutte le sue valutazioni di scienze della vita, con 10,2 punti percentuali in più su un benchmark interno di chimica organica (ricostruire strutture molecolari da dati spettroscopici) e 7,7 su compiti relativi alle proteine. Sull’allineamento, un audit comportamentale automatico interno lo indica come il modello più allineato che Anthropic abbia prodotto, con 2,3 sul comportamento disallineato complessivo: il valore più basso fra i suoi modelli recenti, su una scala che l’annuncio non spiega. Per le capacità a doppio uso l’azienda sostiene che Opus 5 non sposta la frontiera: si avvicina a Mythos 5 nel trovare vulnerabilità, ma resta molto indietro nello sfruttarle.
Che cosa manca per verificarlo
Quasi tutto quello che conta viene dall’azienda che vende il modello. L’unica nota metodologica pubblicata nell’annuncio riguarda Frontier-Bench: una esecuzione interna, con media su cinque tentativi per compito, in cui quando Opus 5 e Fable 5 rifiutavano per via dei classificatori di sicurezza rispondeva al loro posto Opus 4.8. È un dettaglio che complica il confronto e va letto prima dei grafici. Le testimonianze che accompagnano l’annuncio sono di aziende con accesso anticipato: parlano di «salti» e «passi avanti netti», e i pochi numeri che citano (Box, per esempio, dichiara un 8% in più su Opus 4.8) vengono da valutazioni loro. Per le valutazioni sui rischi Anthropic rimanda alla System Card. Anche sui benchmark pubblici, come ARC-AGI 3, i risultati arrivano dall’annuncio: le riproduzioni indipendenti vanno aspettate.
Perché interessa a chi lavora in Italia
Per chi costruisce agenti sulle API, il listino per token resta quello di Opus 4.8: provarlo non chiede un budget nuovo, ma la spesa reale dipende da quanti token consuma per compito. Accanto al modello escono due novità in beta. La prima permette di cambiare gli strumenti disponibili a metà conversazione senza invalidare la cache del prompt. La seconda è il ripiego automatico: una richiesta segnalata dai classificatori può essere girata a un altro modello invece di essere bloccata. In Claude.ai, Claude Code e Claude Cowork succede già di default, verso Opus 4.8. Significa che la stessa applicazione può ricevere risposte da modelli diversi: chi deve documentare i sistemi che usa, per esempio per l’AI Act, farà bene a registrare quale modello ha risposto.
Chi lavora nella sicurezza informatica troverà, rispetto a Opus 4.8, paletti più stretti su un insieme ristretto di compiti: la ricerca di vulnerabilità nel codice sorgente è ammessa, la scansione di vulnerabilità sui binari, il penetration test e la scrittura di exploit vengono bloccati. Rispetto a Fable 5, in base ai suoi test l’azienda prevede che i classificatori intervengano circa l’85% meno spesso, e rimanda al suo Cyber Verification Program per chi ha bisogno di un accesso meno restrittivo. Resta la domanda che l’annuncio non può chiudere: quanto di questo «quasi Fable a metà prezzo» regge fuori dai grafici di chi lo ha costruito.

I commenti sono riservati agli iscritti.
Accedi per commentare