DeepSWE, il benchmark di Datacurve che scrive i compiti da zero per distinguere gli agenti di programmazione

Il 26 maggio la società Datacurve ha presentato DeepSWE, un benchmark per agenti di programmazione firmato da Wenqi Huang, Charley Lee, Leonard Tng e Serena Ge. La premessa è che i benchmark pubblici più usati stiano arrivando a saturazione: in cima alle classifiche i modelli si ammassano in pochi punti, con intervalli di confidenza che spesso si sovrappongono. DeepSWE vuole allargare quella forbice. La classifica è stata aggiornata l’ultima volta il 22 settembre, e in questi giorni su Papers with Code è il secondo benchmark in tendenza per gli agenti di programmazione.

Che cosa dichiarano gli autori

I compiti sono 113, presi da 91 repository open source attivi, con almeno 500 stelle su GitHub e una licenza permissiva, in cinque linguaggi: TypeScript, Go e Python fanno quasi tutto, JavaScript e Rust contano cinque compiti ciascuno. Ogni soluzione di riferimento è scritta da zero, non ricavata da una pull request già esistente, e non viene mai integrata nel progetto originale: secondo gli autori, così nessun modello l’ha vista in addestramento, e difficilmente la vedrà in futuro. Le richieste sono brevi, circa la metà di quelle di SWE-Bench Pro, ma le soluzioni di riferimento aggiungono in media 668 righe contro 120.

Il punto su cui insistono di più è il verificatore, cioè il programma che decide se l’agente ha risolto il compito. In DeepSWE è scritto a mano a partire dalla descrizione del compito, controlla il comportamento osservabile e accetta qualunque implementazione corretta, non solo quella dell’autore. Per misurare la differenza, Datacurve ha estratto a caso 30 compiti da ciascun benchmark, li ha fatti tentare tre volte a dieci configurazioni di agenti e ha fatto rileggere i tentativi a un modello linguistico, confrontando il suo giudizio con quello dei verificatori. Su SWE-Bench Pro il disaccordo riguarda il 32% dei casi, su DeepSWE l’1,4%.

Quanto sbaglia il verificatore (audit Datacurve, %) SWE-Bench Pro DeepSWE Falsi positivi soluzione sbagliata accettata 8,5 0,3 Falsi negativi soluzione corretta respinta 24,0 1,1 Il giudice è un modello linguistico, non un revisore umano: 735 tentativi su DeepSWE, 789 su SWE-Bench Pro.

La classifica attuale, versione 1.1, riporta 28 modelli, tutti fatti girare con lo stesso agente minimale, mini-swe-agent, per confrontare i modelli e non gli strumenti che li circondano. In testa tre modelli appaiati al 74%, con costi medi per compito diversi: 4,43 dollari per GPT-6 Astra, 2,36 per Gemini 3.8 Flash, 11,84 per Claude Opus 5. La vista predefinita mostra 21 modelli e in fondo scende al 36% di Gemini 3.5 Flash; contando tutti e 28, il minimo è il 12% di Gemini 3.1 Pro.

Che cosa manca per verificarlo

Il limite principale lo dichiarano gli autori stessi: l’audit che mette SWE-Bench Pro in cattiva luce è affidato a un giudice automatico, e scrivono che alcuni suoi verdetti saranno sbagliati. Va aggiunto che a misurare il concorrente è chi ha costruito l’alternativa, e che compiti, verificatori e revisioni vengono dallo stesso progetto: una verifica indipendente, per ora, non risulta. Il confronto non è nemmeno alla pari: i verificatori di DeepSWE, prima di entrare nel benchmark, sono stati rivisti anche con modelli linguistici e con tentativi di agenti di frontiera, e un disaccordo basso con un giudice dello stesso tipo ne è in parte il frutto. C’è poi una tensione con la promessa di compiti mai visti: il repository pubblico, con licenza Apache 2.0, contiene anche le soluzioni di riferimento, una cartella per compito. La stringa «canary» che chiede di non usare questi dati per l’addestramento compare sul sito; nei file del repository, a un nostro controllo, non c’è. Infine, la classifica non riflette l’uso dentro Claude Code, Codex CLI o Cursor, come ammettono gli autori (un loro piccolo test su dieci compiti non ha trovato svantaggi per mini-swe-agent); e C++ e Java non ci sono.

Perché interessa in Italia

Per chi deve scegliere un agente di programmazione, la parte più utile non è il podio ma la colonna dei costi: nella classifica di settembre GPT-5.6 Luna arriva al 67% con 0,61 dollari a compito, GLM-5.3 Flash al 63% con 0,24. E il benchmark si può far girare in casa, anche su un sottoinsieme dei compiti, con Pier, lo strumento di Datacurve per il formato Harbor; Pier guida anche Claude Code, Codex, Gemini CLI e opencode: si può misurare lo strumento che si usa davvero. È il modo più onesto di usare una classifica: come metodo da replicare, non come verdetto da citare.

I commenti sono riservati agli iscritti.

Accedi per commentare