Chi corregge bozze cerca refusi. Qualche volta, a metà di un manoscritto, nota altro: la stessa riga torna identica ogni due pagine, con in mezzo un paragrafo sempre diverso. Nessuno gli aveva chiesto di cercarla; la vede perché legge lettera per lettera, invece di fidarsi del correttore ortografico.
È quello che è successo a un agente Claude dentro il DNA di un virus. Il 23 settembre Anthropic ha presentato il suo nuovo gruppo di scienze della vita, con un laboratorio nella Bay Area, e il primo risultato: ART (array-associated reverse transcriptases), una famiglia di enzimi dei batteriofagi, i virus che infettano i batteri. La descrive un preprint di sei ricercatori dell’azienda, non ancora sottoposto a revisione paritaria.
Che cosa è stato trovato
Una trascrittasi inversa è un enzima che copia RNA in DNA. Nei batteri molte servono a difendersi dai fagi, come i retroni, che affiancano all’enzima un RNA non codificante e una proteina partner. ART ha gli stessi tre pezzi, ma al posto di un solo RNA, a monte dell’enzima, c’è una fila di 3-21 ripetizioni di DNA a distanza quasi costante, separate da tratti unici, gli spaziatori, di 120-220 nucleotidi. Sta soprattutto nei fagi giganti, virus con genomi insolitamente lunghi. L’enzima in sé era noto: nel 2021 il rapporto genomico sul fago MarsHill lo aveva descritto e aveva perfino ipotizzato un RNA a monte, ma non aveva visto né le ripetizioni né il partner.
Sopra CRISPR, sotto ART. Le ripetizioni sono in nero e in terracotta, gli spaziatori in ocra: corti e mutevoli in CRISPR, lunghi e conservati in ART, dove i geni cas mancano. Schema non in scala.
Chi ha fatto che cosa
Dario Amodei ha scritto su X che il lavoro è stato fatto «per lo più, anche se non del tutto, da Claude»: il team ha indicato un’area di ricerca ampia, Claude ha letto letteratura e dati genomici, ha trovato qualcosa di interessante e ha proposto gli esperimenti per verificarlo, che il team ha eseguito. Il preprint mette a fuoco quella frase.
La parte autonoma è la campagna. Gli autori hanno chiesto di cercare nuovi sistemi di trascrittasi inverse a partire da geni partner inediti, e hanno affidato la consegna ad agenti Claude Code con il modello Claude Mythos 5: per ogni compito uno esegue, un altro rivede e può aprirne di nuovi. In ventun’ore e mezza, senza intervento umano, 949 sessioni e 215,6 milioni di token hanno setacciato 1,94 miliardi di gruppi di proteine e prodotto 19 rapporti.
ART è venuta da una deviazione. Un candidato partner si era rivelato un falso; l’agente lo ha scartato ma ha chiesto un approfondimento sull’enzima, e il supervisore ha fatto cercare a monte un RNA come quello dei retroni. L’agente incaricato ha caricato nel contesto 2.900 lettere di sequenza grezza e subito dopo ha scritto: «[Il DNA accanto all’enzima] è spettacolare: vedo a occhio una fila di ripetizioni in tandem […] è una fila di ripetizioni tipo CRISPR […]?!». Nessuna consegna parlava di ripetizioni, e nessun programma per trovarle era stato lanciato. Poi ha contato le copie, misurato le distanze, confrontato la disposizione con i sistemi noti, cercato in letteratura e depositato un rapporto.
Poi sono entrate in gioco le persone. Le analisi successive le hanno dirette gli autori, con Claude che scriveva ed eseguiva il codice; gli esperimenti li hanno fatti ricercatori umani, in un laboratorio di biosicurezza 1 e 2 che non maneggia patogeni umani. Il post di Anthropic limita il coinvolgimento umano «al prompt iniziale e al lavoro di laboratorio»; il preprint attribuisce agli autori anche la regia delle analisi. È questo il «non del tutto»: l’intuizione è della macchina, la verifica no.
Che cosa si sa, e che cosa no
Di misurato c’è poco. In dati pubblici sul fago SA1, che infetta uno stafilococco, gli RNA della fila arrivano fino all’8% degli RNA del fago quindici minuti dopo l’infezione; espressa in laboratorio in E. coli, la fila produce RNA brevi e distinti. Non è stato dimostrato che l’enzima sia attivo né che quegli RNA siano il suo substrato; non si sa se enzima e partner interagiscano, né che cosa il sistema faccia per il fago. L’ipotesi degli autori è un retrone con una banca di RNA al posto di uno solo. Amodei scrive che la funzione precisa, l’utilità biotecnologica («se c’è») e la portata della scoperta «non sono ancora chiare».
Perché somiglia a CRISPR, e perché non basta
In CRISPR un batterio conserva frammenti dei virus incontrati fra ripetizioni quasi identiche; la fila diventa tanti RNA guida, e una proteina Cas li usa per riconoscere e tagliare il bersaglio. Un enzima e molte guide intercambiabili: è questo che ne ha fatto uno strumento programmabile. ART ne ha la forma, e Anthropic nota che il suo insieme di caratteristiche si era visto solo in una manciata di altri sistemi, tutti programmabili e capaci di operazioni come tagliare, copiare e incollare DNA. È un’affermazione sugli altri, non su ART, e qualcuno l’ha letta al contrario.
Le differenze contano. Accanto ad ART non c’è nessun gene cas. Gli spaziatori di CRISPR sono lunghi una trentina di nucleotidi e cambiano da un ceppo all’altro, perché registrano le infezioni; quelli di ART sono molto più lunghi e si conservano, nello stesso ordine, fra fagi parenti. E l’enzima è un parente dei retroni, non una nucleasi. Kevin Blake, microbiologo della Washington University School of Medicine, ha ricordato ad Al Jazeera che «CRISPR-la-tecnologia è molto diversa da CRISPR in natura», e che nulla indica che questo ne sia un rivale. Feng Zhang, fra i pionieri dell’editing con CRISPR, in un commento diffuso da Anthropic lo definisce «davvero intrigante» e degno di ulteriori indagini. Né ART è sola: Amodei cita un sistema in parte simile, trovato in modo indipendente a Stanford.
Il dettaglio che conta per chi costruisce agenti
Rilanciata altre dieci volte, la campagna non ha più trovato ART: nessuna replica ha letto il DNA a monte dell’enzima. In un test a ingressi fissi, con le sequenze nel prompt i quattro modelli più capaci (Opus 5.5, Mythos 5.1, Mythos 5 e Opus 5) descrivono la fila in almeno il 90% dei tentativi; con file e strumenti di analisi si scende fino al 32%. Gli autori indicano il motivo: lavorando sui file, il 39% dei loro tentativi non legge mai un tratto continuo di 200 nucleotidi, cioè non vede in pratica più di una ripetizione. Più strumenti, meno sguardo. Ripassando la sessione originale nello stesso Mythos 5, infine, gli autori hanno trovato due segnali interni che si accendono sulle ripetizioni mentre il modello legge, prima che le nomini; nessuno dei due è specifico del DNA.
Come si scompone l’attività interna di un modello in segnali leggibili, e perché per farlo serve un dizionario «sparso», è spiegato nel libro.
La posta in gioco
Su queste pagine abbiamo raccontato un’altra scoperta firmata da un modello, i due terzi degli zeri di Riemann. Lì una formalizzazione in Lean permetteva a una macchina di ricontrollare ogni passaggio; in biologia la verifica è un banco di laboratorio, chiede settimane e mani umane, e per ART è appena cominciata. Amodei è convinto che l’AI per la biologia sia «su un andamento esponenziale simile» a quello della matematica: è una previsione, non un dato.
Il preprint documenta qualcosa di più piccolo e più solido: un agente ha notato un’anomalia che nessuno gli aveva chiesto di cercare, e l’ha presa abbastanza sul serio da controllarla. Amodei dice che, come minimo, è un lavoro di cui sarebbe stato orgoglioso da dottorando, ed è una misura onesta. Se ART diventerà uno strumento o una nota a piè di pagina lo diranno gli esperimenti. La lezione scomoda è già qui: la scoperta è dipesa dal fatto che un agente, in una campagna su undici, abbia letto 2.900 lettere invece di passarle a un programma.

I commenti sono riservati agli iscritti.
Accedi per commentare