Cadence, la rete che si ripara da sola: il sito promette l’intelligenza generale, il preprint è molto più prudente

Cadence, di Pragma Research, promette l'intelligenza generale con reti in cui ogni neurone si corregge sui vicini finché tutto si ferma. Letto il preprint, la regola con cui imparano le sue reti che si assestano è l'equilibrium propagation del 2017, la prova diretta della regola riguarda una rete da 159 parametri, e l'autore stesso scrive che la superiorità sui transformer non è stabilita.

Una tovaglia da stendere su un tavolo lungo, e dieci persone intorno. Nessuno la vede tutta: ciascuno tiene un lembo e tira guardando solo i vicini, finché la stoffa smette di muoversi. La forma in cui si ferma è il risultato. Se poi qualcuno porta il proprio angolo nel punto giusto e tutti si riassestano, ognuno può notare di quanto si è spostato il suo pezzo fra le due posizioni di riposo, e ricordarselo per la volta dopo.

È, semplificando molto, l’idea di Cadence, il progetto di Pragma Research che si presenta con un titolo impegnativo: «Toward general intelligence through local repair», verso l’intelligenza generale attraverso la riparazione locale. Una rete neurale in cui ogni unità corregge il proprio stato a partire dalle vicine finché l’insieme si ferma: lo stato di riposo è la risposta, e l’apprendimento è lo stesso processo spinto verso un obiettivo. Abbiamo letto il sito, il codice e il preprint. Non dicono la stessa cosa.

Chi c’è dietro

Nei documenti pubblici Pragma Research Inc. è soprattutto una persona: Bernhard Mueller, che si presenta come «Chief Hacking Officer» con più di trent’anni di ricerca sulla sicurezza offensiva e di reverse engineering. Nel suo elenco di lavori rivendica la creazione di Mythril, lo strumento di analisi della sicurezza dei contratti Ethereum poi passato a ConsenSys (il suo account GitHub è il secondo contributore del progetto per numero di commit), e la guida OWASP ai test di sicurezza delle app mobili, che dice di aver creato e di cui ha scritto in gran parte il capitolo su reverse engineering e manomissione.

Il repository di Cadence è nato il 7 settembre: 322 commit, tutti a suo nome tranne 3, licenza MIT, 320 stelle, e una corsa di versioni dalla 0.1.0 alla 0.18.0, uscita il 27 settembre (i conteggi sono di quel giorno). Il preprint, «Cadence: an architecture for a continuous and efficient stream of intelligence», ha un solo autore, dichiara di non avere finanziamenti esterni e il conflitto d’interessi con l’azienda. Sta su PhilPapers, l’archivio della filosofia, dal 24 settembre, come manoscritto non pubblicato, aggiornato il 27 settembre (è la versione letta qui). Non risulta su arXiv e non è passato da una revisione tra pari.

Che cosa fa, in concreto

Una rete classica calcola la risposta con una passata in avanti, strato dopo strato, e impara con una passata all’indietro che riporta l’errore verso l’inizio: è la backpropagation. Nelle reti di Cadence che «si assestano», anche quando i neuroni sono disposti a strati, il calcolo non va in un verso solo: i neuroni si scambiano segnali finché l’insieme trova un equilibrio, e il preprint dimostra che, con un tetto alla somma, in valore assoluto, dei pesi che entrano in ogni neurone, quell’equilibrio è unico. Per imparare, la rete si riassesta con l’uscita tirata verso il risultato giusto, e ogni sinapsi si aggiorna guardando soltanto i due neuroni che collega, prima e dopo la spinta. Cadence usa di norma una variante «centrata», proposta nel 2020 da Axel Laborieux e colleghi, con una spinta verso l’obiettivo e una in direzione opposta, e confronta quei due stati:

$$\Delta w_{ij} \propto \frac{a_i^{+}\,a_j^{+} – a_i^{-}\,a_j^{-}}{2\beta}$$

dove $a^{+}$ e $a^{-}$ sono le attività dei neuroni nei due stati «spinti» e $\beta$ è la forza della spinta. Non serve una passata all’indietro separata: la spinta sull’uscita si diffonde nella rete attraverso le stesse connessioni, e ogni sinapsi usa solo ciò che ha sul posto. Per questo l’idea interessa da tempo chi studia il cervello, dove una backpropagation è difficile da immaginare, e chi pensa a calcolatori fisici che si assestano da soli (Pragma, sul suo sito, parla di calcolatori ottici).

Due modi di correggere i pesi di una rete Backpropagation strati in fila, due passate in versi opposti 1. In avanti: la rete calcola la risposta. 2. All’indietro: l’errore torna strato per strato fino all’ingresso. Equilibrium propagation il principio, nella versione base del 2017 stato libero stato spinto obiettivo 1. Libero: ogni neurone si aggiusta sui vicini finché la rete si ferma. Il riposo è la risposta. 2. Spinto: l’uscita è tirata verso l’obiettivo e la rete si riassesta. 3. Ogni sinapsi confronta i suoi due neuroni nei due stati: nessun circuito all’indietro.

Quello che la pagina di presentazione non dice, e che la documentazione scritta per chi fa machine learning dice con franchezza, è che il meccanismo ha un nome e una storia. Si chiama equilibrium propagation, l’hanno pubblicato Benjamin Scellier e Yoshua Bengio nel 2017, e poggia sulle reti a energia di John Hopfield, dei primi anni Ottanta. La tabella compilata da Mueller stesso mette ogni «cervello» di Cadence accanto al modello noto più vicino: la rete che si assesta è «una rete di Hopfield continua, o una rete ricorrente a energia, addestrata con equilibrium propagation»; la memoria a record ricalca il modello del cervelletto di Marr e Albus. Il preprint mette Hopfield fra gli antecedenti, presenta l’equilibrium propagation come un risultato già stabilito da cui prende l’interpretazione del gradiente, e indica come contributo i contratti espliciti e la valutazione controllata, non il meccanismo. E la stessa documentazione precisa una cosa che il titolo tace: due delle quattro famiglie di modelli, quella a record e quella a credenze, addestrano i pesi lenti con una passata all’indietro, come una rete qualsiasi.

Che cos’è una rete a energia, e perché lo stato in cui si ferma può fare da memoria o da risposta, è spiegato nel libro, a partire da Hopfield.

Leggi «Modelli a energia» nel libro →

Che cosa dimostrano i test

Il preprint è più cauto della sua vetrina, e va riconosciuto: quasi ogni risultato arriva con i controlli, le «ricevute» che permettono di ricalcolarlo, e con l’elenco di ciò che non dimostra. Il test che valida direttamente la regola di apprendimento usa 32 frasi inglesi del tipo «the SUBJECT near the DISTRACTOR VERB»: la rete deve dire se soggetto e verbo concordano nel numero. Ha 12 neuroni nascosti e 159 parametri, si allena su 24 frasi e si prova sulle altre 8. Un primo protocollo, con 800 aggiornamenti, manca il criterio di successo, e il preprint lo riporta. Un secondo, deciso dopo aver visto il primo (anche questo è dichiarato), usa 8.000 aggiornamenti e semi nuovi: la regola locale arriva dove arriva il gradiente calcolato in modo esatto sulla stessa rete, impiegando più del doppio del tempo.

Che cosa misura il preprint cifre dichiarate dall’autore, non replicate da terzi
Prova Cadence Confronto
Concordanza soggetto e verbo, 159 parametri, 5 semi
Accuratezza sulle 8 frasi mai viste 1,00 1,00 gradiente esatto
Tempo per seme 12,22 s 4,71 s gradiente esatto
Connettoma del moscerino, 150.802 neuroni
Predicati di sterzata tenuti da parte, superati su 13 7 4 al massimo cablaggi rimescolati
Atari, Demon Attack
Ricompensa per decisione 0,39 0,16 gioco a caso
Il «governatore» che decide quando pensare
Bersagli presi 0,961 15,3 passi per decisione 0,962 71,3 passi, sempre sveglio

Il resto sono prove di concetto con molto fornito a mano, e il preprint lo scrive. Il connettoma di un moscerino della frutta, cervello e cordone nervoso, gira come una rete che si assesta, ma mappe sensoriali, punti di lavoro e controllo del corpo sono forniti. Su Demon Attack la selezione fra cablaggi casuali ha trovato giocatori che imparano nel corso della propria «vita», confrontati però solo con il gioco a caso, con i progetti fatti a mano e con copie congelate di sé stessi: nessuno, scrive l’autore, è messo a confronto con un umano o con un agente pubblicato. Il «governatore», che legge la sorpresa del resto del cervello, prende praticamente gli stessi bersagli con circa un quinto del calcolo.

Il sito e il preprint

La distanza sta qui. La home di Pragma Research si apre con «We solve physics, AGI, and the nature of reality itself»: risolviamo la fisica, l’intelligenza artificiale generale e la natura stessa della realtà. Cadence, vi si legge, nasce da una teoria fisica dello stesso autore, la Observer Patch Holography, da cui la probabilità quantistica, la termodinamica, lo spaziotempo a 3+1 dimensioni e la struttura di gauge del Modello Standard discenderebbero «come conseguenze»; a sostegno, «più di 10.900 teoremi verificati» con l’assistente di dimostrazione Lean e previsioni marcate temporalmente sulla blockchain di Bitcoin. Una sezione per gli investitori parla di un potenziale che, se la teoria regge, «si misura in industrie», e di una propulsione che agisce direttamente sullo spaziotempo; la presentazione allegata chiede un round seed da 4 milioni di dollari per diciotto mesi. La revisione tra pari, ammette la stessa pagina, è «in corso».

Un teorema verificato in Lean garantisce che la conclusione segue dalle premesse, non che le premesse descrivano il cervello o l’universo. La pagina di Cadence lo scrive da sé: le sue 169 dimostrazioni «non certificano l’implementazione Python completa né stabiliscono l’intelligenza». E aggiunge che intelligenza generale e creatività «richiedono ulteriori prove». Il preprint è ancora più netto: l’equivalenza con il cervello, la coscienza, una memoria generale lungo tutta la vita e la superiorità sui transformer a parità di informazione, compito e calcolo sono, parole sue, «non stabilite». Non abbiamo trovato repliche o analisi indipendenti del lavoro.

Che cosa servirebbe

Quello che manca lo elenca in buona parte il preprint stesso, nel capitolo sui limiti. Confronti con baseline forti, poco profonde e ricorrenti, a parità di informazione e di risorse, su compiti che usano anche gli altri: il terreno esiste, perché l’equilibrium propagation è già stata portata su CIFAR-10, con l’11,7 per cento di errore proprio nel lavoro di Laborieux che ha introdotto la variante centrata. Repliche fatte da qualcun altro, che il codice aperto e le ricevute rendono più facili del solito. E una revisione tra pari in una sede di machine learning, che per ora non c’è.

Imparare di continuo, mentre si lavora, senza fermarsi per un nuovo addestramento è un problema vero, e l’abstract del preprint lo pone bene: i pesi di un transformer già rilasciato cambiano solo con un altro addestramento, fuori linea. Cadence prova a rispondere con idee note ricombinate in un sistema aperto e documentato con una cura non comune. Per ora la prova diretta che la sua regola locale impara come il gradiente esatto riguarda una rete da 159 parametri. L’obiettivo immediato dichiarato è un cervello a basso consumo a bordo di un robot umanoide, con prestazioni di livello umano. In mezzo c’è tutto il lavoro da fare, ed è lì che il progetto andrà giudicato.

I commenti sono riservati agli iscritti.

Accedi per commentare