Una tovaglia da stendere su un tavolo lungo, e dieci persone intorno. Nessuno la vede tutta: ciascuno tiene un lembo e tira guardando solo i vicini, finché la stoffa smette di muoversi. La forma in cui si ferma è il risultato. Se poi qualcuno porta il proprio angolo nel punto giusto e tutti si riassestano, ognuno può notare di quanto si è spostato il suo pezzo fra le due posizioni di riposo, e ricordarselo per la volta dopo.
È, semplificando molto, l’idea di Cadence, il progetto di Pragma Research che si presenta con un titolo impegnativo: «Toward general intelligence through local repair», verso l’intelligenza generale attraverso la riparazione locale. Una rete neurale in cui ogni unità corregge il proprio stato a partire dalle vicine finché l’insieme si ferma: lo stato di riposo è la risposta, e l’apprendimento è lo stesso processo spinto verso un obiettivo. Abbiamo letto il sito, il codice e il preprint. Non dicono la stessa cosa.
Chi c’è dietro
Nei documenti pubblici Pragma Research Inc. è soprattutto una persona: Bernhard Mueller, che si presenta come «Chief Hacking Officer» con più di trent’anni di ricerca sulla sicurezza offensiva e di reverse engineering. Nel suo elenco di lavori rivendica la creazione di Mythril, lo strumento di analisi della sicurezza dei contratti Ethereum poi passato a ConsenSys (il suo account GitHub è il secondo contributore del progetto per numero di commit), e la guida OWASP ai test di sicurezza delle app mobili, che dice di aver creato e di cui ha scritto in gran parte il capitolo su reverse engineering e manomissione.
Il repository di Cadence è nato il 7 settembre: 322 commit, tutti a suo nome tranne 3, licenza MIT, 320 stelle, e una corsa di versioni dalla 0.1.0 alla 0.18.0, uscita il 27 settembre (i conteggi sono di quel giorno). Il preprint, «Cadence: an architecture for a continuous and efficient stream of intelligence», ha un solo autore, dichiara di non avere finanziamenti esterni e il conflitto d’interessi con l’azienda. Sta su PhilPapers, l’archivio della filosofia, dal 24 settembre, come manoscritto non pubblicato, aggiornato il 27 settembre (è la versione letta qui). Non risulta su arXiv e non è passato da una revisione tra pari.
Che cosa fa, in concreto
Una rete classica calcola la risposta con una passata in avanti, strato dopo strato, e impara con una passata all’indietro che riporta l’errore verso l’inizio: è la backpropagation. Nelle reti di Cadence che «si assestano», anche quando i neuroni sono disposti a strati, il calcolo non va in un verso solo: i neuroni si scambiano segnali finché l’insieme trova un equilibrio, e il preprint dimostra che, con un tetto alla somma, in valore assoluto, dei pesi che entrano in ogni neurone, quell’equilibrio è unico. Per imparare, la rete si riassesta con l’uscita tirata verso il risultato giusto, e ogni sinapsi si aggiorna guardando soltanto i due neuroni che collega, prima e dopo la spinta. Cadence usa di norma una variante «centrata», proposta nel 2020 da Axel Laborieux e colleghi, con una spinta verso l’obiettivo e una in direzione opposta, e confronta quei due stati:
$$\Delta w_{ij} \propto \frac{a_i^{+}\,a_j^{+} – a_i^{-}\,a_j^{-}}{2\beta}$$
dove $a^{+}$ e $a^{-}$ sono le attività dei neuroni nei due stati «spinti» e $\beta$ è la forza della spinta. Non serve una passata all’indietro separata: la spinta sull’uscita si diffonde nella rete attraverso le stesse connessioni, e ogni sinapsi usa solo ciò che ha sul posto. Per questo l’idea interessa da tempo chi studia il cervello, dove una backpropagation è difficile da immaginare, e chi pensa a calcolatori fisici che si assestano da soli (Pragma, sul suo sito, parla di calcolatori ottici).
Quello che la pagina di presentazione non dice, e che la documentazione scritta per chi fa machine learning dice con franchezza, è che il meccanismo ha un nome e una storia. Si chiama equilibrium propagation, l’hanno pubblicato Benjamin Scellier e Yoshua Bengio nel 2017, e poggia sulle reti a energia di John Hopfield, dei primi anni Ottanta. La tabella compilata da Mueller stesso mette ogni «cervello» di Cadence accanto al modello noto più vicino: la rete che si assesta è «una rete di Hopfield continua, o una rete ricorrente a energia, addestrata con equilibrium propagation»; la memoria a record ricalca il modello del cervelletto di Marr e Albus. Il preprint mette Hopfield fra gli antecedenti, presenta l’equilibrium propagation come un risultato già stabilito da cui prende l’interpretazione del gradiente, e indica come contributo i contratti espliciti e la valutazione controllata, non il meccanismo. E la stessa documentazione precisa una cosa che il titolo tace: due delle quattro famiglie di modelli, quella a record e quella a credenze, addestrano i pesi lenti con una passata all’indietro, come una rete qualsiasi.
Che cos’è una rete a energia, e perché lo stato in cui si ferma può fare da memoria o da risposta, è spiegato nel libro, a partire da Hopfield.
Che cosa dimostrano i test
Il preprint è più cauto della sua vetrina, e va riconosciuto: quasi ogni risultato arriva con i controlli, le «ricevute» che permettono di ricalcolarlo, e con l’elenco di ciò che non dimostra. Il test che valida direttamente la regola di apprendimento usa 32 frasi inglesi del tipo «the SUBJECT near the DISTRACTOR VERB»: la rete deve dire se soggetto e verbo concordano nel numero. Ha 12 neuroni nascosti e 159 parametri, si allena su 24 frasi e si prova sulle altre 8. Un primo protocollo, con 800 aggiornamenti, manca il criterio di successo, e il preprint lo riporta. Un secondo, deciso dopo aver visto il primo (anche questo è dichiarato), usa 8.000 aggiornamenti e semi nuovi: la regola locale arriva dove arriva il gradiente calcolato in modo esatto sulla stessa rete, impiegando più del doppio del tempo.
| Prova | Cadence | Confronto |
|---|---|---|
| Concordanza soggetto e verbo, 159 parametri, 5 semi | ||
| Accuratezza sulle 8 frasi mai viste | 1,00 | 1,00 gradiente esatto |
| Tempo per seme | 12,22 s | 4,71 s gradiente esatto |
| Connettoma del moscerino, 150.802 neuroni | ||
| Predicati di sterzata tenuti da parte, superati su 13 | 7 | 4 al massimo cablaggi rimescolati |
| Atari, Demon Attack | ||
| Ricompensa per decisione | 0,39 | 0,16 gioco a caso |
| Il «governatore» che decide quando pensare | ||
| Bersagli presi | 0,961 15,3 passi per decisione | 0,962 71,3 passi, sempre sveglio |
Il resto sono prove di concetto con molto fornito a mano, e il preprint lo scrive. Il connettoma di un moscerino della frutta, cervello e cordone nervoso, gira come una rete che si assesta, ma mappe sensoriali, punti di lavoro e controllo del corpo sono forniti. Su Demon Attack la selezione fra cablaggi casuali ha trovato giocatori che imparano nel corso della propria «vita», confrontati però solo con il gioco a caso, con i progetti fatti a mano e con copie congelate di sé stessi: nessuno, scrive l’autore, è messo a confronto con un umano o con un agente pubblicato. Il «governatore», che legge la sorpresa del resto del cervello, prende praticamente gli stessi bersagli con circa un quinto del calcolo.
Il sito e il preprint
La distanza sta qui. La home di Pragma Research si apre con «We solve physics, AGI, and the nature of reality itself»: risolviamo la fisica, l’intelligenza artificiale generale e la natura stessa della realtà. Cadence, vi si legge, nasce da una teoria fisica dello stesso autore, la Observer Patch Holography, da cui la probabilità quantistica, la termodinamica, lo spaziotempo a 3+1 dimensioni e la struttura di gauge del Modello Standard discenderebbero «come conseguenze»; a sostegno, «più di 10.900 teoremi verificati» con l’assistente di dimostrazione Lean e previsioni marcate temporalmente sulla blockchain di Bitcoin. Una sezione per gli investitori parla di un potenziale che, se la teoria regge, «si misura in industrie», e di una propulsione che agisce direttamente sullo spaziotempo; la presentazione allegata chiede un round seed da 4 milioni di dollari per diciotto mesi. La revisione tra pari, ammette la stessa pagina, è «in corso».
Un teorema verificato in Lean garantisce che la conclusione segue dalle premesse, non che le premesse descrivano il cervello o l’universo. La pagina di Cadence lo scrive da sé: le sue 169 dimostrazioni «non certificano l’implementazione Python completa né stabiliscono l’intelligenza». E aggiunge che intelligenza generale e creatività «richiedono ulteriori prove». Il preprint è ancora più netto: l’equivalenza con il cervello, la coscienza, una memoria generale lungo tutta la vita e la superiorità sui transformer a parità di informazione, compito e calcolo sono, parole sue, «non stabilite». Non abbiamo trovato repliche o analisi indipendenti del lavoro.
Che cosa servirebbe
Quello che manca lo elenca in buona parte il preprint stesso, nel capitolo sui limiti. Confronti con baseline forti, poco profonde e ricorrenti, a parità di informazione e di risorse, su compiti che usano anche gli altri: il terreno esiste, perché l’equilibrium propagation è già stata portata su CIFAR-10, con l’11,7 per cento di errore proprio nel lavoro di Laborieux che ha introdotto la variante centrata. Repliche fatte da qualcun altro, che il codice aperto e le ricevute rendono più facili del solito. E una revisione tra pari in una sede di machine learning, che per ora non c’è.
Imparare di continuo, mentre si lavora, senza fermarsi per un nuovo addestramento è un problema vero, e l’abstract del preprint lo pone bene: i pesi di un transformer già rilasciato cambiano solo con un altro addestramento, fuori linea. Cadence prova a rispondere con idee note ricombinate in un sistema aperto e documentato con una cura non comune. Per ora la prova diretta che la sua regola locale impara come il gradiente esatto riguarda una rete da 159 parametri. L’obiettivo immediato dichiarato è un cervello a basso consumo a bordo di un robot umanoide, con prestazioni di livello umano. In mezzo c’è tutto il lavoro da fare, ed è lì che il progetto andrà giudicato.

I commenti sono riservati agli iscritti.
Accedi per commentare