Jev-Mem, la memoria degli agenti che decide senza scrivere: un «Sistema Uno» per archiviare e cercare

Un gruppo della University of Texas at Dallas toglie al modello linguistico il lavoro di archivista: le decisioni piccole e continue della memoria di un agente (che tipo di ricordo è, a che cosa si collega, dove cercare, quando smettere) le prende un controllore rapido che risponde con probabilità, non con testo. Su LoCoMo i numeri sono buoni in accuratezza e ottimi in velocità. Che cosa li produce, però, il paper non lo isola.

In una redazione di quotidiano il caporedattore non archivia i ritagli. Se ogni volta che arriva un dispaccio fosse lui a decidere in quale cassetto metterlo, a quali pratiche collegarlo e, quando serve, a frugare nello schedario finché non trova abbastanza per scrivere, il giornale non uscirebbe. Per questo esiste l’archivista: uno che non scrive articoli ma sa, in un attimo, che quel foglio va sotto «trasporti», che riguarda la stessa vicenda di martedì e che, per il pezzo di domani, bastano tre cartelle e non trenta. Il caporedattore arriva solo alla fine, a mettere insieme il racconto.

Molti sistemi di memoria per agenti basati su modelli linguistici fanno il contrario: chiedono al caporedattore di fare anche l’archivista. È la critica da cui parte Jev-Mem: System-One-Controlled Agentic Memory for Efficient AI Agents, uscito su arXiv il 21 settembre 2026 (2609.23986) e firmato da Dongming Jiang, Yi Li e Bingzhe Li della University of Texas at Dallas, lo stesso gruppo che a inizio anno aveva proposto MAGMA, una memoria a più grafi con quattro tipi di relazione. Il codice è pubblico su GitHub.

Il costo nascosto della memoria

Un agente che lavora a lungo (un assistente personale, un agente di programmazione) accumula preferenze, decisioni, eventi, e presto supera quello che sta in una finestra di contesto. Allungare la finestra non risolve: i modelli non sfruttano bene tutte le posizioni di un input lungo. Servono memorie esterne che si scrivono con l’esperienza e si interrogano al bisogno. Gli autori le descrivono con tre funzioni: il recupero $E_t = R(q_t, M_t)$, la risposta $o_t = L(q_t, E_t)$ e l’aggiornamento $M_{t+1} = U(M_t, q_t, o_t)$.

Le memorie recenti sono diventate sofisticate: annotano i ricordi, li collegano in grafi semantici, temporali, causali, li consolidano. Ognuno di questi passaggi è una decisione, e in molti sistemi la decisione la prende una regola fissa, efficiente ma rigida, oppure un modello autoregressivo, che genera testo token per token da analizzare poi. L’osservazione centrale del paper è che queste decisioni sono semantiche ma non generative: chiedono un’etichetta, una probabilità, un punteggio, non un paragrafo. Pagarle al prezzo della generazione, e pagarle a ogni scrittura e a ogni ricerca, può fare della gestione della memoria, sostengono gli autori, una delle voci principali della latenza.

La cornice è quella, presa dalla psicologia, del Sistema Uno e del Sistema Due: pensiero rapido e automatico da una parte, ragionamento lento e deliberato dall’altra. Gli autori precisano in appendice che è un’analogia su come si distribuisce il calcolo, non una tesi su come funziona la mente.

Jev-Mem dà per nota la cassetta degli attrezzi del recupero: ricerca vettoriale e per parole chiave, la loro fusione con la reciprocal rank fusion, il recupero su grafo. È tutto nel capitolo del libro sul RAG avanzato.

Leggi «RAG avanzato» nel libro →

Tre piani, un solo archivista

L’architettura ha tre componenti. Un piano di controllo Sistema Uno, che prende le decisioni frequenti. Un piano dati, la memoria vera: ogni osservazione diventa un nodo canonico, e fra i nodi corrono archi di quattro tipi (semantico, temporale, causale, di entità), con due indici, vettoriale e lessicale, come porte d’ingresso. E un piano di ragionamento Sistema Due, il modello linguistico, che nel percorso normale interviene solo alla fine, per sintetizzare la risposta dalle prove raccolte.

Il controllore è Jev, di TypeSafe AI, che prende uno stato strutturato e un lotto di domande esplicite, ciascuna con un’istruzione e i criteri per il vero e per il falso, e restituisce un numero fra 0 e 1 per ciascuna, oppure una distribuzione su alternative che si escludono a vicenda. Niente testo libero da interpretare, e domande che condividono lo stato viaggiano in una sola chiamata. Gli autori ci tengono a dire che la novità non è Jev ma la separazione: Jev ne è una realizzazione concreta.

Jev-Mem: il Sistema Uno decide, il Sistema Due scrive SCRITTURA osservazione tipo del ricordo 4 punteggi, 1 chiamata candidati ricerca fissa, max 10 quali archi? arco se p ≥ 0,60 MEMORIA: nodi canonici, archi di quattro tipi semantico causale temporale entità LETTURA domanda quali grafi? budget ripartito prove sufficienti? sì: ci si ferma no: espandi e ripunteggia i vicini Sistema Due (LLM) scrive la risposta decisione del Sistema Uno (probabilità, non testo)

In scrittura, ogni osservazione valida entra: la versione attuale non scarta niente all’ingresso, per non perdere ciò che oggi sembra irrilevante e domani servirà. Il controllore assegna quattro punteggi non esclusivi (episodico, semantico, procedurale, preferenza). Poi, per non confrontare il nuovo ricordo con tutta la memoria, una ricerca deterministica (similarità vettoriale, parole in comune, entità condivise, vicinanza nel tempo) seleziona al massimo dieci candidati, e solo su quelle coppie Jev giudica se esista un legame semantico o causale, e in quale direzione. Un arco nasce se il punteggio arriva ad almeno 0,60. Quando l’informazione strutturata c’è già, il controllore non viene nemmeno chiamato: le date ordinano da sole, gli identificativi uguali collegano da soli.

In lettura, la ricerca diventa un anello di controllo. Il controllore stima quanto ciascun grafo serva alla domanda, $p_g(q)$, e il budget di espansione (80 nella configurazione descritta in appendice) si divide fra i grafi attivi, dopo un minimo garantito a ciascuno, in proporzione:

$$w_g(q) = \frac{p_g(q)^{\gamma}}{\sum_{j \in A(q)} p_j(q)^{\gamma}},$$

con $\gamma = 1$ nella stessa configurazione. La ricerca parte da ancore trovate fondendo i due indici, e dopo ogni giro Jev valuta le prove raccolte: se bastano, se manca qualcosa, se ci sono contraddizioni, se continuare servirebbe. Ci si ferma quando

$$s_d \ge 0{,}95 \;\wedge\; m_d \lt 0{,}15 \;\wedge\; c_d \lt 0{,}15,$$

oppure quando l’utilità attesa di un altro giro scende sotto 0,15. Tetti fissi su profondità, nodi visitati, chiamate al controllore (16) e tempo (15 secondi) impediscono al controllo stesso di crescere senza limite. Solo a quel punto le prove migliori passano al Sistema Due.

I numeri

La valutazione è su LoCoMo, un benchmark di conversazioni molto lunghe su più sessioni, con gpt-4o-mini come modello di risposta e un modello linguistico come giudice. I confronti sono con il contesto completo e con quattro memorie recenti: A-MEM, MemoryOS, Nemori e MAGMA.

Nel punteggio complessivo Jev-Mem supera MAGMA, il migliore dei concorrenti, con un miglioramento relativo dell’11%. Il contesto completo si ferma a 0,481. Il salto più vistoso è nella categoria delle domande avversarie, quelle costruite per indurre in errore.

Jev-Mem su LoCoMo dalla tabella del paper · punteggio del giudice automatico · più alto è meglio
Domande Jev-Mem Confronto
Complessivo 0,777 0,700 MAGMA
Avversarie 0,962 0,742
A più passaggi 0,623 0,569 Nemori
A dominio aperto 0,618 0,517 MAGMA

Ma è sui tempi che la differenza diventa di un altro ordine. Costruire la memoria dell’intero benchmark richiede 158 secondi, contro i 1.044 di Nemori, il più rapido fra gli altri: 6,6 volte meno. A-MEM e MemoryOS superano i 3.000. La latenza media per domanda è di 0,93 secondi: il 36,7% in meno degli 1,47 di MAGMA, e meno anche degli 1,74 del contesto completo. MemoryOS, per confronto, impiega 32,68 secondi.

Tempo per costruire la memoria su LoCoMo (secondi) A-MEM 3.636 MemoryOS 3.276 MAGMA 1.404 Nemori 1.044 Jev-Mem 158 Fonte: tabella 2 del paper

Che cosa resta da verificare

Manca l’esperimento che isola l’idea. Il paper non ha ablazioni. Jev-Mem mette insieme molti ingredienti: il controllore, la conservazione di tutte le osservazioni, le soglie, l’arresto adattivo, la fusione dei due indici. Il confronto con MAGMA, dello stesso gruppo e con gli stessi quattro tipi di relazione, non dice quanto del guadagno in accuratezza venga dal Sistema Uno e quanto dal resto, né quanto costi, in punti, affidare le decisioni a quello che gli autori stessi chiamano un ragionatore più debole.

Il controllore è una scatola chiusa. Jev è un prodotto di TypeSafe AI, chiamato attraverso il suo client (l’appendice parla di richieste a un «provider»). Il paper non dice che modello ci sia dietro, quanto sia grande, dove giri, quanto costi una chiamata, né su quale hardware siano stati misurati i tempi. I tempi includono quindi un componente che dall’esterno non si può ispezionare, e con ogni probabilità il codice pubblico da solo non basta a rifare gli esperimenti senza accesso a Jev. L’appendice aggiunge un’avvertenza onesta: i valori restituiti non sono da considerare probabilità calibrate, eppure le decisioni poggiano su soglie fisse (0,60 per gli archi, 0,85 per la consolidazione, 0,95 e 0,15 per l’arresto) di cui il paper non spiega la scelta.

Un solo benchmark, e un testo che non torna sempre con le tabelle. Il setup annuncia «due benchmark molto usati», ma ne descrive e riporta uno solo. Nel commento ai risultati alcuni numeri differiscono dalla tabella (0,625 contro 0,623 sui passaggi multipli, 0,610 contro 0,618 sul dominio aperto, 0,797 contro 0,802 su quelle a un passaggio), e il testo dice che Jev-Mem eguaglia il migliore sulle domande temporali, mentre la tabella gli dà 0,637 contro lo 0,650 di MAGMA. Sono scarti piccoli, ma segnalano un preprint ancora da rifinire. Un solo modello di risposta, un giudice automatico di cui non si dice il modello e nessuna misura di costo in token o in denaro completano il quadro.

Il salto sulle domande avversarie chiede una spiegazione. Passare da 0,742 a 0,962 è il risultato più forte del lavoro, e il paper lo attribuisce in generale alla selezione delle prove. È plausibile che l’arresto su prove sufficienti e prive di contraddizioni aiuti a rispondere «non lo so» quando serve, ma nessun esperimento lo mostra.

Perché conta adesso

Nella corsa alle memorie per agenti, finora, si è discusso soprattutto di che cosa conservare e di come organizzarlo. Jev-Mem sposta l’attenzione su una domanda da ingegneri di sistema: chi prende le mille piccole decisioni che la memoria richiede, e a che prezzo. La risposta, un controllore che risponde con numeri invece che con frasi, non è del tutto nuova (va nella stessa direzione di lavori come Zero-Mem e LightMem, che il paper cita), ma qui è portata sull’intero ciclo di vita, dalla scrittura alla fermata della ricerca. I numeri di velocità, se reggono fuori da LoCoMo, sono la parte che conta per chi deve far girare un agente per mesi. Quella sull’accuratezza aspetta l’esperimento che manca: togliere l’archivista e vedere quanto peggiora il giornale.

I commenti sono riservati agli iscritti.

Accedi per commentare