Chi guida in una città che conosce non ne ha in testa la fotografia. Non ricorda il colore di ogni portone né la forma di ogni nuvola. Ricorda dove sono le buche, quale incrocio ha la precedenza a destra, che il semaforo di via Garibaldi scatta tardi. È una mappa povera e insieme sufficiente: contiene esattamente quello che serve per non sbagliare strada e non prendere una multa. Il resto, per quanto bello, è rumore.
Su questa idea è costruito Kairos: A Regret-Aware Native World-Action Model Stack for Physical AI, depositato su arXiv il 15 giugno 2026 (2606.16533) e arrivato alla terza versione il 3 luglio. Solo quest’ultima parla di rimpianto: le prime due si intitolavano A Native World Model Stack for Physical AI. Lo firma il «Kairos Team»: Dacheng Tao e Xiaogang Wang come consulenti, Fei Wang, Shan You e Qiming Zhang a guidare il progetto, Tao Huang e Zuoyi Fu come contributori principali e altri sedici collaboratori. Il paper non indica le affiliazioni. Codice e pesi sono pubblici su GitHub, Hugging Face e ModelScope.
Il mondo non va simulato tutto
Negli ultimi anni «world model» è diventata un’etichetta larga. Gli autori ne contano quattro famiglie: i generatori di video ad alta fedeltà come Cosmos di NVIDIA, i modelli che prevedono in uno spazio astratto come V-JEPA di Meta, i mondi interattivi come Genie 3, e i modelli unificati che tengono insieme comprensione, generazione e previsione delle azioni. Kairos si colloca nella quarta, e parte da una tesi netta: per un robot che deve afferrare una tazza non conta prevedere la trama del tavolo, conta sapere dov’è la tazza, quanto scivola, se la presa tiene, a che punto è il compito.
Che cos’è un world model, perché un agente dovrebbe «immaginare» prima di agire e dove si è arrivati da Dreamer in poi: il capitolo del libro ricostruisce il quadro che questo paper dà per scontato.
Per dare forma alla tesi gli autori definiscono un rimpianto indotto dalla rappresentazione. Si confrontano due pianificatori: uno che vede tutta la storia $H_t$ di osservazioni e azioni, uno che vede solo lo stato compresso $Z_t = f(H_t)$ prodotto dal modello. La differenza fra i migliori costi fisici attesi che i due possono ottenere, con $J_H$ il costo fisico atteso su un orizzonte di $H$ passi (fallimenti, urti, contatti pericolosi, fatica di recupero), è
$$\mathrm{Reg}_H(f;g) = \inf_{\pi_Z} \mathbb{E}\big[J_H(\pi_Z(Z_t,g))\big] – \inf_{\pi_H} \mathbb{E}\big[J_H(\pi_H(H_t,g))\big].$$
Non è mai negativa, perché chi vede tutto può sempre imitare chi vede solo il riassunto. Uno stato è buono se tiene piccola questa quantità: se buttando via i dettagli non si butta via niente che faccia cadere la tazza. Il paper chiama uno stato così sufficiente per il controllo, ed è la stessa mappa povera del guidatore.
Tre maestri in ordine
Il primo pilastro riguarda i dati. Invece di mescolarli in un unico calderone, Kairos li mette in fila per forza d’intervento. Prima i video del mondo aperto, nell’ordine dei milioni di ore: gravità, urti, liquidi, oggetti che si deformano, guardati da spettatore, senza un compito da seguire. Poi i dati centrati sulle persone, nell’ordine di $10^5$ ore di comportamento umano e riprese in prima persona: qui compaiono l’intenzione, l’uso degli attrezzi, i compiti in più passi. Infine i dati dei robot, che ancorano tutto al corpo che dovrà muoversi davvero.
Nell’ultimo stadio entra l’idea che dà senso al titolo. Gli autori estraggono dalle esecuzioni dei robot i fallimenti, le riprese dopo un errore, i contatti al limite, e ne fanno coppie di preferenza nello stesso contesto: l’esito che costa meno fisicamente è preferito a quello che costa di più. Su queste coppie il modello viene allineato con un obiettivo in stile DPO. Il fallimento non è scartato come dato sporco: diventa l’esempio di ciò che non deve succedere.
Il secondo pilastro è l’architettura. Un modulo visione-linguaggio costruisce lo stato condiviso; un Diffusion Transformer per il video immagina il futuro; un secondo, per le azioni, prevede le traiettorie del robot; un’attenzione mista li lega. La generazione video, nelle intenzioni, non è il fine: è una specie di esame orale che costringe lo stato a ricordare dov’era l’oggetto quando riappare da dietro un ostacolo. Al momento dell’uso il ramo video si può spegnere e tenere solo quello delle azioni.
Memorie su scale diverse
Il pezzo tecnicamente più interessante è l’attenzione dentro il Transformer. Quella classica confronta ogni fotogramma con tutti gli altri e il costo cresce col quadrato della lunghezza del video. Kairos la sostituisce con tre percorsi che si alternano nei blocchi: una finestra scorrevole sui fotogrammi vicini, per contatti, scivolamenti e urti; una finestra dilatata, che guarda più lontano saltando fotogrammi (a passi di 6 o 12), per i sotto-compiti; e una memoria globale a costo lineare, per la permanenza degli oggetti e l’avanzamento del compito.
La memoria globale è un Gated DeltaNet. Invece di accumulare tutto, a ogni passo cancella in parte il vecchio e corregge l’associazione fra chiave e valore che sta per sovrascrivere:
$$S_t = \alpha_t S_{t-1} + \beta_t \big(v_t – S_{t-1}k_t\big)k_t^\top,$$
dove $\alpha_t$ decide quanto dimenticare e $\beta_t$ quanto scrivere. Gli autori enunciano due teoremi, dimostrati in appendice e validi sotto ipotesi dichiarate: una finestra limitata ha un errore irriducibile quando il futuro dipende da ciò che è uscito dalla finestra; una memoria ibrida di questo tipo può avvicinarsi al predittore ottimo. L’abstract delle prime due versioni parlava di propagazione dello stato «matematicamente garantita»; la terza è più cauta.
Perché l’attenzione lineare è una memoria di dimensione fissa, e come la regola delta impara a cancellare prima di scrivere: il libro la ricostruisce passo per passo, fino a Gated DeltaNet.
I numeri
Il modello valutato ha 4 miliardi di parametri, e il confronto più insistito è proprio con modelli più grandi. Sul sottoinsieme robotico di WorldModelBench ottiene 9,30 punti totali; Cosmos3-Nano, da 16 miliardi, si ferma a 9,26, e Lingbot, da 28 miliardi, a 9,04. Su DreamGen Bench è primo nella media complessiva (0,618) e nell’aderenza fisica (0,538), secondo nel seguire le istruzioni, dietro Wan2.2 da 14 miliardi.
Sulla manipolazione, dopo un fine-tuning sui singoli benchmark, i margini restano sottili. Su RoboTwin 2.0, oltre cinquanta compiti a due braccia, Kairos ha il miglior tasso medio di successo, 96,1%, con 96,9 sulla scena pulita; MotuBrain lo segue a un decimo, 96,0, e vince sulla scena randomizzata. Su LIBERO-Plus, che perturba fra l’altro telecamera, luce, sfondo e disposizione, arriva all’89,0% di media, contro l’88,0 del miglior concorrente in tabella, e al 90,8% nella variante che genera il video futuro insieme alle azioni.
Le ablazioni dicono qualcosa di più utile dei primati. Senza i dati umani, LIBERO-Plus scende da 89,0 a 83,0. Addestrando solo il ramo delle azioni, senza l’obiettivo di generare video, crolla a 65,8. È un solo benchmark, ma il segnale è chiaro: imparare a immaginare il mondo non è un accessorio, qui vale più di venti punti.
Sulle clip lunghe, 15 secondi su PAI-Bench, Kairos passa da 80,8 a 79,9 punti. Cosmos-Predict2.5 da 14 miliardi, che sui 5 secondi era avanti di poco, scende invece da 81,0 a 76,2. Sull’efficienza il paper misura quanto tempo serve, su schede A800, per un video di 5 secondi a 720p.
| Modello | Una GPU | Quattro GPU |
|---|---|---|
| Kairos | 43 | 9 |
| Wan2.2-5B | 201 | 85 |
| Cosmos-Predict2.5-14B | 2526 | 687 |
Con la versione distillata a quattro passi, a 480p, bastano 11,4 secondi su una RTX 5090 con 13,9 GB di memoria, e su quattro A800 ne servono 3 per 5 secondi di video: tempo reale. La qualità della versione distillata, però, è giudicata solo a occhio; il confronto numerico con il modello di partenza è rimandato.
Quello che il paper non dimostra
Il rimpianto non è mai stato misurato. È il limite più importante e gli autori lo scrivono in chiaro, fin dall’abstract: tutti i risultati sono prove indirette. Nessun esperimento controlla se i futuri immaginati corrispondono a quelli reali, se il modello prevede un fallimento prima che avvenga, se un robot migliora allenandosi sulle esperienze immaginate. Il criterio scritto nel titolo è per ora un principio di progetto, non un risultato.
I margini sono sottili e i confronti fatti in casa. Su WorldModelBench tre sottopunteggi di fisica su cinque valgono 1,00 per quasi tutti i modelli, e fra 9,30 e 9,26 passano quattro centesimi. Sui benchmark di generazione molti concorrenti sono stati rieseguiti dal gruppo stesso, su WorldModelBench tutti. La valutazione umana si regge su dieci volontari, con una selezione dei confronti: e lì Kairos resta sotto il 50% contro Lingbot su PAI-Bench (49,1%) e contro Cosmos da 14 miliardi su DreamGen (47,6%).
La modalità pensata per il robot non ha tempi. La velocità misurata è quella della generazione video. Per la modalità solo-azioni, quella che servirebbe davvero dentro un ciclo di controllo, il paper dice che il risparmio di latenza è atteso ma non ancora riportato.
Parte della pipeline è ancora un programma. Il filtro che dovrebbe privilegiare i dati più informativi per il controllo, fallimenti e quasi-fallimenti, è descritto al condizionale: la pipeline attuale non lo calcola. E la memoria lunga è stata provata fino a 15 secondi, non su minuti o ore di lavoro.
Perché conta adesso
La corsa ai world model si è misurata finora soprattutto sulla bellezza dei video. Kairos propone di cambiare metro: non quanto sembra vero il futuro immaginato, ma quanto costano gli errori che aiuta a evitare. È la domanda giusta per chi vuole mettere questi modelli dentro un robot, e le ablazioni suggeriscono che la strada abbia un fondamento. Ma la domanda, per ora, è posta meglio di quanto sia risolta. Con i pesi pubblici e un modello che gira su una scheda da gioco, la verifica che manca, un robot vero che sbaglia meno, può farla anche qualcun altro.

I commenti sono riservati agli iscritti.
Accedi per commentare