Porta la data del 13 settembre il report tecnico GPT 6 Astra as an Embodied Policy, pubblicato su GitHub e indicizzato su Papers with Code. La domanda: GPT-6 Astra, il modello generalista di OpenAI, che accetta anche immagini in ingresso, può comandare un robot senza un addestramento specifico per la robotica? Lo firmano Jiayi Su e Yixin Zheng, a pari merito, con Mi Yan, Li Yi, Zhizheng Zhang e He Wang; gli ultimi tre sono indicati come autori corrispondenti. In testata compare il marchio dell’azienda di robotica Galbot. Codice e registrazioni degli episodi sono pubblicati.
Che cosa hanno provato
Due architetture, entrambe in simulazione e con il ragionamento di Astra impostato su xhigh. Nella prima, detta direct, il modello guarda le immagini delle telecamere e lo stato dei giunti e scrive direttamente posizione, orientamento e apertura delle due pinze, che la cinematica inversa traduce in obiettivi per i giunti, da 1 a 5 passi alla volta. Nella seconda, ibrida, lavora π0.5, una policy vision-language-action già addestrata sui movimenti (su RoboDojo, nei pesi messi a punto sui compiti del benchmark), che propone un tratto di 50 passi; Astra lo esamina e sceglie se eseguirne da 1 a 15 così com’è o se sostituirli con una propria correzione da 1 a 5 passi. Gli autori parlano di Sistema 1 e Sistema 2: π0.5 come istinto motorio, Astra come deliberazione.
Che cosa dichiarano gli autori
Il primo banco di prova è RoboDojo: dieci compiti di manipolazione a due braccia, cinque episodi per compito, con gli stessi semi per le due architetture. La versione ibrida riesce in 24 casi su 50 (48%, punteggio medio 62,60), quella diretta in 13 (26%, punteggio medio 37,81). Astra interviene sul 14,4% dei passi eseguiti; il resto è π0.5. Come riferimento gli autori riportano π0.5 da solo al 15,67%, ricalcolato dai risultati pubblici del benchmark sugli stessi dieci compiti. L’ibrido consuma anche meno: circa 624,8 milioni di token contro 1,13 miliardi, il 44,8% in meno, perché Astra non deve costruire ogni singolo movimento.
Il secondo test ribalta l’ordine. Su dieci compiti di RoboLab, con un braccio Franka singolo e π0.5 usato senza adattamento ai compiti, Astra da solo riesce 49 volte su 50, l’ibrido 46, π0.5 da solo 18. Gli autori avanzano due ipotesi: compiti soprattutto di prendere-e-posare con requisiti semantici, che possono favorire la comprensione e il giudizio spaziale di Astra, e una policy non adattata, che può costringere l’ibrido a correzioni e recuperi in più.
Che cosa manca per verificarlo
Il report non è un paper revisionato né un preprint su arXiv: è una pagina ospitata dall’account GitHub anonymous-report-421, senza affiliazioni accanto ai nomi. Le firme le dichiara la pagina stessa: finché gli autori non la rilanciano dai propri canali, l’attribuzione va presa con cautela.
Sul merito, sono gli autori a mettere i paletti. Dieci compiti per benchmark, scelti su RoboDojo privilegiando quelli dove π0.5 va peggio. I numeri di riferimento degli altri modelli non sono riesecuzioni con gli stessi semi. Su RoboLab i risultati di Astra includono ripetizioni autorizzate e stati iniziali non appaiati fra i metodi: descrittivi, dicono gli autori, non un confronto alla pari. L’esperimento cambia insieme più cose (i movimenti appresi di π0.5, l’interfaccia dei comandi, la lunghezza dei tratti eseguiti) e non dice quanto pesi ciascuna. I token contano solo le esecuzioni selezionate, non i tentativi precedenti. Soprattutto, la simulazione si ferma mentre Astra pensa: il tempo di risposta del modello non entra nella durata misurata. È robotica come un videogioco in pausa, ammettono gli autori, e la latenza resta un problema irrisolto per l’impiego in tempo reale. Nessun esperimento è su un robot fisico.
Perché interessa a chi lavora in Italia
Per chi integra l’AI nell’automazione, il messaggio utile non è che un modello generalista sappia muovere un braccio, ma come dividere il lavoro: la policy addestrata esegue, il modello generalista interviene quando qualcosa esce dal previsto. In linea di principio lo schema non dipende da Astra, ma il report prova solo quello. Il conto però va fatto prima: oltre seicento milioni di token, in gran parte input in cache, per cinquanta episodi simulati, e un mondo reale che, a differenza del simulatore, non aspetta la risposta.

I commenti sono riservati agli iscritti.
Accedi per commentare