Experiential Reinforcement Learning: far riflettere il modello sui propri errori prima di premiarlo
Gli agenti addestrati con reinforcement learning imparano per tentativi ed errori, senza fermarsi a capire perché hanno sbagliato. Un gruppo…
LLM, RAG, Agents, MCP
Gli agenti addestrati con reinforcement learning imparano per tentativi ed errori, senza fermarsi a capire perché hanno sbagliato. Un gruppo…
Nell'RL per gli LLM si campiona un gruppo di risposte a un prompt e le si valuta. TPO separa due…
Un framework di Meta FAIR che coordina decine di migliaia di agenti AI senza orchestratore centrale: lo stato di ogni…
Un gruppo del MIT propone SEAL: davanti a un testo nuovo, il modello si scrive da solo i dati su…
Un agente autonomo affianca due giudici — un revisore addestrato sui referaggi di ICLR e l'esecuzione del codice — per…
Uno studio di PricewaterhouseCoopers mette alla prova un'intuizione scomoda: nella ricerca agentica il vecchio grep batte spesso la ricerca semantica…
Ricercatori di Apple mostrano che un modello può migliorare a scrivere codice riaddestrandosi sui propri output grezzi, senza verificatore, insegnante…
Da mesi si distribuiscono "skill" per gli agenti AI, schede di procedure che dovrebbero renderli più bravi. Un benchmark le…
Un gruppo di Tsinghua misura i modelli "ragionanti" con pass@k invece che sulla media. La scoperta scomoda: il reinforcement learning…
Un commento di quattro pagine sostiene che il "collasso del ragionamento" misurato in uno studio molto discusso sia un artefatto…