SkillsBench: le ‘skill’ per agenti funzionano davvero? Un benchmark lo misura
Da mesi si distribuiscono "skill" per gli agenti AI, schede di procedure che dovrebbero renderli più bravi. Un benchmark le…
Da mesi si distribuiscono "skill" per gli agenti AI, schede di procedure che dovrebbero renderli più bravi. Un benchmark le…
Le reti ricorrenti sono efficienti ma dimenticano; i transformer ricordano tutto ma costano il quadrato. Un gruppo di Google propone…
François Fleuret aggiunge al decoder Transformer una variabile casuale latente, appresa senza supervisione con un autoencoder variazionale. Un ingranaggio in…
Un modello che comprime il passato in sintesi e vi presta attenzione, con una manopola per scegliere a inferenza quanto…
Un gruppo di Meta e New York University addestra un "modello del mondo" su oltre 900 ore di video, in…
Tre ricercatori costruiscono "gallerie del vento" bayesiane, compiti dove la risposta esatta è nota in anticipo e la memorizzazione è…
Un gruppo di Tsinghua misura i modelli "ragionanti" con pass@k invece che sulla media. La scoperta scomoda: il reinforcement learning…
Un gruppo di fisici propone di rimpicciolire i modelli linguistici non tagliando neuroni, ma le correlazioni tra i loro pesi,…
Un commento di quattro pagine sostiene che il "collasso del ragionamento" misurato in uno studio molto discusso sia un artefatto…
Yann LeCun e due colleghi portano nel linguaggio l'obiettivo di addestramento che ha dato i risultati migliori nella visione: non…