Tokenizzare con la programmazione lineare: oltre gli algoritmi greedy come BPE
Ogni modello linguistico comincia spezzando il testo in token, e da trent'anni lo fa con un algoritmo goloso che decide…
Rilettura accessibile di un paper
Ogni modello linguistico comincia spezzando il testo in token, e da trent'anni lo fa con un algoritmo goloso che decide…
Addestrare un modello a prevedere come cambia il mondo richiede di solito traiettorie in cui ogni azione è annotata a…
Un nuovo benchmark mette venti compiti di programmazione lunghi e realistici davanti agli agenti CLI più avanzati. Nessuno supera il…
Dentro i modelli linguistici alcuni numeri interni esplodono e alcune parole calamitano l'attenzione: due anomalie che compaiono sempre insieme. Un…
I video generati dall'AI sono spesso bellissimi e fisicamente impossibili: oggetti che cadono verso l'alto, velocità che cambiano dal nulla.…
Balestriero e LeCun sostituiscono la pila di accorgimenti che tiene in piedi il self-supervised learning con un solo principio dimostrabile:…
Un consorzio di ricercatori mette alla prova dieci modelli di frontiera non su quiz di scienza, ma su scenari di…
I modelli neurali che simulano la fisica schiacciano ogni grandezza su dei punti. Questo paper propone di rimettere ciascuna al…
Un gruppo di Caltech modella l'addestramento come un'equazione differenziale stocastica e mostra che i valori singolari dei pesi si comportano…
Nell'RL per gli LLM si campiona un gruppo di risposte a un prompt e le si valuta. TPO separa due…