q0: pretraining a iper-epoca, o come sfruttare il budget di calcolo oltre la saturazione
Quando il testo di qualità finisce ma il calcolo abbonda, ripassare gli stessi dati smette presto di aiutare un modello.…
Reti neurali, ottimizzazione, architetture
Quando il testo di qualità finisce ma il calcolo abbonda, ripassare gli stessi dati smette presto di aiutare un modello.…
Quattro ricercatori del MIT sostengono che reti neurali diverse per architettura, obiettivo e persino tipo di dato stiano convergendo verso…
Da nove anni le parole di un prompt ricevono un numero di posizione fisso, 0, 1, 2, fino alla fine.…
Un gruppo di Stanford, NVIDIA e Berkeley riformula il contesto lungo come apprendimento continuo: invece di ricordare ogni token, il…
Il reinforcement learning premia di solito la risposta finale di un modello. Un gruppo tra Google, UC Davis e Princeton…
Un gruppo di Caltech modella l'addestramento come un'equazione differenziale stocastica e mostra che i valori singolari dei pesi si comportano…
Balestriero e LeCun sostituiscono la pila di accorgimenti che tiene in piedi il self-supervised learning con un solo principio dimostrabile:…
Un gruppo di ricercatori indiani mette a confronto le reti di Kolmogorov-Arnold e i classici percettroni multistrato su quattro compiti,…
Addestrare un modello a prevedere come cambia il mondo richiede di solito traiettorie in cui ogni azione è annotata a…
Dietro ogni modello che "impara" c'è un solo algoritmo, ideato decenni fa. Un viaggio nella backpropagation senza formule pesanti, con…