KAN (2024): funzioni sugli archi, non sui nodi
Le reti neurali imparano regolando i pesi sui collegamenti e lasciando fisse le funzioni di attivazione nei neuroni. Le Kolmogorov-Arnold…
Reti neurali, ottimizzazione, architetture
Le reti neurali imparano regolando i pesi sui collegamenti e lasciando fisse le funzioni di attivazione nei neuroni. Le Kolmogorov-Arnold…
I modelli a spazio degli stati e l'attenzione sembrano due mondi lontani: una ricorrenza che scorre in linea, una matrice…
Prima di leggere anche una sola parola, ogni modello linguistico spezza il testo in token secondo un vocabolario fisso deciso…
Un transformer dimentica tutto ciò che esce dalla sua finestra di attenzione; una rete ricorrente comprime il passato in uno…
Un gruppo di fisici propone di rimpicciolire i modelli linguistici non tagliando neuroni, ma le correlazioni tra i loro pesi,…
Yann LeCun e due colleghi portano nel linguaggio l'obiettivo di addestramento che ha dato i risultati migliori nella visione: non…
François Fleuret aggiunge al decoder Transformer una variabile casuale latente, appresa senza supervisione con un autoencoder variazionale. Un ingranaggio in…
Un modello che comprime il passato in sintesi e vi presta attenzione, con una manopola per scegliere a inferenza quanto…
Un gruppo del MIT guidato da Kaiming He sposta la parte ripetitiva della generazione dal momento in cui si produce…
Le reti ricorrenti sono efficienti ma dimenticano; i transformer ricordano tutto ma costano il quadrato. Un gruppo di Google propone…