Generative Modeling via Drifting: la generazione in un solo passo che evolve durante il training
Un gruppo del MIT guidato da Kaiming He sposta la parte ripetitiva della generazione dal momento in cui si produce…
Reti neurali, ottimizzazione, architetture
Un gruppo del MIT guidato da Kaiming He sposta la parte ripetitiva della generazione dal momento in cui si produce…
Le reti ricorrenti sono efficienti ma dimenticano; i transformer ricordano tutto ma costano il quadrato. Un gruppo di Google propone…
François Fleuret aggiunge al decoder Transformer una variabile casuale latente, appresa senza supervisione con un autoencoder variazionale. Un ingranaggio in…
Un modello che comprime il passato in sintesi e vi presta attenzione, con una manopola per scegliere a inferenza quanto…
Un gruppo di fisici propone di rimpicciolire i modelli linguistici non tagliando neuroni, ma le correlazioni tra i loro pesi,…
Yann LeCun e due colleghi portano nel linguaggio l'obiettivo di addestramento che ha dato i risultati migliori nella visione: non…
Prima di leggere anche una sola parola, ogni modello linguistico spezza il testo in token secondo un vocabolario fisso deciso…
Un transformer dimentica tutto ciò che esce dalla sua finestra di attenzione; una rete ricorrente comprime il passato in uno…
I modelli a spazio degli stati e l'attenzione sembrano due mondi lontani: una ricorrenza che scorre in linea, una matrice…
Le reti neurali imparano regolando i pesi sui collegamenti e lasciando fisse le funzioni di attivazione nei neuroni. Le Kolmogorov-Arnold…