q0: pretraining a iper-epoca, o come sfruttare il budget di calcolo oltre la saturazione
Quando il testo di qualità finisce ma il calcolo abbonda, ripassare gli stessi dati smette presto di aiutare un modello.…
Rilettura accessibile di un paper
Quando il testo di qualità finisce ma il calcolo abbonda, ripassare gli stessi dati smette presto di aiutare un modello.…
Meta addestra un modello di visione da 7 miliardi di parametri senza una sola etichetta umana, e per la prima…
Le mappe di attenzione di un Vision Transformer dicono quali patch si guardano, non cosa si scambiano. Un gruppo di…
Un gruppo del MIT guidato da Kaiming He sposta la parte ripetitiva della generazione dal momento in cui si produce…
Da mesi si distribuiscono "skill" per gli agenti AI, schede di procedure che dovrebbero renderli più bravi. Un benchmark le…
Le reti ricorrenti sono efficienti ma dimenticano; i transformer ricordano tutto ma costano il quadrato. Un gruppo di Google propone…
Un gruppo di Meta e New York University addestra un "modello del mondo" su oltre 900 ore di video, in…
Tre ricercatori costruiscono "gallerie del vento" bayesiane, compiti dove la risposta esatta è nota in anticipo e la memorizzazione è…
François Fleuret aggiunge al decoder Transformer una variabile casuale latente, appresa senza supervisione con un autoencoder variazionale. Un ingranaggio in…
Un modello che comprime il passato in sintesi e vi presta attenzione, con una manopola per scegliere a inferenza quanto…