Generative Modeling via Drifting: la generazione in un solo passo che evolve durante il training
Un gruppo del MIT guidato da Kaiming He sposta la parte ripetitiva della generazione dal momento in cui si produce…
Un gruppo del MIT guidato da Kaiming He sposta la parte ripetitiva della generazione dal momento in cui si produce…
Le mappe di attenzione di un Vision Transformer dicono quali patch si guardano, non cosa si scambiano. Un gruppo di…
Tre ricercatori costruiscono "gallerie del vento" bayesiane, compiti dove la risposta esatta è nota in anticipo e la memorizzazione è…
Un gruppo di Meta e New York University addestra un "modello del mondo" su oltre 900 ore di video, in…
Un modello che comprime il passato in sintesi e vi presta attenzione, con una manopola per scegliere a inferenza quanto…
François Fleuret aggiunge al decoder Transformer una variabile casuale latente, appresa senza supervisione con un autoencoder variazionale. Un ingranaggio in…
Yann LeCun e due colleghi portano nel linguaggio l'obiettivo di addestramento che ha dato i risultati migliori nella visione: non…
Un commento di quattro pagine sostiene che il "collasso del ragionamento" misurato in uno studio molto discusso sia un artefatto…
Un gruppo di fisici propone di rimpicciolire i modelli linguistici non tagliando neuroni, ma le correlazioni tra i loro pesi,…
Un gruppo di Tsinghua misura i modelli "ragionanti" con pass@k invece che sulla media. La scoperta scomoda: il reinforcement learning…