Titans (2025): una memoria che impara al momento del test
Un transformer dimentica tutto ciò che esce dalla sua finestra di attenzione; una rete ricorrente comprime il passato in uno…
Un transformer dimentica tutto ciò che esce dalla sua finestra di attenzione; una rete ricorrente comprime il passato in uno…
Nel 2023 un gruppo di ricercatori della Fudan University prova a mettere ordine nella parola più abusata dell'anno: "agente". Rileggiamo…
Molti problemi di geometria delle olimpiadi si sbloccano con un'unica idea, tracciare il punto o la linea giusta. AlphaGeometry unisce…
Nell'ottobre 2024 Meta presenta un modello che trasforma una frase in un video di sedici secondi. Il paper interessa meno…
Un lavoro di Google DeepMind del 2024 mostra che lasciar "ragionare" più a lungo un modello piccolo davanti a una…
Per anni abbiamo istruito i modelli con due o tre esempi nel prompt. Un lavoro di Google DeepMind del 2024…
Un modello linguistico può nascondere un comportamento dannoso che si attiva solo con un trigger preciso, e le tecniche standard…
DPO ha semplificato l'allineamento dei modelli linguistici, ma porta ancora con sé due pesi: un modello di riferimento da tenere…
AlphaFold 2 prevedeva la forma di una proteina isolata. AlphaFold 3 prova a prevedere come proteine, DNA, RNA, farmaci e…
A gennaio 2024 Mistral pubblica un modello da 47 miliardi di parametri che al momento di rispondere ne accende solo…