Byte Latent Transformer (2024): addio al tokenizer
Prima di leggere anche una sola parola, ogni modello linguistico spezza il testo in token secondo un vocabolario fisso deciso…
Prima di leggere anche una sola parola, ogni modello linguistico spezza il testo in token secondo un vocabolario fisso deciso…
Raccogliere le preferenze umane per allineare un modello linguistico è lento e costoso. Un paper di Google mostra che un…
Per anni abbiamo istruito i modelli con due o tre esempi nel prompt. Un lavoro di Google DeepMind del 2024…
Un lavoro di Google DeepMind del 2024 mostra che lasciar "ragionare" più a lungo un modello piccolo davanti a una…
Nell'ottobre 2024 Meta presenta un modello che trasforma una frase in un video di sedici secondi. Il paper interessa meno…
Molti problemi di geometria delle olimpiadi si sbloccano con un'unica idea, tracciare il punto o la linea giusta. AlphaGeometry unisce…
AlphaFold 2 prevedeva la forma di una proteina isolata. AlphaFold 3 prova a prevedere come proteine, DNA, RNA, farmaci e…
DPO ha semplificato l'allineamento dei modelli linguistici, ma porta ancora con sé due pesi: un modello di riferimento da tenere…
Un modello linguistico può nascondere un comportamento dannoso che si attiva solo con un trigger preciso, e le tecniche standard…
Un modello di Anthropic, messo in una situazione costruita ad arte, ha scelto di obbedire a richieste che considerava sbagliate…