Tokenizzare con la programmazione lineare: oltre gli algoritmi greedy come BPE
Ogni modello linguistico comincia spezzando il testo in token, e da trent'anni lo fa con un algoritmo goloso che decide…
Linguaggio, computer vision, audio, multimodale
Ogni modello linguistico comincia spezzando il testo in token, e da trent'anni lo fa con un algoritmo goloso che decide…
I video generati dall'AI sono spesso bellissimi e fisicamente impossibili: oggetti che cadono verso l'alto, velocità che cambiano dal nulla.…
Rimuovere un oggetto da un video è la parte facile; togliere anche l'ombra e il riflesso che si lascia dietro…
Un team di Google DeepMind sostiene che un modello video generativo come Veo 3 sappia risolvere decine di compiti visivi…
Meta addestra un modello di visione da 7 miliardi di parametri senza una sola etichetta umana, e per la prima…
Un gruppo di Meta e New York University addestra un "modello del mondo" su oltre 900 ore di video, in…
Nell'ottobre 2024 Meta presenta un modello che trasforma una frase in un video di sedici secondi. Il paper interessa meno…
AlphaFold 2 prevedeva la forma di una proteina isolata. AlphaFold 3 prova a prevedere come proteine, DNA, RNA, farmaci e…
Nel 2023 SAM aveva imparato a ritagliare qualsiasi oggetto in una foto con un clic. La versione 2, firmata Meta,…