Tokenizzare con la programmazione lineare: oltre gli algoritmi greedy come BPE
Ogni modello linguistico comincia spezzando il testo in token, e da trent'anni lo fa con un algoritmo goloso che decide…
Linguaggio, computer vision, audio, multimodale
Ogni modello linguistico comincia spezzando il testo in token, e da trent'anni lo fa con un algoritmo goloso che decide…
I video generati dall'AI sono spesso bellissimi e fisicamente impossibili: oggetti che cadono verso l'alto, velocità che cambiano dal nulla.…
Rimuovere un oggetto da un video è la parte facile; togliere anche l'ombra e il riflesso che si lascia dietro…
Un team di Google DeepMind sostiene che un modello video generativo come Veo 3 sappia risolvere decine di compiti visivi…
Un gruppo di Meta e New York University addestra un "modello del mondo" su oltre 900 ore di video, in…
Meta addestra un modello di visione da 7 miliardi di parametri senza una sola etichetta umana, e per la prima…
Nell'ottobre 2024 Meta presenta un modello che trasforma una frase in un video di sedici secondi. Il paper interessa meno…
AlphaFold 2 prevedeva la forma di una proteina isolata. AlphaFold 3 prova a prevedere come proteine, DNA, RNA, farmaci e…
Nel 2023 SAM aveva imparato a ritagliare qualsiasi oggetto in una foto con un clic. La versione 2, firmata Meta,…