SAM 2 (2024): segmentare qualsiasi cosa, anche nei video
Nel 2023 SAM aveva imparato a ritagliare qualsiasi oggetto in una foto con un clic. La versione 2, firmata Meta,…
Linguaggio, computer vision, audio, multimodale
Nel 2023 SAM aveva imparato a ritagliare qualsiasi oggetto in una foto con un clic. La versione 2, firmata Meta,…
AlphaFold 2 prevedeva la forma di una proteina isolata. AlphaFold 3 prova a prevedere come proteine, DNA, RNA, farmaci e…
Nell'ottobre 2024 Meta presenta un modello che trasforma una frase in un video di sedici secondi. Il paper interessa meno…
Un gruppo di Meta e New York University addestra un "modello del mondo" su oltre 900 ore di video, in…
Meta addestra un modello di visione da 7 miliardi di parametri senza una sola etichetta umana, e per la prima…
Un team di Google DeepMind sostiene che un modello video generativo come Veo 3 sappia risolvere decine di compiti visivi…
Rimuovere un oggetto da un video è la parte facile; togliere anche l'ombra e il riflesso che si lascia dietro…
I video generati dall'AI sono spesso bellissimi e fisicamente impossibili: oggetti che cadono verso l'alto, velocità che cambiano dal nulla.…
Ogni modello linguistico comincia spezzando il testo in token, e da trent'anni lo fa con un algoritmo goloso che decide…