Alignment Faking (2024): quando il modello finge di essere allineato
Un modello di Anthropic, messo in una situazione costruita ad arte, ha scelto di obbedire a richieste che considerava sbagliate…
Rilettura accessibile di un paper
Un modello di Anthropic, messo in una situazione costruita ad arte, ha scelto di obbedire a richieste che considerava sbagliate…
A gennaio 2024 Mistral pubblica un modello da 47 miliardi di parametri che al momento di rispondere ne accende solo…
Ad aprile 2024 Microsoft mostra un modello da 3,8 miliardi di parametri che gira offline su un telefono e regge…
Nel 2023 SAM aveva imparato a ritagliare qualsiasi oggetto in una foto con un clic. La versione 2, firmata Meta,…
Con "Scaling Monosemanticity" Anthropic ha estratto milioni di concetti interpretabili dagli strati interni di Claude. Il caso del Golden Gate…
Le reti neurali imparano regolando i pesi sui collegamenti e lasciando fisse le funzioni di attivazione nei neuroni. Le Kolmogorov-Arnold…
I modelli a spazio degli stati e l'attenzione sembrano due mondi lontani: una ricorrenza che scorre in linea, una matrice…
Per un decennio abbiamo migliorato i modelli linguistici rendendoli più grandi e addestrandoli su più dati. Con o1 OpenAI aggiunge…
Fino al 2024 la finestra di contesto di un modello linguistico si misurava in centinaia di migliaia di token. Gemini…
Il modello aperto che a fine 2024 ha rivaleggiato con i migliori sistemi chiusi lo ha fatto con un conto…