Il microscopio per leggere dentro un modello linguistico
Con "Scaling Monosemanticity" Anthropic ha estratto milioni di concetti interpretabili dagli strati interni di Claude. Il caso del Golden Gate…
Interpretabilità, robustezza, governance, AI Act
Con "Scaling Monosemanticity" Anthropic ha estratto milioni di concetti interpretabili dagli strati interni di Claude. Il caso del Golden Gate…
Un modello di Anthropic, messo in una situazione costruita ad arte, ha scelto di obbedire a richieste che considerava sbagliate…
Un modello linguistico può nascondere un comportamento dannoso che si attiva solo con un trigger preciso, e le tecniche standard…
Raccogliere le preferenze umane per allineare un modello linguistico è lento e costoso. Un paper di Google mostra che un…
Un paper di OpenAI del 2025 sostiene che le allucinazioni non sono un mistero: nascono come normali errori statistici durante…
Tre ricercatori costruiscono "gallerie del vento" bayesiane, compiti dove la risposta esatta è nota in anticipo e la memorizzazione è…
Le mappe di attenzione di un Vision Transformer dicono quali patch si guardano, non cosa si scambiano. Un gruppo di…
Un modello linguistico non calcola la parola giusta all'ultimo livello. La azzarda subito, scegliendo la più comune, e poi la…
Nell'agosto e settembre 2025 tre ricercatori hanno intervistato venticinque esperti tra laboratori di frontiera e accademia sull'idea che l'AI possa…
Dentro i modelli linguistici alcuni numeri interni esplodono e alcune parole calamitano l'attenzione: due anomalie che compaiono sempre insieme. Un…