Attivazioni massive e attention sink: due fenomeni distinti, non uno solo
Dentro i modelli linguistici alcuni numeri interni esplodono e alcune parole calamitano l'attenzione: due anomalie che compaiono sempre insieme. Un…
Interpretabilità, robustezza, governance, AI Act
Dentro i modelli linguistici alcuni numeri interni esplodono e alcune parole calamitano l'attenzione: due anomalie che compaiono sempre insieme. Un…
Un modello linguistico non calcola la parola giusta all'ultimo livello. La azzarda subito, scegliendo la più comune, e poi la…
Le mappe di attenzione di un Vision Transformer dicono quali patch si guardano, non cosa si scambiano. Un gruppo di…
Tre ricercatori costruiscono "gallerie del vento" bayesiane, compiti dove la risposta esatta è nota in anticipo e la memorizzazione è…
Nell'agosto e settembre 2025 tre ricercatori hanno intervistato venticinque esperti tra laboratori di frontiera e accademia sull'idea che l'AI possa…
Un paper di OpenAI del 2025 sostiene che le allucinazioni non sono un mistero: nascono come normali errori statistici durante…
Raccogliere le preferenze umane per allineare un modello linguistico è lento e costoso. Un paper di Google mostra che un…
Un modello linguistico può nascondere un comportamento dannoso che si attiva solo con un trigger preciso, e le tecniche standard…
Un modello di Anthropic, messo in una situazione costruita ad arte, ha scelto di obbedire a richieste che considerava sbagliate…
Con "Scaling Monosemanticity" Anthropic ha estratto milioni di concetti interpretabili dagli strati interni di Claude. Il caso del Golden Gate…