L’RL insegna davvero a ragionare? Il paper che mette alla prova RLVR
Un gruppo di Tsinghua misura i modelli "ragionanti" con pass@k invece che sulla media. La scoperta scomoda: il reinforcement learning…
Rilettura accessibile di un paper
Un gruppo di Tsinghua misura i modelli "ragionanti" con pass@k invece che sulla media. La scoperta scomoda: il reinforcement learning…
Un gruppo di fisici propone di rimpicciolire i modelli linguistici non tagliando neuroni, ma le correlazioni tra i loro pesi,…
Un commento di quattro pagine sostiene che il "collasso del ragionamento" misurato in uno studio molto discusso sia un artefatto…
Yann LeCun e due colleghi portano nel linguaggio l'obiettivo di addestramento che ha dato i risultati migliori nella visione: non…
Prior Labs pubblica la nuova generazione del suo modello per dati tabellari: una rete che predice da una tabella senza…
Comprimere un modello a quattro bit fa risparmiare memoria e calcolo, ma spesso ne intacca l'accuratezza. Un report tecnico di…
Un paper di OpenAI del 2025 sostiene che le allucinazioni non sono un mistero: nascono come normali errori statistici durante…
Un modello linguistico non vede nulla: legge numeri. LLaVA mostra che per dargli la vista basta un pezzo sorprendentemente semplice…
Nell'ottobre 2024 Anthropic ha dato a Claude un mouse e una tastiera: guarda lo schermo con uno screenshot, decide dove…
Raccogliere le preferenze umane per allineare un modello linguistico è lento e costoso. Un paper di Google mostra che un…