RLAIF (2024): feedback dall’AI invece che dall’uomo
Raccogliere le preferenze umane per allineare un modello linguistico è lento e costoso. Un paper di Google mostra che un…
Rilettura accessibile di un paper
Raccogliere le preferenze umane per allineare un modello linguistico è lento e costoso. Un paper di Google mostra che un…
Prima di leggere anche una sola parola, ogni modello linguistico spezza il testo in token secondo un vocabolario fisso deciso…
Un transformer dimentica tutto ciò che esce dalla sua finestra di attenzione; una rete ricorrente comprime il passato in uno…
Nel 2023 un gruppo di ricercatori della Fudan University prova a mettere ordine nella parola più abusata dell'anno: "agente". Rileggiamo…
Un modello linguistico non vede nulla: legge numeri. LLaVA mostra che per dargli la vista basta un pezzo sorprendentemente semplice…
Nell'ottobre 2024 Anthropic ha dato a Claude un mouse e una tastiera: guarda lo schermo con uno screenshot, decide dove…
Un paper di OpenAI del 2025 sostiene che le allucinazioni non sono un mistero: nascono come normali errori statistici durante…
Prior Labs pubblica la nuova generazione del suo modello per dati tabellari: una rete che predice da una tabella senza…
Comprimere un modello a quattro bit fa risparmiare memoria e calcolo, ma spesso ne intacca l'accuratezza. Un report tecnico di…
Un gruppo di Tsinghua misura i modelli "ragionanti" con pass@k invece che sulla media. La scoperta scomoda: il reinforcement learning…