LongCLI-Bench: mettere alla prova gli agenti di programmazione su compiti lunghi da terminale
Un nuovo benchmark mette venti compiti di programmazione lunghi e realistici davanti agli agenti CLI più avanzati. Nessuno supera il…

Un nuovo benchmark mette venti compiti di programmazione lunghi e realistici davanti agli agenti CLI più avanzati. Nessuno supera il…

Dentro i modelli linguistici alcuni numeri interni esplodono e alcune parole calamitano l'attenzione: due anomalie che compaiono sempre insieme. Un…

I video generati dall'AI sono spesso bellissimi e fisicamente impossibili: oggetti che cadono verso l'alto, velocità che cambiano dal nulla.…

Balestriero e LeCun sostituiscono la pila di accorgimenti che tiene in piedi il self-supervised learning con un solo principio dimostrabile:…

Un modello da 8 miliardi di parametri addestrato non a rispondere, ma a smistare: chiama gli strumenti e i modelli…

Un consorzio di ricercatori mette alla prova dieci modelli di frontiera non su quiz di scienza, ma su scenari di…

Un gruppo di Princeton propone una via di mezzo tra i database rigidi e i mondi interamente generati dall'AI: il…

Un gruppo di ricercatori indiani mette a confronto le reti di Kolmogorov-Arnold e i classici percettroni multistrato su quattro compiti,…

Un gruppo di Caltech modella l'addestramento come un'equazione differenziale stocastica e mostra che i valori singolari dei pesi si comportano…

Un agente di Google per la data science che non si ferma quando il codice gira, ma quando un giudice…