L’11 agosto NVIDIA ha pubblicato su Hugging Face Nemotron 3.5 Lightning, un modello linguistico da 30 miliardi di parametri totali, di cui 3 attivi per ogni token. Questa è la versione in piena precisione, BF16, che la scheda presenta come «pesi di riferimento»: un punto di partenza per riaddestrare il modello sui propri dati, adattarlo a un dominio o ricavarne versioni quantizzate. Per usarlo in produzione NVIDIA indica una variante separata in NVFP4.
Che cosa dichiara NVIDIA
L’architettura, secondo la scheda, è un ibrido: strati Mamba-2 e strati a miscela di esperti (MoE) intercalati, con alcuni strati di attenzione, più strati di multi-token prediction che prevedono più token futuri alla volta. Il contesto dichiarato arriva a un milione di token, ma in BF16 su una sola H100 da 80 GB NVIDIA lo ferma a circa 256.000 per ragioni di memoria; per la finestra piena indica otto H100, una GB200 o una B200. Il pre-addestramento ha usato oltre 20.000 miliardi di token, con una ricetta in NVFP4, poi fine-tuning supervisionato su dati sintetici e reinforcement learning con GRPO su più ambienti. Il ragionamento esplicito si accende e si spegne dal template della chat. Accanto al modello escono due modelli «bozza» per lo speculative decoding, DSpark e DFlash, per generare più in fretta.
Due dettagli lo distinguono da molti annunci simili. Il primo: fra le lingue supportate c’è l’italiano, con spagnolo, francese, tedesco e giapponese; la lingua principale resta l’inglese. L’italiano compare anche fra le lingue del post-training, sotto forma di esercizi di ragionamento e di traduzione. Il secondo: NVIDIA dichiara di pubblicare i dati finali di pre-training e post-training. Un campione è libero, per i dati di codice, matematica e multilingue serve una richiesta di accesso; e la scheda elenca anche dataset privati, di terzi e di NVIDIA, che restano chiusi. La licenza è la OpenMDW-1.1, e la scheda dice che il modello è pronto per uso commerciale.
Che cosa dice la sua stessa tabella
Nella tabella dei benchmark, misurati da NVIDIA con un proprio harness, Lightning non è primo in nessuna delle quattordici righe. Su MMLU Pro fa 81,94, contro 85,63 di Qwen 3.6 35B A3B e 85,20 di Gemma 4 26B A4B. Su GPQA Diamond fa 75,44, contro 83,40 di Qwen. Su SWE-bench Verified fa 51,56: di poco sotto GPT-OSS 20B (52,44), lontano da Qwen (70,12). Il confronto che regge è con il predecessore della stessa taglia, Nemotron 3 Nano: 34,08 su SWE-bench Verified, 8,29 su Terminal-Bench 2.1 contro 24,58. Con due avvertenze: Nano resta davanti su IFBench e AA-Omniscience, e nel grafico della scheda compare nella versione quantizzata NVFP4.
Lightning è davanti a Qwen solo su IFBench, l’aderenza alle istruzioni (71,88 contro 63,71), dove però Gemma fa meglio (77,25). Il suo meglio sono tre secondi posti, su PinchBench, BrowseComp e GDPval-AA; altrove è quarto o quinto. Che un produttore pubblichi una tabella del genere non capita spesso, e va detto a suo credito. La promessa, qui, non è la qualità assoluta: è l’efficienza di un modello che sta su una GPU sola.
Che cosa manca per verificarlo
Non c’è un rapporto tecnico collegato alla scheda, che resta la fonte principale su architettura e addestramento. I numeri sono di NVIDIA, che avverte essa stessa che possono differire da quelli dichiarati dagli altri produttori; le ricette per riprodurli sono pubblicate in NeMo Gym, ma la scheda non cita verifiche indipendenti. Mancano poi due cose: una misura della velocità reale (la scheda dice «più veloce», senza numeri) e una valutazione in italiano. L’italiano è «supportato», ma nessun benchmark della tabella lo misura.
Perché interessa a chi lavora in Italia
A conti nostri, 30 miliardi di parametri in BF16 occupano circa 60 GB: per farlo girare basta una GPU da 80 GB (NVIDIA indica una H100 o una A100), alla portata di un laboratorio universitario o di una PMI; riaddestrarlo per intero chiede invece molta più memoria. Con parte dei dati di addestramento pubblicata e l’italiano presente nel post-training, è una base ragionevole per chi vuole un modello da adattare su testi propri e tenere i dati in casa. Resta da vedere quanto regga nella nostra lingua: la prova, questa volta, possono farla anche le università e i laboratori italiani.

I commenti sono riservati agli iscritti.
Accedi per commentare