Nvidia sta costruendo un modello open da un trilione di parametri, e sarebbe comunque più piccolo di quello della Cina.
Nvidia ha rilasciato Nemotron 3.5 Lightning martedì. Si tratta di un modello misto di esperti con 30 miliardi di parametri, con tre miliardi attivi in ogni momento. L'architettura è un ibrido di Mamba-2, MoE e strati di attenzione, con una finestra di contesto di un milione di token. I pesi sono su Hugging Face e ModelScope.
La licenza è la parte che conta. Viene distribuito sotto OpenMDW-1.1, che consente l'uso commerciale, e Nvidia ha pubblicato i dati di addestramento e le ricette insieme ai pesi. È gratuito per le aziende scaricare, utilizzare e modificare senza chiedere permesso o pagare Nvidia, nota CNBC.
La rivendicazione di velocità ha due numeri
Nvidia guida la velocità di output fino a quattro volte quella di modelli di dimensioni simili. Leggendo oltre, la cifra agentica è più modesta. Su PinchBench ha raggiunto l'86% di precisione completando 10.000 compiti il 30% più velocemente rispetto a Qwen 3.6 35B di Alibaba con precisione simile.
Entrambi i numeri sono nella stessa release. Quattro volte più veloce descrive la generazione di token in laboratorio. Il trenta percento è ciò che accade quando il modello svolge effettivamente un lavoro. Quel divario vale la pena menzionare ogni volta che un fornitore cita il throughput.
I punteggi di benchmark sono rispettabili piuttosto che sorprendenti. Ha registrato 81.94 su MMLU Pro, 75.44 su GPQA Diamond e 51.56 su SWE-bench Verified. L'addestramento preliminare ha superato i 20 trilioni di token.
Il router è il vero prodotto
Nvidia ha anche rilasciato NeMo Switchyard, una libreria open-source. Invia ogni passaggio di un flusso di lavoro dell'agente al modello che lo gestisce meglio. I piani instradano fino a un modello di frontiera. L'esecuzione instrada verso Lightning.
LangChain lo ha utilizzato su 145 compiti, in cifre compilate da MarkTechPost. L'instradamento tra Lightning e Claude Opus 4.8 ha ridotto i costi del 74% rispetto all'uso del solo modello di frontiera. Solo il 7% delle chiamate è andato al modello costoso, con un costo di circa sei punti di precisione.
Non è una proposta per essere il miglior modello. È una proposta per gestire il 93% delle chiamate. Nvidia sta sostenendo che la maggior parte del lavoro degli agenti non ha bisogno di un modello di frontiera. Questo è un argomento di commoditizzazione mirato direttamente ai laboratori.
Perché un'azienda di chip regala modelli
Il motivo non è misterioso e Nvidia non l'ha mai nascosto. Modelli più economici e disponibili gratuitamente significano più inferenze, e l'inferenza funziona su GPU. Commoditizzare il software espande il mercato per l'hardware sottostante.
Abbiamo riportato la stessa logica quando Nvidia ha legato il suo lavoro sulla sicurezza alla domanda di chip. Ha anche messo i modelli dietro una firma. Nvidia ha firmato la lettera dei pesi aperti esortando Washington a non reprimere. Jensen Huang ha fatto il suo primo post su X per promuoverlo. OpenAI, Anthropic e Google non hanno firmato.
Il modello da un trilione di parametri, e il problema
The Information riporta che Nvidia sta costruendo Nemotron 4 con più di un trilione di parametri. Questo è un aumento rispetto ai 550 miliardi di Nemotron 3 Ultra. Potrebbe essere pronto già in autunno. L'azienda vuole che competi con i migliori modelli aperti al mondo.
Ecco la parte che tutti salteranno. Anche con un trilione di parametri, Nemotron 4 sarebbe comunque più piccolo dei principali modelli aperti cinesi. Kimi K3 di Moonshot detiene già il record come il più grande modello aperto mai rilasciato.
Quindi l'ambizione è recuperare terreno, non leadership. Nvidia sta costruendo verso una dimensione che la Cina ha superato per prima, e lo sta dicendo nel proprio briefing.
La Cina ha stabilito questo ritmo e lo mantiene ancora
Il confronto scelto da Nvidia per il proprio benchmark era un modello cinese. Lightning si confronta con Qwen 3.6 piuttosto che con qualsiasi modello aperto americano. A quella dimensione, Qwen è la cosa da battere.
DeepSeek ha trascorso l'anno riducendo i prezzi sui modelli aperti fino a quando eseguire qualsiasi cosa meno capace ha smesso di avere senso. Alibaba e Moonshot hanno scambiato il vertice delle classifiche aperte tra di loro. I pesi aperti americani sono stati un argomento politico per la maggior parte di quel tempo piuttosto che un prodotto in spedizione.
Nemotron 3.5 Lightning cambia questo in modo marginale. È un modello reale, genuinamente aperto, dall'azienda che vende le pale.
Cosa osservare invece dei benchmark
Nvidia ha già spedito modelli Nemotron, incluso Nemotron Nano Omni per agenti edge. Nessuno ha spostato il centro di gravità dei pesi aperti lontano dai laboratori cinesi.
Il test è Nemotron 4 e ha una data approssimativa. Supponiamo che arrivi in autunno e raggiunga il vertice delle classifiche aperte. Nvidia avrà comprato un posto a un tavolo che attualmente finanzia solo. Supponiamo che arrivi secondo a Kimi di nuovo. La descrizione onesta della strategia è quindi generazione di domanda per le GPU.
Entrambi i punti di vista possono essere veri contemporaneamente. Questo è piuttosto il punto di dare via il software quando vendi l'hardware.
Altri articoli
Nvidia sta costruendo un modello open da un trilione di parametri, e sarebbe comunque più piccolo di quello della Cina.
Il Nemotron 3.5 Lightning di Nvidia è gratuito e veloce. Il Nemotron 4, con un trilione di parametri previsto, sarebbe comunque inferiore ai principali modelli open cinesi.
