Nvidia está construyendo un modelo abierto de un billón de parámetros, y aún así sería más pequeño que el de China.
Nvidia lanzó Nemotron 3.5 Lightning el martes. Es un modelo de mezcla de expertos de 30 mil millones de parámetros con tres mil millones activos en cualquier momento. La arquitectura es un híbrido de Mamba-2, MoE y capas de atención, con una ventana de contexto de un millón de tokens. Los pesos están en Hugging Face y ModelScope.
La licencia es la parte que importa. Se distribuye bajo OpenMDW-1.1, que permite el uso comercial, y Nvidia publicó los datos de entrenamiento y las recetas junto con los pesos. Es gratuito para que las empresas lo descarguen, usen y modifiquen sin pedir permiso ni pagar a Nvidia, señala CNBC.
La afirmación de velocidad tiene dos números
Nvidia lidera en velocidad de salida de hasta cuatro veces la de modelos de tamaño similar. Al leer más, la cifra de rendimiento es más modesta. En PinchBench alcanzó un 86% de precisión mientras completaba 10,000 tareas un 30% más rápido que el Qwen 3.6 35B de Alibaba con precisión similar.
Ambos números están en el mismo lanzamiento. Cuatro veces más rápido describe la generación de tokens en el laboratorio. Treinta por ciento es lo que sucede cuando el modelo realmente realiza un trabajo. Esa diferencia vale la pena tener en cuenta siempre que un proveedor cite el rendimiento.
Las puntuaciones de referencia son respetables más que sorprendentes. Publica 81.94 en MMLU Pro, 75.44 en GPQA Diamond y 51.56 en SWE-bench Verified. El pre-entrenamiento se extendió a más de 20 billones de tokens.
El enrutador es el verdadero producto
Nvidia también lanzó NeMo Switchyard, una biblioteca de código abierto. Envía cada paso de un flujo de trabajo de agente al modelo que mejor lo maneje. Los planes se dirigen hasta un modelo de frontera. La ejecución se dirige hacia abajo a Lightning.
LangChain lo ejecutó en 145 tareas, en cifras compiladas por MarkTechPost. El enrutamiento entre Lightning y Claude Opus 4.8 redujo costos en un 74% en comparación con el uso del modelo de frontera solo. Solo el 7% de las llamadas fueron al modelo costoso, a un costo de aproximadamente seis puntos de precisión.
Eso no es una propuesta para ser el mejor modelo. Es una propuesta para manejar el 93% de las llamadas. Nvidia está argumentando que la mayoría del trabajo de los agentes no necesita un modelo de frontera. Ese es un argumento de comoditización dirigido directamente a los laboratorios.
Por qué una empresa de chips regala modelos
El motivo no es misterioso y Nvidia nunca lo ha ocultado. Modelos más baratos y disponibles libremente significan más inferencia, y la inferencia se ejecuta en GPUs. Comoditizar el software expande el mercado para el hardware subyacente.
Informamos la misma lógica cuando Nvidia vinculó su trabajo de seguridad a la demanda de chips. También pone modelos detrás de una firma. Nvidia firmó la carta de pesos abiertos instando a Washington a no reprimir. Jensen Huang hizo su primera publicación en X para promoverlo. OpenAI, Anthropic y Google no firmaron.
El modelo de un billón de parámetros, y la trampa
The Information informa que Nvidia está construyendo Nemotron 4 con más de un billón de parámetros. Eso es un aumento desde los 550 mil millones de Nemotron 3 Ultra. Podría estar listo tan pronto como a finales de otoño. La compañía quiere que compita con los mejores modelos abiertos del mundo.
Aquí está la línea que todos saltarán. Incluso con un billón de parámetros, Nemotron 4 seguiría siendo más pequeño que los principales modelos abiertos chinos. El Kimi K3 de Moonshot ya tiene el récord como el modelo abierto más grande jamás lanzado.
Así que la ambición es alcanzar, no liderar. Nvidia está construyendo hacia un tamaño que China superó primero, y lo dice en su propio informe.
China estableció este ritmo y aún lo mantiene
La comparación que Nvidia eligió para su propia referencia fue un modelo chino. Lightning se enfrenta a Qwen 3.6 en lugar de cualquier modelo abierto estadounidense. A ese tamaño, Qwen es lo que hay que superar.
DeepSeek ha pasado el año reduciendo precios en modelos abiertos hasta que ejecutar algo menos capaz dejó de tener sentido. Alibaba y Moonshot han intercambiado la cima de las listas abiertas entre ellos. Los pesos abiertos estadounidenses han sido un argumento de política durante la mayor parte de ese tiempo en lugar de un producto en circulación.
Nemotron 3.5 Lightning cambia eso de manera pequeña. Es un modelo real, genuinamente abierto, de la compañía que vende las palas.
Qué observar en lugar de las referencias
Nvidia ha lanzado modelos Nemotron antes, incluido Nemotron Nano Omni para agentes de borde. Ninguno ha movido el centro de gravedad de los pesos abiertos lejos de los laboratorios chinos.
La prueba es Nemotron 4 y tiene una fecha aproximada. Digamos que llega a finales de otoño y encabeza las listas abiertas. Nvidia habrá comprado un asiento en una mesa que actualmente solo financia. Digamos que llega en segundo lugar detrás de Kimi nuevamente. La descripción honesta de la estrategia es entonces generación de demanda para GPUs.
Ambas lecturas pueden ser verdaderas a la vez. Ese es más bien el objetivo de regalar software cuando vendes el hardware.
Otros artículos
Nvidia está construyendo un modelo abierto de un billón de parámetros, y aún así sería más pequeño que el de China.
El Nemotron 3.5 Lightning de Nvidia es gratuito y rápido. El Nemotron 4, con un billón de parámetros planeado, aún estaría detrás de los principales modelos abiertos chinos.
