NVIDIA lanza Nemotron 3 Nano, modelo IA abierto
NVIDIA presenta Nemotron 3 Nano, un modelo abierto para agentes de IA con 1 millón de tokens de contexto y unos 3.600 millones de parámetros activos por token. La compañía afirma que ofrece hasta 3,3 veces más rendimiento que modelos comparables e incluye datos, herramientas y recetas de entrenamiento para que otros desarrolladores puedan ampliarlo.

NVIDIA ha presentado Nemotron 3 Nano, un modelo de inteligencia artificial abierto diseñado para ejecutar agentes y flujos de trabajo con muchos pasos sin disparar el coste ni los tiempos de respuesta.
El modelo combina 31.600 millones de parámetros, aunque solo activa unos 3.600 millones por cada token. Un parámetro es una unidad interna que el modelo ajusta durante su entrenamiento, mientras que un token es un fragmento de texto que procesa. En la práctica, esto le permite tener capacidades propias de un modelo grande con un consumo más cercano al de uno pequeño.
Un modelo pensado para trabajar como agente
Nemotron 3 Nano está orientado a tareas en las que la IA no solo responde, sino que también planifica, consulta herramientas y completa procesos de varios pasos. Por ejemplo, puede buscar información, analizarla, escribir código y utilizar una aplicación externa dentro de un mismo flujo.
Para ello utiliza una arquitectura híbrida que combina dos enfoques:
Mamba-2, pensado para procesar conversaciones y documentos extensos con baja latencia.- Una arquitectura Transformer, más precisa para prestar atención a detalles concretos y resolver problemas complejos.
- Un sistema de expertos, o MoE, que activa solo una parte del modelo en cada operación.
El sistema cuenta con 128 expertos internos y activa seis por cada paso. No todos trabajan al mismo tiempo. Esa selección reduce el trabajo necesario sin eliminar la capacidad total disponible.
NVIDIA afirma que el modelo puede alcanzar hasta cuatro veces más velocidad que Nemotron Nano 2 y hasta 3,3 veces más que otros modelos de su categoría, aunque esas cifras dependen del hardware y de la configuración utilizada. En una prueba con una GPU H200, 8.000 tokens de entrada y 16.000 de salida, logró 3,3 veces más rendimiento que Qwen3-30B y 2,2 veces más que GPT-OSS-20B.
Un millón de tokens de contexto
La ventana de contexto llega hasta 1 millón de tokens. Es la cantidad de información que el modelo puede tener en cuenta durante una interacción, aunque no equivale exactamente a un millón de palabras.
Ese límite permite trabajar con documentos muy largos, historiales completos de proyectos o grandes colecciones de información. También puede servir para mantener una memoria más amplia en agentes que operan durante mucho tiempo, por ejemplo al revisar cientos de archivos o coordinar varias tareas relacionadas.
El modelo ofrece además controles para decidir cuánto razona antes de responder:
- Reasoning ON, para tareas que necesitan análisis paso a paso.
- Reasoning OFF, para respuestas más directas y rápidas.
- Un presupuesto configurable de tokens de razonamiento, para limitar el tiempo y el coste de cada consulta.
Esto evita usar el mismo nivel de procesamiento para todo. Una pregunta sencilla puede recibir una respuesta inmediata, mientras que un problema de programación puede disponer de más tiempo de análisis.
La apertura incluye datos y herramientas
NVIDIA no solo publica los pesos del modelo, que son los archivos que permiten ejecutarlo. También libera buena parte de los datos, el código y la receta de entrenamiento, bajo la licencia nvidia-open-model-license.
El proceso incluyó un corpus de 25 billones de tokens, 13 millones de muestras de ajuste posterior y más de diez entornos de aprendizaje por refuerzo con más de 900.000 tareas de matemáticas, programación, razonamiento y uso de herramientas. También incorpora cerca de 11.000 trazas etiquetadas para analizar riesgos de seguridad en agentes.
La compañía presenta junto al modelo NeMo Gym, una biblioteca abierta para crear entornos donde otros modelos pueden practicar y ser evaluados. Esos entornos pueden simular desde ejercicios de matemáticas y programación hasta calendarios, conversaciones de varios turnos y uso de herramientas externas.
La idea es que los desarrolladores puedan entrenar sus propios modelos con tareas verificables, recopilar errores y probar cambios sin tener que construir toda la infraestructura desde cero.
Qué cambia para ti
Si desarrollas aplicaciones con IA, Nemotron 3 Nano ofrece una alternativa abierta para ejecutar muchas consultas en paralelo, especialmente en servidores con GPU. Su contexto de un millón de tokens puede reducir la necesidad de dividir documentos grandes o resumir constantemente el historial.
También está disponible para probarlo mediante Hugging Face, OpenRouter y los servicios de NVIDIA. Puede desplegarse con herramientas como vLLM y SGLang, y llegar a equipos con hardware NVIDIA mediante soluciones como Llama.cpp, LM Studio y Unsloth.
La principal incógnita no está solo en sus cifras de rendimiento, sino en cómo se comportará fuera de las pruebas de NVIDIA: en tareas reales, con costes concretos, diferentes GPU y datos propios. Aun así, el lanzamiento apunta a una tendencia clara: los sistemas multiagente necesitan modelos suficientemente capaces, pero también baratos y rápidos para funcionar durante muchas etapas seguidas.