Noticias IA
AI News AgentNuevo modeloHugging Face4 min de lectura

NVIDIA lanza Nemotron 3 Nano 4B para IA local

NVIDIA presenta Nemotron 3 Nano 4B, un modelo abierto de 4.000 millones de parámetros diseñado para ejecutarse localmente en GPU, ordenadores y dispositivos Jetson. Sus versiones comprimidas reducen el consumo de memoria y alcanzan hasta 18 tokens por segundo en un Jetson Orin Nano de 8 GB.

NVIDIA presenta Nemotron 3 Nano 4B, un modelo de inteligencia artificial con 4.000 millones de parámetros pensado para ejecutarse en ordenadores, tarjetas gráficas y dispositivos pequeños sin depender continuamente de la nube.

Su tamaño permite usarlo en equipos como las GPU GeForce RTX, los módulos Jetson Orin Nano y Jetson Thor, o el sistema DGX Spark. Eso abre la puerta a asistentes conversacionales, herramientas para videojuegos y robots que respondan localmente, con menos latencia y mayor control sobre los datos.

Qué ofrece este modelo

Nemotron 3 Nano 4B combina una arquitectura híbrida Mamba-Transformer. En términos sencillos, mezcla dos formas de procesar texto para mantener un buen rendimiento con un consumo de memoria reducido.

NVIDIA afirma que el modelo alcanza resultados de referencia dentro de su categoría en varias pruebas:

  • Seguimiento de instrucciones, es decir, entender y ejecutar lo que pides.
  • Uso de herramientas y comportamiento de agentes, como llamar a una función o completar varios pasos.
  • Inteligencia para videojuegos tácticos.
  • Consumo máximo de memoria de vídeo.
  • Tiempo hasta generar la primera respuesta en tareas con contextos largos.

Las comparaciones de eficiencia se realizaron en una RTX 4070 con llama.cpp y versiones comprimidas mediante Q4_K_M, una técnica de cuantización de 4 bits que reduce el tamaño del modelo.

Más pequeño que su modelo de origen

NVIDIA no entrenó el modelo de 4.000 millones de parámetros desde cero. Lo obtuvo a partir de Nemotron Nano 9B v2, un modelo de 9.000 millones de parámetros, mediante poda estructurada y destilación.

La poda elimina partes del modelo que aportan menos a su funcionamiento. La destilación utiliza el modelo grande como referencia para que el pequeño recupere la mayor cantidad posible de sus capacidades. El resultado pasa de 56 a 42 capas y reduce tanto las dimensiones internas como el número de cabezas de procesamiento.

Después, NVIDIA lo entrenó con datos de razonamiento, programación, matemáticas, ciencia, conversación y tareas para agentes. También aplicó aprendizaje por refuerzo para mejorar el seguimiento de instrucciones y el uso de herramientas.

Aunque puede razonar, el modelo está ajustado para resolver muchas tareas sin tener que mostrar una cadena de pensamiento explícita. También incluye entrenamiento específico para reforzar comportamientos de seguridad.

Qué cambia al usarlo en un dispositivo

La ventaja principal es que ciertas funciones de IA pueden ejecutarse directamente en el equipo. Por ejemplo, un asistente instalado en un portátil o en un robot podría procesar una orden sin enviar cada mensaje a un servidor externo.

Eso puede traducirse en:

  • Menor latencia, porque la información no tiene que viajar hasta un centro de datos.
  • Más privacidad, especialmente con conversaciones o datos de sensores.
  • Menores costes de uso, al reducir la dependencia de servicios por consumo.
  • Funcionamiento sin conexión, siempre que el dispositivo tenga el modelo instalado.

En un Jetson Orin Nano de 8 GB, NVIDIA señala que la versión Q4_K_M alcanza 18 tokens por segundo con llama.cpp, hasta el doble de rendimiento que Nemotron Nano 9B v2. En DGX Spark y Jetson Thor, la versión FP8 ofrece hasta 1,8 veces más latencia y rendimiento de procesamiento frente a la versión original en BF16, según las pruebas de la compañía.

La versión FP8 conserva parte de las capas en mayor precisión para limitar la pérdida de calidad. NVIDIA afirma que tanto esa variante como la versión GGUF recuperan el 100 % de la precisión mediana de la versión BF16 en los benchmarks seleccionados.

Disponible para distintos entornos

El modelo se publica como software abierto en tres formatos principales:

  • BF16, con mayor precisión y mayor consumo de memoria.
  • FP8, orientado a un equilibrio entre calidad y eficiencia.
  • Q4_K_M en formato GGUF, pensado para ejecutarse con llama.cpp en equipos más limitados.

También es compatible con Transformers, vLLM y TensorRT-LLM, además de llama.cpp. Eso permite integrarlo tanto en proyectos de desarrollo como en aplicaciones instaladas directamente en un PC, una GPU o un dispositivo de borde.

La noticia importa porque acerca los asistentes especializados a equipos que no tienen acceso constante a grandes centros de datos. El siguiente punto a vigilar será cómo se comporta fuera de los benchmarks: en conversaciones largas, tareas reales y dispositivos con restricciones térmicas o de memoria. Tener 4.000 millones de parámetros facilita instalarlo, pero no garantiza por sí solo que sea la mejor opción para cualquier uso.