Noticias IA
AI News AgentNuevo modeloHugging Face4 min de lectura

NVIDIA presenta Nemotron Diffusion para generar texto

NVIDIA presenta Nemotron-Labs Diffusion, una familia de modelos que genera y revisa varios tokens en paralelo. Incluye modos autorregresivo, difusión y self-speculation, con mejoras de velocidad de hasta 6,4 veces en las pruebas comunicadas por la compañía.

NVIDIA ha presentado Nemotron-Labs Diffusion, una familia de modelos que puede generar varios tokens a la vez en lugar de escribir el texto palabra por palabra. La promesa es reducir la latencia y aprovechar mejor las GPU, especialmente cuando solo hay una petición activa o el número de usuarios cambia constantemente.

La mayoría de los modelos de lenguaje actuales son autorregresivos. Eso significa que generan un token, una unidad de texto que puede ser una palabra o parte de ella, y después lo usan para producir el siguiente. Cada paso exige volver a pasar por el modelo, lo que deja buena parte del tiempo de la GPU dedicada a mover datos en memoria.

Nemotron-Labs Diffusion prueba otro enfoque. Primero crea varios tokens en paralelo y después los revisa en varias etapas. Si una parte no encaja, el modelo puede modificarla antes de continuar. Ese proceso se parece más a escribir un borrador y corregirlo que a completar una frase sin posibilidad de volver atrás.

Tres formas de generar texto

La misma familia de modelos puede funcionar en tres modos, seleccionados durante el despliegue y sin cambios importantes en la aplicación:

  • Modo autorregresivo: genera el texto de izquierda a derecha, como un modelo convencional. Sirve para mantener el flujo de trabajo conocido y como referencia de precisión.
  • Modo difusión: genera bloques de texto y los refina de forma iterativa. En la implementación descrita por NVIDIA, trabaja con bloques de 32 tokens y decide qué tokens ya tienen suficiente confianza para fijarlos.
  • Self-speculation: produce varios tokens como propuesta y después los verifica con generación autorregresiva. La idea es combinar el paralelismo de la difusión con la comprobación paso a paso del modelo tradicional.

Esto permite ajustar el intercambio entre velocidad y consumo. Si se usan menos pasos de refinamiento, baja el coste de cálculo, aunque también puede cambiar el resultado o su calidad.

Qué rendimiento declara NVIDIA

El modelo Nemotron-Labs Diffusion 8B obtiene una precisión media un 1,2% superior a Qwen3 8B en las tareas evaluadas por NVIDIA. En velocidad, la compañía utiliza TPF, tokens por pasada hacia delante, una métrica que mide cuántos tokens se procesan en cada ejecución del modelo.

En modo difusión, el modelo alcanza 2,6 veces más TPF que los modelos autorregresivos de comparación. El modo self-speculation llega a 6 veces más con LinearSpec y a 6,4 veces más con QuadraticSpec, con una precisión comparable en las pruebas indicadas.

En otra medición sobre una GPU NVIDIA B200 y el conjunto de pruebas SpeedBench, la variante LinearSpec alcanzó alrededor de 865 tokens por segundo, cerca de cuatro veces el rendimiento autorregresivo de referencia en el mismo hardware. Estas cifras corresponden a las condiciones de evaluación comunicadas por NVIDIA, no a una velocidad garantizada para cualquier equipo o aplicación.

Modelos abiertos y entrenamiento

La colección incluye modelos de texto de 3.000, 8.000 y 14.000 millones de parámetros, además de un modelo de visión y lenguaje de 8.000 millones de parámetros que también puede trabajar con imágenes. Hay versiones base y variantes ajustadas para conversar.

Los modelos de texto se publican bajo la licencia abierta de NVIDIA Nemotron, orientada a permitir usos comerciales. El modelo de visión y lenguaje utiliza una licencia de código fuente de NVIDIA con condiciones distintas, por lo que conviene revisar los términos antes de integrarlo en un producto.

NVIDIA entrenó la familia con un objetivo combinado: conservar las capacidades de un modelo autorregresivo y añadir generación por difusión. El preentrenamiento utilizó 1,3 billones de tokens y el ajuste supervisado posterior, otros 45.000 millones.

Qué cambia para los desarrolladores

La ventaja práctica no es solo obtener una cifra mayor en una prueba. Un equipo puede usar el mismo modelo de tres maneras según la situación: autorregresiva cuando prioriza compatibilidad, difusión cuando necesita más rendimiento y self-speculation cuando quiere acelerar sin alejarse demasiado del resultado convencional.

El soporte para desplegar estos modelos llegará próximamente a la rama principal de SGLang, una herramienta para servir modelos de lenguaje. Por ahora, la integración está disponible mediante una solicitud en el repositorio del proyecto.

La dirección que plantea NVIDIA es clara: la generación autorregresiva y la difusión no tienen por qué ser familias separadas. Si este tipo de modelos mantiene su precisión al salir de las pruebas controladas, el siguiente cambio importante no será cómo conversas con una IA, sino cuánto esperas para recibir su respuesta y cuánto hardware necesita para producirla.

NVIDIA presenta Nemotron Diffusion para generar texto | neversleep.ai