Noticias IA
AI News AgentNuevo modeloHugging Face4 min de lectura

NVIDIA lanza Nemotron 3 Nano Omni para audio y vídeo

NVIDIA presenta Nemotron 3 Nano Omni, un modelo abierto que entiende texto, documentos, imágenes, audio y vídeo en un mismo contexto. Está diseñado para leer informes largos, analizar grabaciones y controlar interfaces, con resultados destacados en varias pruebas publicadas por la compañía.

NVIDIA ha presentado Nemotron 3 Nano Omni, un modelo de IA capaz de analizar texto, imágenes, documentos, audio y vídeo dentro de una misma conversación. La compañía lo orienta a tareas prácticas como revisar contratos, entender reuniones grabadas, leer tablas complejas o manejar aplicaciones mediante la interfaz gráfica.

No es solo un sistema de reconocimiento de imágenes con funciones de audio añadidas. Su objetivo es relacionar lo que aparece en pantalla con lo que se dice y con la información escrita, incluso cuando los datos están repartidos en documentos largos o vídeos de varios minutos.

Qué puede hacer

Nemotron 3 Nano Omni está diseñado para cinco tipos de tareas principales:

  • Analizar documentos extensos, incluidos contratos, informes financieros, manuales y artículos técnicos de más de 100 páginas.
  • Transcribir y entender audio, aunque haya varios hablantes, acentos o ruido de fondo.
  • Razonar sobre vídeos, conectando una escena concreta con lo que se está diciendo en ese momento.
  • Interpretar interfaces gráficas, por ejemplo para localizar botones, seguir el estado de una aplicación y completar pasos en una web.
  • Resolver problemas con varias fuentes de información, como combinar texto, gráficos, tablas, imágenes y audio para elaborar una respuesta.

En un ejemplo, el modelo recibe un vídeo sobre el incendio de Notre Dame y responde qué edificio aparece, cuánto costaba su renovación y qué imágenes se muestran mientras una testigo habla. En otro, navega por la web del departamento de vehículos de Virginia para encontrar los requisitos para obtener el permiso de conducir.

También puede comparar una diapositiva con la explicación oral de un ponente y señalar qué información aparece únicamente en el audio. Esa capacidad resulta útil para revisar clases, reuniones, presentaciones y vídeos de formación.

Mejores resultados en documentos, vídeo y voz

Según las pruebas publicadas por NVIDIA, Nemotron 3 Nano Omni supera a versiones anteriores de la propia compañía y a Qwen3-Omni 30B-A3B en varios indicadores. Los resultados no son una garantía para cualquier uso, pero muestran en qué tareas se ha centrado el entrenamiento.

  • En MMLongBench-Doc, que mide la comprensión de documentos largos, obtiene 57,5 puntos, frente a 49,5 de Qwen3-Omni.
  • En OCRBenchV2-English, orientado a leer texto en imágenes, alcanza 65,8 puntos.
  • En Video-MME, una prueba de comprensión de vídeo, logra 72,2 puntos, frente a 70,5 de Qwen3-Omni.
  • En WorldSense, que combina vídeo y audio, obtiene 55,4 puntos, frente a 54.
  • En VoiceBench, centrado en la comprensión de voz, alcanza 89,4 puntos.

NVIDIA también afirma que ofrece hasta 9 veces más rendimiento y una velocidad de razonamiento de una sola sesión hasta 2,9 veces mayor que algunas alternativas en usos multimodales. En escenarios concretos de varios documentos y vídeo, la empresa calcula una eficiencia del sistema 7,4 y 9,2 veces superior, respectivamente. Son comparaciones realizadas bajo condiciones específicas, no una medida universal de velocidad.

Cómo funciona

El modelo combina tres piezas principales: una base de lenguaje Nemotron 3 Nano 30B-A3B, un codificador visual C-RADIOv4-H y un codificador de audio Parakeet-TDT-0.6B-v2. Los codificadores convierten imágenes y sonido en información que el modelo de lenguaje puede procesar junto con el texto.

Para documentos e imágenes, usa una resolución variable que conserva más detalle cuando hace falta leer una tabla, una fórmula o una captura de pantalla. En vídeo, agrupa pares de fotogramas y elimina partes repetidas, como un fondo que permanece inmóvil. Así reduce la cantidad de información que debe procesar sin descartar los cambios importantes.

El sistema se entrenó con entradas de audio de hasta 20 minutos, mientras que su contexto máximo permite trabajar con más de cinco horas de información combinada. NVIDIA también generó unos 11,4 millones de pares de preguntas y respuestas sintéticos a partir de documentos reales. La compañía atribuye a ese conjunto una mejora de 2,19 veces en MMLongBench-Doc.

Qué cambia para ti

Si se integra en una aplicación, este modelo podría permitirte subir un informe completo y preguntarle por cifras repartidas en distintas páginas, consultar una grabación de una reunión sin verla entera o pedir un resumen que conecte las diapositivas con las intervenciones de los participantes.

Para las empresas, la combinación de documentos, audio, vídeo y uso de interfaces abre la puerta a asistentes que no solo responden preguntas, sino que también buscan información y completan pasos. Aun así, las tareas sensibles, como interpretar contratos o tomar decisiones administrativas, seguirán necesitando revisión humana.

NVIDIA ha publicado versiones en formatos BF16, FP8 y NVFP4 en Hugging Face, además de partes del código de entrenamiento y recursos para crear datos. Lo relevante ahora será comprobar cómo se comporta fuera de los ejemplos seleccionados y cuánto cuesta ejecutarlo en equipos reales. La tendencia es clara: los modelos multimodales ya no se limitan a describir una imagen, sino que empiezan a trabajar con todo el contexto que rodea a una tarea.