NVIDIA lanza Nemotron 3 para moderar texto e imágenes
NVIDIA presenta Nemotron 3 Content Safety, un modelo abierto que modera texto, imágenes y respuestas de asistentes en 12 idiomas. La compañía afirma que alcanza un 84% de precisión media en pruebas multimodales y reduce la latencia frente a modelos de seguridad más grandes.

NVIDIA ha presentado Nemotron 3 Content Safety, un modelo de 4.000 millones de parámetros que analiza texto, imágenes y respuestas de asistentes para detectar contenido inseguro. Su objetivo es cubrir dos problemas que suelen aparecer juntos: los sistemas de moderación entienden peor los idiomas distintos del inglés y pueden perder el significado cuando una imagen y un texto se interpretan por separado.
El modelo está pensado para vigilar conversaciones, agentes de IA, documentos, capturas de pantalla e imágenes. Puede recibir solo texto, solo una imagen o ambos elementos a la vez, y después emitir un veredicto breve sobre si el contenido es seguro.
El contexto cambia el significado
Una imagen de un cuchillo de cocina no implica por sí sola una amenaza. Si el texto que la acompaña habla de preparar una comida, la combinación es segura. Pero si dice que el objeto se usará para herir a alguien, el mismo cuchillo pasa a formar parte de una posible amenaza.
Ese análisis conjunto también depende del idioma y la cultura. Un símbolo religioso puede tener un significado aceptable en un contexto y estar asociado con propaganda, odio o discriminación en otro. Por eso, traducir cada elemento por separado no siempre basta: el sistema tiene que entender qué significa la combinación para el usuario y su entorno.
Cómo funciona
Nemotron 3 Content Safety se basa en Gemma-3 4B-IT, un modelo de visión y lenguaje con una ventana de contexto de 128.000 tokens y compatibilidad con más de 140 idiomas. NVIDIA lo ajustó mediante un adaptador LoRA, una técnica que añade capacidades específicas sin modificar por completo el modelo base.
El sistema puede evaluar tanto la petición del usuario como la respuesta generada por un asistente. Esto permite detectar casos en los que la entrada parece segura, pero la respuesta termina incluyendo instrucciones peligrosas o contenido prohibido.
En su modo de baja latencia, devuelve etiquetas como:
- Seguridad de la petición del usuario: segura
- Seguridad de la respuesta: insegura
- Categorías: violencia y planificación o confesión de delitos
Las categorías siguen la taxonomía de Aegis AI Content Safety Dataset v2, alineada con el estándar de seguridad de ML Commons. También es posible ocultar las categorías y conservar únicamente el veredicto de seguridad.
Datos en 12 idiomas
NVIDIA entrenó el modelo con datos humanos y sintéticos que incluyen texto, imágenes reales, documentos escaneados, gráficos, capturas de pantalla y ejemplos diseñados para poner a prueba los sistemas de seguridad. El conjunto cubre riesgos como:
- Lenguaje dañino, acoso y autolesiones
- Violaciones de privacidad
- Intentos de saltarse las protecciones de un modelo
- Planificación de delitos
- Políticas de seguridad específicas de cada región
El contenido textual se tradujo a 12 idiomas: inglés, árabe, alemán, español, francés, hindi, japonés, tailandés, neerlandés, italiano, coreano y chino. NVIDIA afirma que los datos sintéticos representan aproximadamente el 10% del entrenamiento, mientras que la mayor parte procede de material creado o revisado por personas.
Rendimiento y disponibilidad
En las pruebas citadas por NVIDIA, el modelo alcanzó una precisión media del 84% en evaluaciones de contenido dañino multimodal y superó a otros modelos abiertos de tamaño comparable. También mantuvo resultados consistentes en los 12 idiomas entrenados y mostró generalización sin entrenamiento específico en portugués, sueco, ruso, checo, polaco y bengalí.
La velocidad es otro de sus objetivos. NVIDIA asegura que presenta aproximadamente la mitad de latencia que modelos multimodales de seguridad más grandes, incluso en mediciones medias, medianas y del percentil 99. La compañía indica que puede ejecutarse en GPU con 8 GB o más de VRAM, lo que facilita usarlo dentro del flujo de un agente sin detener cada acción durante demasiado tiempo.
El modelo ya está disponible en Hugging Face para integrarlo con Transformers o vLLM. Puede funcionar como filtro en tiempo real, revisar grandes lotes de documentos e imágenes o controlar las llamadas a herramientas de un agente. NVIDIA también planea ofrecerlo en abril como NVIDIA NIM, un servicio preparado para producción que simplifica el despliegue y la operación a escala.
Para ti, el cambio más importante es que la moderación deja de limitarse a buscar palabras concretas. Un sistema de este tipo intenta valorar quién dice qué, en qué idioma, junto a qué imagen y con qué respuesta del asistente. Todavía habrá errores y el resultado dependerá de los datos y las políticas elegidas, pero esta combinación será cada vez más necesaria a medida que los agentes de IA trabajen con usuarios, documentos e imágenes de todo el mundo.