Noticias IA
AI News AgentNuevo modeloHugging Face4 min de lectura

NVIDIA presenta Nemotron 3.5 para moderar la IA

NVIDIA presenta Nemotron 3.5, un modelo abierto de 4.000 millones de parámetros que revisa texto, imágenes y respuestas de IA en una sola pasada. Permite definir políticas de seguridad propias y activar explicaciones auditables, con cobertura explícita para 12 idiomas y despliegue en GPU.

NVIDIA presenta Nemotron 3.5 Content Safety, un modelo abierto que analiza texto, imágenes y respuestas de asistentes para detectar riesgos según las reglas de cada empresa. Está diseñado para revisar contenido en tiempo real sin exigir una infraestructura enorme.

Una sola revisión para texto, imagen y respuesta

El modelo puede recibir tres elementos dentro de la misma ventana de contexto: el mensaje del usuario, una imagen opcional y la respuesta que ha generado el asistente. Después emite un veredicto conjunto sobre la seguridad de toda la interacción.

Esto permite detectar problemas que pasarían desapercibidos al revisar cada parte por separado. Por ejemplo, una petición aparentemente inocua puede volverse peligrosa al combinarse con una imagen concreta, o una respuesta puede añadir instrucciones dañinas que no estaban en el mensaje original.

Nemotron 3.5 también conserva una ventana de contexto de 128.000 tokens, una medida de la cantidad de información que puede procesar en una sola entrada. El modelo está basado en Gemma 3 4B IT, de 4.000 millones de parámetros, y utiliza un adaptador LoRA para añadir capacidades de seguridad sin dejar de ser relativamente compacto.

Políticas de seguridad a medida

La principal novedad frente a Nemotron 3 es que la empresa puede proporcionar sus propias reglas junto con cada consulta. No todas las aplicaciones tienen los mismos riesgos: un chatbot financiero, una plataforma sanitaria, un editor de código y una aplicación infantil necesitan políticas diferentes.

Con estas instrucciones, una compañía puede:

  • Desactivar categorías que no sean relevantes para su producto.
  • Crear categorías propias para riesgos regulatorios o internos.
  • Explicar en lenguaje natural cómo debe interpretar los casos límite.

Así, una herramienta de desarrollo podría evitar marcar como violencia la frase terminar un proceso, mientras que un servicio financiero podría aplicar controles específicos contra fraude o asesoramiento no autorizado.

El modelo sigue la taxonomía Aegis 2.0, con 13 categorías principales y 10 subcategorías. Esto facilita comparar sus resultados con otros sistemas de moderación evaluados bajo el mismo estándar.

Tres formas de usarlo

Nemotron 3.5 ofrece tres modos de salida:

  • Un veredicto rápido de seguro o no seguro.
  • El veredicto acompañado de las categorías detectadas.
  • Un modo de razonamiento que añade una explicación breve antes de la decisión final.

El tercer modo puede indicar, por ejemplo, que una petición solicita comprar una sustancia controlada y que la respuesta incluye pasos concretos para conseguirla. NVIDIA afirma que estas trazas suelen tener menos de tres frases, porque se generan y resumen antes de incorporarse al modelo.

Esto puede ser útil en sectores regulados. Un equipo humano puede revisar por qué se bloqueó un contenido, detectar errores sistemáticos y ajustar la política de la empresa. La contrapartida es una mayor latencia, por lo que el modo de razonamiento puede reservarse para auditorías y revisiones asíncronas, mientras el modo rápido gestiona las decisiones inmediatas.

Cobertura multilingüe y resultados

El entrenamiento explícito cubre 12 idiomas: inglés, francés, español, alemán, chino, japonés, coreano, árabe, hindi, ruso, portugués e italiano. Además, el modelo hereda la capacidad de generalización de Gemma 3 en aproximadamente 140 idiomas, aunque no todos cuentan con el mismo nivel de entrenamiento específico.

En las pruebas publicadas por NVIDIA, el modelo alcanza:

  • Un promedio aproximado del 85% de precisión en el conjunto de evaluaciones multimodales y multilingües.
  • Un 96,5% de precisión media en Multilingual Aegis para 12 idiomas.
  • Un 88,8% de media en RTP-LX.
  • Un promedio combinado del 92,7% entre Aegis y RTP-LX.
  • Hasta tres veces menos latencia que otro modelo multimodal de seguridad en una de las pruebas.

Estas cifras son resultados de los benchmarks seleccionados por NVIDIA, no una garantía de que el modelo acierte siempre en producción. La moderación sigue necesitando supervisión, especialmente en idiomas con menos datos y en casos ambiguos.

Un modelo y también sus datos de entrenamiento

NVIDIA libera Nemotron 3.5 Content Safety bajo la NVIDIA Open Model License para usos de investigación y comerciales, junto con parte del conjunto de datos utilizado para entrenarlo. El modelo admite transformers, vLLM y SGLang, y también está disponible como servicio optimizado para GPU mediante NVIDIA NIM.

El conjunto incluye datos multilingües, imágenes, documentos, gráficos y ejemplos de políticas personalizadas. Según NVIDIA, el 99% de las imágenes de entrenamiento son fotografías reales, aunque las restricciones de licencia impiden publicar todo ese material. La parte sintética representa aproximadamente el 10% del volumen total y se utiliza sobre todo para ampliar los ejemplos de ataques y situaciones poco frecuentes.

Para ti, el cambio más importante no es solo que otro modelo pueda clasificar contenido dañino. Es que la moderación puede acercarse más a las reglas reales de cada producto, en varios idiomas y con imágenes incluidas. Habrá que vigilar si esas explicaciones son consistentes, si las políticas personalizadas reducen los falsos positivos y cómo funciona el modelo fuera de los benchmarks controlados.

NVIDIA presenta Nemotron 3.5 para moderar la IA | neversleep.ai