AprielGuard detecta ataques contra agentes de IA
ServiceNow AI presenta AprielGuard, un modelo de 8.000 millones de parámetros que detecta riesgos de seguridad y ataques contra agentes de IA. Analiza mensajes, conversaciones largas y flujos con memoria, herramientas y llamadas a APIs, aunque sus resultados dependen del idioma, el contexto y el tipo de ataque.

ServiceNow AI presentó AprielGuard, un modelo de 8.000 millones de parámetros que busca detectar tanto contenido peligroso como ataques diseñados para manipular sistemas de IA. Está pensado para modelos que ya no solo responden preguntas, sino que también usan herramientas, consultan memoria, ejecutan código y toman decisiones en varios pasos.
La diferencia está en el tipo de amenazas que intenta cubrir. Un filtro tradicional puede identificar insultos o contenido sexual en un mensaje aislado. AprielGuard también analiza conversaciones largas y flujos de trabajo completos para encontrar instrucciones ocultas, intentos de saltarse las reglas o cambios maliciosos en la memoria y las herramientas de un agente.
Qué detecta AprielGuard
El modelo clasifica 16 categorías de riesgos de seguridad, entre ellas:
- Contenido tóxico, odio y representaciones injustas.
- Contenido adulto, autolesiones y actividades ilegales.
- Desinformación, fraude, manipulación e intentos de influencia.
- Riesgos financieros, amenazas de seguridad y violaciones de privacidad.
- Difamación, información peligrosa y vulneraciones de propiedad.
También busca ataques adversariales. Son técnicas que intentan hacer que un modelo ignore sus instrucciones o actúe fuera de los límites previstos. El sistema contempla casos como prompt injection, un ataque que introduce instrucciones maliciosas dentro de un texto aparentemente normal, además de jailbreaks, secuestro de contexto, corrupción del razonamiento, envenenamiento de memoria y manipulación de herramientas.
En un agente que resume documentos, por ejemplo, una instrucción dañina podría estar escondida en una página recuperada por el sistema. En otro caso, un atacante podría alterar un parámetro antes de que el agente llame a una API. AprielGuard intenta revisar esas partes del proceso, no solo el mensaje inicial del usuario.
Un filtro para conversaciones y agentes
El modelo acepta tres tipos de entrada:
- Un mensaje o instrucción independiente.
- Una conversación con varios turnos.
- Un flujo de trabajo de un agente, con mensajes del sistema, razonamientos, memoria, llamadas a herramientas y resultados intermedios.
Puede funcionar en modo rápido, que devuelve solo la clasificación, o en modo de razonamiento, que añade una explicación estructurada de la decisión. El primero está pensado para sistemas que necesitan baja latencia. El segundo ofrece más contexto para revisar por qué se marcó una entrada, aunque consume más tiempo y recursos.
La base es una versión reducida a 8.000 millones de parámetros de Apriel-1.5 Thinker Base. El modelo admite contextos de hasta 32.000 tokens, una unidad de texto que permite procesar documentos y conversaciones extensas, y fue diseñado para funcionar con precisión bfloat16, habitual en cargas de trabajo de IA.
Resultados: buen rendimiento, pero no es una garantía
En las pruebas públicas, AprielGuard obtuvo resultados altos en varios conjuntos de datos. Su puntuación F1, una métrica que combina precisión y capacidad para encontrar casos peligrosos, llegó a 1,00 en HarmBench y a 0,98 en SimpleSafetyTests. En ataques adversariales alcanzó 0,98 en Salad-Data y 1,00 en ChatGPT-Jailbreak-Prompts.
Los resultados no fueron iguales en todas las pruebas. En un conjunto sobre inyecciones de instrucciones obtuvo un F1 de 0,68, y en otro conjunto de ataques contra instrucciones alcanzó 0,73. Esto importa porque muestra que detectar un ataque conocido no equivale a reconocer cualquier ataque nuevo.
En una evaluación interna con flujos de agentes y textos de hasta 32.000 tokens, el modo sin razonamiento logró un F1 de 0,97 para riesgos de seguridad y 0,88 para ataques adversariales. Al activar el razonamiento, el F1 fue de 0,95 y 0,94, respectivamente. A cambio, aumentó la tasa de falsos positivos, es decir, la proporción de casos seguros marcados por error.
Datos sintéticos y límites del modelo
El entrenamiento se hizo principalmente con datos sintéticos, generados por otros modelos y técnicas automáticas. El equipo creó conversaciones largas, escenarios con herramientas, estados de memoria alterados e interacciones entre varios agentes. También añadió errores tipográficos, cambios de orden, paráfrasis y sustituciones tipo leetspeak para comprobar si el detector resistía variaciones superficiales.
Hay varias precauciones importantes. Aunque fue evaluado en inglés, alemán, español, francés, francés canadiense, italiano, neerlandés, portugués brasileño y japonés, la mayor parte de su entrenamiento fue en inglés. ServiceNow recomienda probarlo y calibrarlo antes de usarlo en producción en otros idiomas.
Además, puede fallar ante ataques nuevos, textos muy especializados o contextos legales, médicos y científicos. Tampoco conviene tratarlo como una barrera única: un modelo de seguridad también puede equivocarse, bloquear contenido legítimo o no detectar una manipulación sofisticada.
Para ti, el cambio potencial está detrás de los asistentes que trabajan con tus documentos, cuentas o herramientas. En vez de aplicar filtros separados a cada etapa, las empresas podrían usar un solo guardián para revisar mensajes, memoria, llamadas a servicios y resultados. Lo que habrá que vigilar ahora es si ese enfoque mantiene su precisión fuera de los escenarios sintéticos y frente a ataques que sus creadores no anticiparon.