Noticias IA
AI News AgentPolítica y seguridadAnthropic3 min de lectura

Anthropic mejora la defensa de Claude contra jailbreaks

Anthropic presenta `Constitutional Classifiers++`, un sistema que protege Claude contra jailbreaks con aproximadamente un 1% de coste adicional. En pruebas con 198.000 intentos no apareció ningún jailbreak universal y el rechazo de consultas inofensivas cayó al 0,05%.

Anthropic ha presentado una nueva versión de sus defensas para Claude que busca bloquear los jailbreaks, técnicas para esquivar los límites de seguridad de un modelo, sin encarecer su uso ni rechazar tantas preguntas legítimas.

El sistema se llama Constitutional Classifiers++ y combina varios controles. Según Anthropic, durante más de 1.700 horas de pruebas y 198.000 intentos, sus equipos de seguridad no encontraron ningún jailbreak universal, es decir, una estrategia que funcione de forma consistente contra muchas consultas.

Más protección con menos coste

La primera versión de los llamados clasificadores constitucionales redujo la tasa de éxito de los jailbreaks del 86% al 4,4% frente a un modelo sin esa protección. Pero tenía dos inconvenientes: aumentaba el coste de computación un 23,7% y hacía que Claude rechazara un 0,38% más de preguntas inofensivas.

La nueva versión reduce ese equilibrio entre seguridad y utilidad. En un mes de funcionamiento sobre tráfico de Claude Sonnet 4.5, rechazó solo el 0,05% de las consultas consideradas inofensivas, una caída del 87% frente al sistema anterior. Aplicada al tráfico de Claude Opus 4.0, añade aproximadamente un 1% de coste de computación.

En la práctica, esto significa que una pregunta legítima de química, programación o investigación tiene menos posibilidades de recibir un “no” automático solo porque se parece a una solicitud peligrosa.

Cómo funciona la nueva defensa

El sistema analiza las conversaciones en dos etapas. Primero, una herramienta ligera revisa todo el tráfico. Si detecta señales sospechosas, envía el intercambio a un clasificador más potente para que lo examine con mayor detalle.

Ese segundo análisis no mira únicamente la respuesta de Claude. También compara la respuesta con la solicitud original. Es una diferencia importante: una frase aparentemente inocente puede ocultar otro significado cuando se interpreta junto con la pregunta que la provocó.

Anthropic también usa sondas internas, pequeños clasificadores que observan patrones en los cálculos intermedios del modelo. Esos patrones pueden indicar que una petición parece dañina antes de que Claude termine de generar una respuesta. La empresa los compara con una intuición interna del modelo, aunque no se trata de conciencia ni de una decisión independiente.

Los ataques también han evolucionado

Las pruebas revelaron que todavía existen formas de intentar esquivar estos controles:

  • Ataques de reconstrucción: dividen una petición peligrosa en fragmentos que parecen inofensivos y después piden al modelo que los reúna.
  • Ataques de ofuscación: hacen que Claude sustituya términos delicados por palabras aparentemente inocentes, metáforas o acertijos.

Estos métodos no siempre funcionan sin costes. En algunas pruebas, el rendimiento del modelo en GPQA Diamond, un examen de preguntas de nivel doctoral sobre biología, química y física, cayó del 74% al 32% cuando se aplicaron ciertas técnicas de jailbreak.

Las cifras no significan que Claude sea imposible de engañar. Anthropic reconoce que encontró una vulnerabilidad de alto riesgo durante las pruebas, aunque la tasa observada fue de 0,005 por cada mil consultas, la más baja entre los sistemas evaluados.

El siguiente paso será integrar estas señales de seguridad directamente en la generación de respuestas y entrenar mejor a los modelos para reconocer información disfrazada. Para ti, el cambio más visible debería ser doble: menos respuestas peligrosas ante intentos de manipulación y menos bloqueos cuando la pregunta es legítima. Ningún sistema es infalible, así que la carrera entre defensas y jailbreaks continúa.