Anthropic refuerza las defensas de IA de Fable 5
Anthropic vuelve a ofrecer `Claude Fable 5` a todos los usuarios y explica cómo bloquea usos peligrosos de ciberseguridad. También propone una escala de CJS, de 0 a 4, para medir la gravedad de los jailbreaks que consiguen saltarse sus defensas.

Anthropic ha vuelto a desplegar Claude Fable 5 a nivel global y ha detallado cómo intenta evitar que el modelo se use para ciberataques. La compañía también propone una escala para medir la gravedad de los jailbreaks, es decir, técnicas que fuerzan a una IA a ignorar sus límites de seguridad.
La decisión llega después de que Fable 5 regresara al servicio el 1 de julio. Ahora está disponible para todos los usuarios, mientras Anthropic explica qué solicitudes de ciberseguridad bloquea, cuáles permite y cómo piensa evaluar los fallos que consigan saltarse sus defensas.
Cuatro niveles para las tareas de ciberseguridad
El problema es que muchas herramientas de seguridad tienen doble uso. Analizar un código para encontrar una vulnerabilidad puede ayudar a proteger una empresa, pero también puede servir como primer paso para atacarla.
Por eso, Fable 5 no bloquea cualquier pregunta relacionada con ciberseguridad. Sus clasificadores, sistemas que detectan el riesgo de una solicitud, separan las peticiones en cuatro grupos:
- Uso prohibido: acciones como crear ransomware, robar datos, evadir antivirus, desplegar malware, sabotear sistemas físicos o atacar infraestructuras de Internet. Se bloquean.
- Doble uso de alto riesgo: pruebas de penetración, escalada de privilegios, movimiento lateral, desarrollo de exploits o ataques contra redes industriales, telecomunicaciones y sistemas financieros. También se bloquean por ahora.
- Doble uso de bajo riesgo: revisar sistemas públicos, buscar vulnerabilidades que otras herramientas ya detectan o probar protocolos criptográficos. Se permiten en muchos casos, aunque se monitorizan y algunas solicitudes se bloquean como medida de precaución.
- Uso benigno: corregir código, analizar registros, gestionar redes y nubes, aplicar parches, investigar incidentes o hacer ingeniería inversa de malware. La intención es permitir estas tareas, aunque pueden producirse falsos positivos.
La frontera más delicada está en la búsqueda de vulnerabilidades. Anthropic quiere permitir que Fable 5 encuentre fallos conocidos o que otras herramientas ya pueden detectar, pero pretende bloquear el descubrimiento de vulnerabilidades complejas que ningún modelo disponible pueda encontrar todavía. También bloquea la generación automática de exploits funcionales.
La protección no depende de un único filtro. Anthropic combina los clasificadores con controles de acceso, entrenamiento de seguridad y monitorización fuera de línea. Además, reconoce que la llamada margen de seguridad puede bloquear algunas solicitudes legítimas: cuanto más amplio es ese margen, más difícil resulta que se cuele una petición peligrosa, pero también aumentan los bloqueos incorrectos.
Una escala para medir los jailbreaks
Anthropic propone una escala llamada Cyber Jailbreak Severity, o CJS, para que empresas, investigadores y gobiernos puedan describir un jailbreak con criterios comunes. La escala va de CJS-0, informativo, a CJS-4, crítico.
La puntuación combina cuatro factores:
- Ganancia de capacidad: cuánto más puede hacer un atacante gracias al jailbreak frente a las herramientas que ya existen.
- Alcance: si funciona en una sola tarea o en muchas categorías de ataques.
- Facilidad para convertirlo en un ataque: cuánto trabajo y conocimientos hacen falta para usarlo.
- Facilidad de descubrimiento: si requiere una investigación especializada o ya está publicado y al alcance de cualquiera.
Un jailbreak público que desactive todas las protecciones con una sola instrucción recibiría la categoría CJS-4. En cambio, una técnica que solo extraiga una cadena de texto conocida de un tutorial de seguridad podría quedarse en CJS-0, porque no ofrece una capacidad nueva al atacante.
La escala no es lineal. Cada nivel representa un salto importante en el riesgo. Además, Anthropic puede elevar la categoría si el fallo permite descubrir una vulnerabilidad crítica, no tiene una solución cercana o se combina con otros problemas conocidos.
Qué cambia para ti
Para un usuario normal, el efecto más visible será que algunas solicitudes de ciberseguridad serán rechazadas aunque tengan una explicación legítima. Un administrador podrá pedir ayuda para analizar registros o corregir una configuración, pero no necesariamente para automatizar una intrusión o desarrollar un exploit durante una prueba autorizada.
Anthropic presenta el sistema como un borrador y pide comentarios a investigadores, gobiernos y organizaciones civiles. También ha abierto un programa en HackerOne para que los investigadores informen de posibles jailbreaks en Fable 5.
La cuestión que queda por vigilar es si estos filtros consiguen distinguir bien entre defensa y ataque sin convertir la asistencia de seguridad en una sucesión de bloqueos. A medida que los modelos sean más útiles para encontrar fallos, medir esa frontera con criterios compartidos será tan importante como mejorar el modelo.