Anthropic amplía su programa de ciberseguridad con IA
Anthropic amplía su Cyber Verification Program con tres niveles de acceso para equipos de ciberseguridad. Los modelos podrán realizar tareas más avanzadas según la organización, sus autorizaciones y los controles que cumpla.

Anthropic amplía su Cyber Verification Program para que más equipos de seguridad puedan usar modelos de IA con menos bloqueos en tareas defensivas. El programa incorpora tres niveles de acceso, cada uno con requisitos y controles distintos, y permite trabajar con modelos como Claude Opus 5.5, Claude Sonnet 5.5 y Claude Mythos 5.1.
La razón es sencilla: una IA capaz de encontrar una vulnerabilidad también puede ayudar a explotarla. Por eso, los modelos disponibles para todo el público mantienen barreras estrictas para muchas tareas de ciberseguridad, aunque sí pueden utilizarse para revisar código, corregir fallos conocidos, analizar código propio y clasificar alertas.
El nuevo programa busca dar más margen a quienes protegen sistemas reales sin eliminar los controles necesarios.
Tres niveles de acceso
Defense Access está pensado para trabajo defensivo. Incluye operaciones de centros de seguridad, respuesta a incidentes, ingeniería inversa de malware y análisis de vulnerabilidades. Pueden solicitarlo equipos internos, universidades, organizaciones sin ánimo de lucro, entidades públicas, operadores de infraestructuras críticas, empresas de seguridad pequeñas, mantenedores de proyectos de código abierto e investigadores con historial de vulnerabilidades reportadas.
Anthropic espera que muchas organizaciones defensivas puedan acceder a este nivel y afirma que pretende responder a las solicitudes en unos días.
Red Team Access añade pruebas de penetración y ejercicios de equipo rojo. En otras palabras, permite simular ataques contra sistemas que la organización está autorizada a evaluar. Aun así, mantiene bloqueos en acciones capaces de causar daños físicos o interrupciones masivas, como desplegar ransomware, dañar sistemas físicos o probar sistemas de seguridad de alto riesgo.
La revisión de estas solicitudes puede tardar varias semanas. Además, este nivel está disponible para organizaciones, no para investigadores individuales.
Specialized Access tiene la menor cantidad de bloqueos y queda reservado para un grupo limitado de organizaciones verificadas. Son entidades autorizadas a probar sistemas cuyo fallo podría poner vidas en riesgo o alterar mercados, como redes eléctricas, sistemas de vuelo, telecomunicaciones, transferencias interbancarias y redes administrativas gubernamentales.
Anthropic revisa cada organización de este nivel junto con el Gobierno de Estados Unidos. Los miembros actuales de Project Glasswing pasarán a esta categoría sin tener que repetir la aprobación para los modelos que ya utilizan.
Qué tan bien funcionan los controles
Anthropic probó Claude Opus 5.5 con CyScenarioBench, una evaluación que mide si un modelo puede planificar y ejecutar operaciones cibernéticas de varias etapas en condiciones realistas. Realizó cinco intentos para cada uno de los diez desafíos en cada nivel.
Los resultados fueron los siguientes:
- Sin acceso al programa, las 50 pruebas se bloquearon desde el primer mensaje.
- En Defense Access, 46 de las 50 pruebas se bloquearon en algún momento y cuatro llegaron a completarse.
- En Red Team Access, no hubo bloqueos y el modelo completó 34 de 50 tareas.
Ese último resultado equivale a una tasa de éxito del 67,6 %, similar a la obtenida sin salvaguardas, una configuración que Anthropic considera representativa de Specialized Access. La empresa reconoce que seguirá ajustando sus clasificadores, los sistemas que deciden qué solicitudes permitir o bloquear.
El impacto que Anthropic atribuye al programa
Según Anthropic, los participantes de Project Glasswing identificaron al menos 129.000 vulnerabilidades verificadas entre abril y julio de 2026. La compañía encontró otras 5.500 mediante sus propios análisis de proyectos de código abierto entre abril y octubre.
Más de 33.000 de esas vulnerabilidades han sido clasificadas hasta ahora como críticas o de alta gravedad. Anthropic advierte que la cifra probablemente es inferior al impacto real, porque se basa en datos de solo una parte de los colaboradores. Por esa razón, estima que el resultado verdadero podría ser al menos cinco veces mayor.
La empresa también recoge testimonios de socios que aseguran que Claude Mythos aceleró la búsqueda de vulnerabilidades en meses o incluso años frente al trabajo sin el modelo. Es una afirmación basada en las respuestas de esos participantes, no una medición independiente de todos los equipos de seguridad.
Qué cambia para las organizaciones
Las entidades que entren al programa deberán aceptar retención de datos para que Anthropic pueda vigilar posibles usos indebidos. Más adelante, la compañía planea ofrecer Enterprise Frontier Safeguards, una solución que combinará controles de seguridad con almacenamiento en una infraestructura de nube controlada por el cliente.
CVP está disponible en Claude Platform, Google Cloud Vertex AI y Microsoft Foundry. En Amazon Bedrock, por ahora, solo podrán utilizarlo los clientes que cumplan los requisitos de Enterprise Frontier Safeguards.
Para los equipos de seguridad, el cambio principal es que ya no existe un único nivel de acceso. Una universidad que analiza malware, una empresa que hace pruebas de penetración y un operador de una red eléctrica no necesitan las mismas capacidades ni deben asumir el mismo riesgo.
Anthropic está intentando convertir esa diferencia en permisos concretos. Lo importante será comprobar si los controles consiguen ampliar el acceso defensivo sin abrir una vía equivalente para el abuso, especialmente cuando los modelos puedan actuar sobre sistemas críticos.