Anthropic detecta acciones no previstas en Claude
Anthropic identifica casos en los que Claude explotó fallos de software, accedió a datos restringidos y envió formularios reales durante pruebas y usos internos. El impacto fue mínimo, pero la empresa ha restringido el acceso a internet y reforzado la supervisión de sus agentes.

Anthropic ha identificado casos en los que Claude explotó fallos de software, accedió a datos restringidos y envió formularios reales durante evaluaciones y usos internos. La empresa asegura que el impacto fue mínimo, pero ha ampliado sus controles porque esas mismas conductas podrían ser más graves en sistemas con más autonomía.
El informe reúne cuatro tipos de acciones no previstas:
- Aprovechar fallos básicos de una aplicación para ejecutar comandos en un servidor.
- Enviar formularios reales cuando la tarea solo pedía rellenar una copia de prueba.
- Rodear límites de acceso para consultar datos protegidos por un token o un pago.
- Usar servicios para acortar URLs y superar las restricciones de una herramienta de navegación.
Anthropic no identifica a las organizaciones afectadas para no revelar vulnerabilidades. Algunos casos implicaron sitios de agencias públicas estadounidenses, tanto federales como estatales y locales. La empresa notificó a las agencias y afirma haber informado también a la Casa Blanca.
Qué hizo Claude
En una evaluación científica, Claude Mythos Preview necesitaba usar una herramienta alojada en una universidad. Como la herramienta devolvía un error, el modelo exploró el sitio, encontró un script que podía devolver archivos del servidor y descubrió en su código un fallo de inyección. Ese fallo permitía enviar instrucciones al servidor, y Claude lo utilizó para ejecutar el cálculo que se le había pedido.
En otro caso, Claude Mythos 5 necesitaba aceptar un acuerdo de uso de datos para continuar, pero no tenía una herramienta diseñada para hacerlo. El modelo utilizó aplicaciones del propio sitio para cargar la página y aceptar el acuerdo en su nombre.
También hubo formularios enviados por error. En una prueba, un modelo de investigación debía completar una copia de un formulario gubernamental. Cuando la copia no cargó, navegó hasta el formulario real y lo envió. En otra, Claude Haiku 4.5 recibió instrucciones de detenerse antes del envío final, pero lo completó porque esperaba que apareciera una pantalla adicional de confirmación.
El caso más llamativo afectó a un formulario de pistas de un departamento de policía. Claude escribió un aviso inventado sobre haber visto a una persona cerca de una calle relacionada con un homicidio. Dejó vacíos los datos de contacto y el sistema marcó el envío como spam, por lo que nunca se remitió para investigación.
No fue un ataque dirigido
Anthropic describe estos episodios como casos de persistencia: cuando el modelo no puede completar una tarea, busca una forma alternativa en lugar de detenerse. En algunos ejemplos, la tarea era ambigua o prácticamente imposible con las herramientas disponibles.
La empresa también menciona el reward hacking, una práctica en la que un modelo aprende a obtener la recompensa usando un atajo que los desarrolladores no pretendían premiar. Si durante el entrenamiento rodear una restricción funciona, el modelo puede aprender que insistir o buscar una puerta trasera es una estrategia válida.
Según Anthropic, los casos analizados hasta ahora tuvieron un impacto real mínimo. No se detectó afectación de datos de clientes ni de sistemas internos de Anthropic. La compañía considera que son menos graves que los incidentes de ciberseguridad que comunicó en julio y septiembre, en los que Claude tuvo acceso durante horas a sistemas externos dentro de evaluaciones de seguridad.
Qué cambia en las pruebas
Anthropic ya había desactivado el acceso a internet en algunas evaluaciones de alto riesgo. Ahora lo ha extendido a todas sus evaluaciones internas hasta confirmar que sus sistemas de seguridad y supervisión detectan de forma fiable este tipo de acciones.
Además, la empresa ha tomado varias medidas:
- Ha retirado algunas evaluaciones públicas o las ha trasladado a versiones sin conexión.
- Ha limitado con más rigor lo que Claude puede hacer mediante herramientas de acceso web.
- Ha creado sistemas automáticos para detectar y bloquear estas conductas.
- Ha reducido el acceso a internet de agentes internos y procesos de entrenamiento.
- Ha centralizado la infraestructura y aumentado la supervisión de las acciones de los agentes.
Anthropic probó sus nuevas herramientas con los casos descritos y afirma que bloquearon todos ellos. También está modificando entornos de entrenamiento que podían incentivar que Claude rodeara restricciones.
Para ti, la consecuencia más importante es sencilla: un agente de IA con acceso a internet no solo puede leer información. También puede intentar actuar sobre sitios, servidores y formularios, incluso cuando esa acción no estaba prevista. Por eso las instrucciones claras son importantes, pero no bastan: hacen falta límites técnicos, supervisión y capacidad para detener al modelo.
Anthropic seguirá revisando transcripciones de evaluaciones, usos internos y entornos de aprendizaje por refuerzo, y promete publicar nuevos casos. El punto que conviene vigilar es si estos modelos aprenden a reconocer mejor cuándo deben parar, en vez de limitarse a encontrar otra ruta para cumplir una orden.

