Claude Opus 4.5 mejora ante ataques de prompt injection
Anthropic afirma que Claude Opus 4.5 mejora su resistencia a los ataques de prompt injection, con una tasa de éxito del ataque del 1% en una prueba interna. La extensión Claude for Chrome pasa a beta para usuarios del plan Max, aunque la compañía advierte que el riesgo no ha desaparecido.

Anthropic asegura que Claude Opus 4.5 reduce de forma importante el riesgo de prompt injection, un ataque que introduce instrucciones maliciosas dentro de páginas web, correos o documentos para desviar el comportamiento de una IA. El problema no está resuelto, pero la compañía afirma que el nuevo modelo alcanza una tasa de éxito del ataque del 1% en una de sus pruebas internas.
Cómo puede engañarse a un agente de navegador
Un agente de IA no solo responde preguntas. También puede abrir páginas, leer correos, rellenar formularios, pulsar botones o descargar archivos. Para hacerlo, tiene que procesar contenido que no controla, y ahí aparece el riesgo.
Imagina que le pides revisar tus correos y preparar respuestas para las invitaciones a reuniones. Uno de esos mensajes parece una consulta normal de un proveedor, pero contiene instrucciones ocultas en texto blanco. El agente podría interpretarlas como órdenes y reenviar mensajes que incluyan la palabra “confidencial” a una dirección externa.
Tú no verías necesariamente el ataque. La IA sí podría procesarlo.
El navegador amplía el problema porque cada elemento externo puede convertirse en una vía de entrada:
- Páginas web y documentos incrustados.
- Anuncios y elementos cargados de forma dinámica.
- Botones, formularios e interfaces manipuladas.
- Imágenes con instrucciones ocultas o engañosas.
Si el agente cae en la trampa, el atacante no solo puede influir en lo que responde. También puede intentar que realice acciones con consecuencias reales.
Qué ha cambiado en Claude
Anthropic compara la versión actual de su extensión de navegador con la configuración original de Claude for Chrome, lanzada como vista previa de investigación. Para la evaluación utilizó un atacante adaptativo interno, llamado “Best-of-N”, que combina distintas técnicas conocidas de prompt injection para encontrar una forma de superar las defensas.
La empresa atribuye la mejora a tres líneas de trabajo:
- Entrenamiento específico: durante el aprendizaje por refuerzo, Claude recibe contenido web simulado con instrucciones maliciosas y es recompensado cuando las identifica y rechaza.
- Clasificadores más precisos: sistemas que revisan el contenido no confiable antes de que llegue al contexto del modelo y detectan órdenes ocultas, imágenes manipuladas o elementos engañosos de una interfaz.
- Pruebas de seguridad continuas: equipos humanos buscan nuevas formas de atacar el agente, tanto dentro de Anthropic como en desafíos externos.
Estas defensas no dependen únicamente de Claude Opus 4.5. Anthropic también afirma haber mejorado los controles que acompañan a todos sus modelos en la extensión.
Qué significa para ti
La mejora permite que Claude for Chrome pase de una vista previa de investigación a una beta disponible para todos los usuarios del plan Max. En la práctica, significa que puedes delegar más tareas de navegación con menos riesgo que antes, pero no con riesgo cero.
Una tasa de éxito del ataque del 1% sigue siendo relevante si el agente tiene acceso a correos, cuentas, documentos privados o sistemas de trabajo. Por eso conviene revisar sus acciones, limitar los permisos y evitar que opere sin supervisión en tareas sensibles.
El punto importante es que un agente de navegador no trata toda la web como información neutral. Cada página puede contener instrucciones dirigidas a la IA, aunque parezca diseñada para una persona. Anthropic seguirá midiendo y publicando avances, porque mientras estos sistemas tengan capacidad para actuar, la seguridad dependerá tanto del modelo como de los controles que lo rodean.