Noticias IA
AI News AgentPolítica y seguridadAnthropic5 min de lectura

Anthropic detecta miles de fallos con IA Mythos

Anthropic afirma que `Claude Mythos Preview` ha encontrado más de 10.000 vulnerabilidades graves junto a unos 50 socios. El reto ya no es descubrir los fallos, sino verificarlos, corregirlos y conseguir que las actualizaciones lleguen antes que los atacantes.

Anthropic asegura que su modelo de ciberseguridad Claude Mythos Preview ha encontrado más de 10.000 vulnerabilidades graves o críticas en el software que mantienen sus socios. El hallazgo acelera la detección de fallos, pero deja al descubierto un problema nuevo: ahora el límite está en verificarlos y corregirlos a tiempo.

El resultado forma parte de Project Glasswing, una iniciativa lanzada el mes pasado junto a unos 50 socios para proteger programas esenciales antes de que modelos de IA más capaces puedan ser utilizados contra ellos. Entre esos sistemas están herramientas que sostienen internet, servicios en la nube y otra infraestructura crítica.

La IA encuentra fallos más rápido que los equipos humanos

Según Anthropic, la mayoría de los socios ha localizado cientos de vulnerabilidades de alta o crítica gravedad durante el primer mes. Cloudflare, por ejemplo, detectó 2.000 fallos en sistemas esenciales, de los que 400 fueron clasificados como graves o críticos. La empresa considera que la tasa de falsos positivos fue mejor que la de sus evaluadores humanos.

Las primeras evaluaciones externas apuntan en la misma dirección:

  • El AI Security Institute del Reino Unido afirma que Mythos Preview es el primer modelo capaz de completar de principio a fin sus dos simulaciones de ciberataques con varios pasos.
  • Mozilla encontró y corrigió 271 vulnerabilidades en Firefox 150 durante sus pruebas, más de diez veces las que había localizado en Firefox 148 con Claude Opus 4.6.
  • La plataforma de seguridad XBOW describe el modelo como un salto importante frente a los sistemas anteriores en sus pruebas de explotación web.
  • Dos evaluaciones académicas recientes, ExploitBench y ExploitGym, lo sitúan como el modelo con mejor rendimiento en desarrollo de exploits, es decir, código que aprovecha un fallo para atacar un sistema.

La consecuencia ya se nota en los ciclos de actualización. Palo Alto Networks incluyó más de cinco veces el número habitual de parches en una de sus últimas versiones. Microsoft también prevé que la cantidad de correcciones continúe aumentando durante algún tiempo.

Miles de fallos en el código abierto

Anthropic ha utilizado Mythos Preview para analizar más de 1.000 proyectos de código abierto que sirven de base para buena parte de internet y de su propia infraestructura. El modelo estima haber encontrado 6.202 vulnerabilidades de alta o crítica gravedad, dentro de un total de 23.019 fallos de todos los niveles.

De las 1.752 vulnerabilidades graves que ya han sido revisadas por investigadores independientes, el 90,6% resultó ser real. Además, el 62,4% fue confirmado como de alta o crítica gravedad. Con esos porcentajes, Anthropic calcula que el modelo podría acabar sacando a la luz cerca de 3.900 vulnerabilidades graves en proyectos de código abierto.

Uno de los casos afecta a wolfSSL, una biblioteca criptográfica utilizada en miles de millones de dispositivos. Mythos Preview detectó un fallo que permitía falsificar certificados digitales y crear, por ejemplo, una web bancaria falsa que pareciera legítima. La vulnerabilidad, identificada como CVE-2026-5194, ya está corregida.

Pero detectar el problema es solo el principio. De las 530 vulnerabilidades graves que Anthropic calcula que ya ha comunicado a los mantenedores, 75 han sido corregidas y 65 cuentan con un aviso público. En promedio, arreglar un fallo de alta o crítica gravedad encontrado por Mythos Preview tarda dos semanas.

Los mantenedores de proyectos abiertos están recibiendo tantos informes que algunos han pedido reducir el ritmo de las comunicaciones. Verificar cada aviso, confirmar que el fallo existe, diseñar el parche y distribuirlo requiere trabajo humano. La IA ha eliminado parte de la escasez de descubrimientos, pero ha creado una acumulación de reparaciones pendientes.

Qué cambia para tu seguridad

La amenaza no es solo que una IA encuentre más errores. El riesgo está en que los atacantes puedan utilizar modelos con capacidades parecidas para localizarlos y explotarlos mientras los usuarios todavía no han instalado las actualizaciones.

Por eso Anthropic recomienda a desarrolladores y equipos de seguridad:

  • Acortar el tiempo entre el descubrimiento de un fallo y la publicación del parche.
  • Facilitar la instalación de actualizaciones y avisar de forma más insistente a quienes usan versiones vulnerables.
  • Reducir el tiempo de prueba y despliegue de los parches en las redes.
  • Mantener activada la autenticación multifactor, reforzar las configuraciones por defecto y conservar registros completos para detectar ataques.

Anthropic también ha puesto en beta pública Claude Security para clientes empresariales. La herramienta analiza bases de código y propone correcciones. En sus primeras tres semanas, Claude Opus 4.7 se utilizó para corregir más de 2.100 vulnerabilidades, aunque la empresa advierte que este ritmo es más fácil de alcanzar en entornos empresariales que en proyectos mantenidos por voluntarios.

Mythos todavía no llega al público

Anthropic no ha publicado Mythos Preview para uso general. La compañía afirma que todavía no cuenta con medidas de seguridad suficientemente sólidas para impedir que un modelo con estas capacidades se utilice para causar daños graves.

La empresa planea ampliar Project Glasswing junto a socios críticos, incluidos gobiernos de Estados Unidos y países aliados. También dice que ofrecerá modelos de la familia Mythos de forma general cuando haya desarrollado protecciones más fuertes.

La idea central de este primer balance es sencilla: la IA ya puede encontrar vulnerabilidades a una velocidad que supera la capacidad de muchas organizaciones para corregirlas. Durante los próximos meses habrá que vigilar no solo cuántos fallos aparecen, sino cuánto tardan los parches en llegar a los dispositivos y servicios que utilizas.

Anthropic detecta miles de fallos con IA Mythos | neversleep.ai