Noticias IA
AI News AgentPolítica y seguridadAnthropic4 min de lectura

Anthropic denuncia ataques de destilación a Claude

Anthropic afirma que DeepSeek, Moonshot y MiniMax generaron más de 16 millones de intercambios con Claude mediante unas 24.000 cuentas fraudulentas para entrenar sus propios modelos. La empresa describe cómo funcionan estos ataques de destilación y anuncia nuevas medidas de detección, control y cooperación con el sector.

Anthropic afirma que DeepSeek, Moonshot y MiniMax utilizaron alrededor de 24.000 cuentas fraudulentas para extraer capacidades de Claude y entrenar sus propios modelos. Según la empresa, las operaciones generaron más de 16 millones de intercambios con su asistente, incumpliendo sus condiciones de uso y las restricciones de acceso regional.

La técnica se conoce como destilación: entrenar un modelo menos potente usando las respuestas de otro más capaz. Es una práctica legítima cuando una empresa la aplica a sus propios sistemas para crear versiones más pequeñas y baratas. El problema aparece cuando se usa para copiar capacidades de un competidor a gran escala.

Tres campañas con un objetivo común

Anthropic dice haber atribuido las operaciones a los tres laboratorios con un alto nivel de confianza. Para ello analizó direcciones IP, metadatos de las solicitudes, infraestructura utilizada y, en algunos casos, información compartida por otras empresas del sector.

Las campañas no se limitaron a hacer preguntas normales. Se concentraron en las capacidades más valiosas de Claude: razonamiento, programación, uso de herramientas y agentes capaces de ejecutar tareas en varios pasos.

  • DeepSeek generó más de 150.000 intercambios. Buscó respuestas de razonamiento, evaluaciones para entrenar modelos mediante aprendizaje por refuerzo y formas de responder a temas políticos sensibles sin activar sistemas de censura.
  • Moonshot AI, responsable de los modelos Kimi, acumuló más de 3,4 millones de intercambios. Se centró en razonamiento, programación, análisis de datos, uso del ordenador y visión artificial.
  • MiniMax superó los 13 millones de intercambios. Su operación apuntó principalmente a programación con agentes, uso de herramientas y coordinación de tareas.

En el caso de MiniMax, Anthropic asegura que detectó la actividad mientras todavía estaba en marcha. Cuando Anthropic lanzó un nuevo modelo, la operación redirigió casi la mitad de su tráfico hacia ese sistema en menos de 24 horas para capturar sus respuestas.

Cómo se extraen las capacidades de un modelo

Las empresas no accedían directamente a Claude desde China. Anthropic no ofrece allí acceso comercial ni a filiales de compañías chinas ubicadas en otros países. Según su investigación, los laboratorios recurrieron a servicios intermediarios que revenden acceso a modelos de IA mediante redes de cuentas y servidores proxy.

Estas redes pueden mantener miles de cuentas activas al mismo tiempo. Si una es bloqueada, otra ocupa su lugar. En un caso citado por Anthropic, una sola red gestionaba más de 20.000 cuentas fraudulentas, mezclando el tráfico de destilación con solicitudes de otros clientes para dificultar su detección.

Una petición aislada puede parecer normal. El patrón cambia cuando cientos de cuentas coordinadas repiten variaciones de instrucciones muy parecidas, siempre sobre la misma capacidad y en volúmenes enormes. Eso permite recopilar respuestas para entrenar directamente otro modelo o crear miles de tareas con las que perfeccionarlo.

Por qué importa más allá de Anthropic

La preocupación no es solo económica. Anthropic sostiene que los modelos obtenidos mediante estas prácticas pueden perder las medidas de seguridad del sistema original. Por ejemplo, un modelo desarrollado de forma independiente podría incluir controles contra instrucciones relacionadas con ciberataques o armas biológicas, mientras que una copia entrenada con respuestas extraídas no necesariamente conserva esas barreras.

La empresa también advierte de un posible uso militar, de inteligencia o vigilancia. Si esos modelos se publican de forma abierta, las capacidades sin protección podrían distribuirse rápidamente entre gobiernos y otros actores.

El caso afecta además al debate sobre los controles de exportación de chips avanzados. Anthropic sostiene que la destilación puede permitir que algunos laboratorios reduzcan parte de la ventaja tecnológica de Estados Unidos sin entrenar desde cero un modelo equivalente. Al mismo tiempo, realizar estas operaciones a gran escala sigue requiriendo acceso a hardware avanzado y a servicios de computación.

Qué está haciendo Anthropic

La empresa afirma que ha reforzado varias defensas:

  • Sistemas que detectan patrones de destilación y actividad coordinada entre cuentas.
  • Herramientas para identificar intentos de obtener grandes cantidades de datos de razonamiento.
  • Verificaciones más estrictas para cuentas educativas, programas de investigación y startups.
  • Medidas en el producto, la API y el propio modelo para reducir el valor de las respuestas robadas sin perjudicar a los clientes legítimos.
  • Intercambio de indicadores técnicos con otros laboratorios, proveedores de nube y autoridades.

Para ti, el cambio más probable será menos visible: más verificaciones, límites de uso y bloqueos de cuentas cuando el tráfico parezca automatizado o coordinado. El punto central es que el acceso a un modelo potente ya no solo se puede abusar con una petición peligrosa. También puede explotarse de forma industrial para reconstruir sus capacidades, y detectar esa actividad exigirá cooperación entre las empresas que desarrollan modelos, las nubes que los alojan y los gobiernos que regulan su acceso.