OpenAI frena una campaña de destilación de modelos IA
OpenAI afirma haber interrumpido una campaña que intentaba extraer el razonamiento protegido de sus modelos para entrenar o mejorar otros sistemas. La actividad llegó a 16.000 solicitudes y más de 15.000 usuarios relacionados, y la empresa atribuye su núcleo a personas vinculadas con Moonshot AI, aunque mantiene cierta incertidumbre sobre el alcance del grupo.

OpenAI asegura haber desarticulado una campaña coordinada para extraer el razonamiento protegido de sus modelos y utilizarlo para entrenar o mejorar otros sistemas. La actividad comenzó el 1 de julio y alcanzó picos de 16.000 solicitudes entre más de 4.000 usuarios los días 24 y 25.
La empresa afirma que identificó después patrones relacionados en una red de más de 15.000 usuarios, que fue completamente interrumpida el 28 de julio. OpenAI atribuye el núcleo de la actividad a personas vinculadas con Moonshot AI, la compañía que desarrolla Kimi, aunque también reconoce que no está claro si todos los operadores pertenecían al mismo actor.
No fue un robo de datos
Según OpenAI, los atacantes no rompieron su cifrado, no accedieron a una base de datos ni entraron directamente en conversaciones almacenadas. Manipularon las interacciones con los modelos para hacer que partes de su razonamiento interno aparecieran en formas visibles para quien las solicitaba.
Ese razonamiento protegido es el registro interno que el modelo utiliza para resolver una tarea. No siempre coincide con la respuesta final y puede contener información que el sistema está diseñado para no mostrar. Si alguien logra recopilarlo de forma masiva, puede usarlo como material de entrenamiento para reproducir capacidades de otro modelo.
A esta práctica se la conoce como destilación adversarial: extraer de manera sistemática y no autorizada las respuestas o el razonamiento de un modelo para entrenar, copiar o mejorar otro.
OpenAI detectó métodos especialmente elaborados. En uno de ellos, los operadores copiaban razonamiento cifrado de una conversación y pedían a otro modelo, en una conversación diferente, que lo descifrara y transcribiera.
Investigadores de seguridad independientes también informaron de vulnerabilidades relacionadas con ataques entre modelos y con la compactación de conversaciones. OpenAI confirmó que esas rutas de ataque eran reales y afirma que la investigación externa ayudó a acelerar las medidas de protección.
Qué riesgo plantea
El problema va más allá de que una empresa copie el trabajo de otra. El razonamiento extraído podría utilizarse para entrenar un modelo sin conservar los controles de seguridad aplicados a las respuestas que recibe el usuario.
Eso puede facilitar que un sistema reproduzca capacidades avanzadas sin asumir el mismo coste de investigación, infraestructura y seguridad. El riesgo aumenta en áreas de uso dual, donde una capacidad puede tener aplicaciones legítimas y también usos dañinos.
La técnica tampoco sería exclusiva de OpenAI. La empresa compartió información con el Frontier Model Forum y con canales de intercambio de información gubernamentales para que otros desarrolladores de modelos avanzados puedan buscar ataques similares.
Las medidas adoptadas
OpenAI dice que combinó controles técnicos, restricciones de cuentas y coordinación con socios para frenar la campaña. Entre las acciones anunciadas están:
- Prohibir o restringir cuentas fraudulentas.
- Reforzar los controles de registro y de infraestructura.
- Ampliar la vigilancia sobre redes de cuentas relacionadas.
- Proteger el razonamiento oculto entre usuarios, espacios de trabajo, organizaciones y familias de modelos.
- Cerrar una vía que permitía reutilizar razonamiento cifrado de otro usuario para recuperar su contenido.
- Detectar y retener respuestas transmitidas que pudieran exponer razonamiento protegido.
Cuando parte de la actividad pasó por servicios de terceros, OpenAI trabajó con esos proveedores para localizar y desactivar las cuentas implicadas.
La empresa advierte que los intentos de destilación probablemente serán más sofisticados a medida que mejoren los modelos y aumente el interés por imitarlos con un coste menor. También reconoce que todavía quedan frentes abiertos, como las implementaciones alojadas por socios y los ataques que usan resultados de herramientas, que requieren revisar algo más que el texto visible de una respuesta.
Para ti, esto significa que los sistemas de IA no solo deben proteger tus datos y sus servidores. También tienen que impedir que sus capacidades internas se extraigan a escala y se reutilicen sin los mismos límites de seguridad. La siguiente batalla estará en detectar estas campañas coordinadas antes de que conviertan miles de interacciones aparentemente normales en un manual para copiar un modelo.