OpenAI frena el desarrollo de IA por riesgos cibernéticos
OpenAI ralentiza temporalmente el entrenamiento de sus modelos más avanzados tras detectar que `Astra` podría alcanzar capacidades cibernéticas críticas. La empresa refuerza el aislamiento, la monitorización y las pruebas de alineación antes de reanudar sus mayores entrenamientos.

OpenAI ralentiza temporalmente el entrenamiento de sus modelos más avanzados porque uno de los próximos sistemas, Astra, podría alcanzar un nivel crítico de capacidad en ciberseguridad. La empresa también ha endurecido sus controles después de un incidente relacionado con Hugging Face.
La decisión afecta al trabajo interno de OpenAI, no significa que sus productos actuales hayan dejado de funcionar. El objetivo es comprobar que los modelos pueden entrenarse y evaluarse sin obtener un acceso peligroso a herramientas, redes o sistemas internos.
Una pausa para reforzar los controles
OpenAI detuvo durante dos semanas el entrenamiento mediante aprendizaje por refuerzo, una técnica que ajusta el comportamiento de un modelo a partir de recompensas. La pausa afectó a sus modelos más recientes pensados para llegar a los usuarios.
Además, el mayor entrenamiento de frontera que la empresa tenía previsto sigue detenido. OpenAI está realizando pruebas más pequeñas para estudiar el comportamiento de los modelos, comprobar sus defensas y reunir más pruebas de que actúan de acuerdo con las instrucciones y bajo supervisión humana.
La empresa afirma que esta decisión llega tras dos señales de riesgo:
- El incidente de OpenAI con Hugging Face.
- Las primeras pruebas que indican que
Astrapodría superar el umbral de capacidad cibernética crítica de su marco de seguridad.
OpenAI determinó el 7 de agosto que Astra podría tener ese nivel de capacidad. Por eso, ahora aplica las medidas de seguridad más estrictas a sus entrenamientos y evaluaciones, además de a otros trabajos relacionados con ciberseguridad.
Tres barreras para modelos más capaces
La nueva estrategia se apoya en tres defensas que deben funcionar juntas:
- Monitorización: detecta comportamientos preocupantes y permite reaccionar.
- Alineación: intenta que el modelo siga las instrucciones y respete la supervisión humana.
- Seguridad: limita a qué puede acceder el sistema y qué acciones puede ejecutar.
El cambio más visible está en los entornos donde OpenAI entrena y prueba sus modelos. Las tareas que ejecutan código generado por la IA deben funcionar dentro de espacios aislados, conocidos como sandboxes. También se han reforzado las barreras entre esas tareas, internet y las redes internas de la empresa.
OpenAI ha reducido permisos permanentes, eliminado servicios compartidos que podían ser vulnerables y mejorado la recopilación de registros de seguridad. También está usando sus propios modelos para probar de forma automática esas barreras mediante ataques simulados.
Supervisión token a token
La monitorización ya no se limita a ciertas sesiones de programación o a los entrenamientos considerados de mayor riesgo. El nuevo sistema empieza con detectores que revisan la actividad interna del modelo en cada token muestreado, es decir, en cada unidad de texto que procesa o genera.
Cuando detectan algo sospechoso, el caso pasa a investigadores automáticos más sofisticados. Estos revisan las acciones realizadas con herramientas, el razonamiento disponible y la secuencia completa de actividad para buscar señales como:
- Intentos de acceso no autorizado.
- Robo de datos.
- Comportamiento destructivo.
- Esfuerzos por esquivar las medidas de seguridad.
OpenAI pretende generar una alerta en un plazo de 30 minutos desde que aparece una señal preocupante. Si el sistema cree que se ha violado una barrera crítica, avisa a los equipos de seguridad, investigación y protección. Si en otros 30 minutos no pueden demostrar que se trata de una falsa alarma, deben pausar la actividad.
Este sistema es obligatorio para los entrenamientos y evaluaciones con herramientas de modelos con capacidades de nivel Sol o superior. Desde la clasificación de Astra del 7 de agosto, también se exige para cualquier uso de Astra con herramientas, no solo para su entrenamiento.
El coste no es menor: OpenAI calcula que la monitorización consume alrededor del 20% de la capacidad de cómputo de inferencia supervisada, aunque el porcentaje cambia según la tarea.
Qué cambia para ti
No hay un cambio inmediato anunciado para quienes usan los productos de OpenAI. El efecto directo está dentro de la empresa: algunos entrenamientos se retrasarán y más cargas de trabajo tendrán que migrar a entornos con controles reforzados.
Lo importante es que la capacidad de un modelo para programar, usar herramientas o encontrar fallos de seguridad ya no se considera solo una ventaja. También puede convertirse en un riesgo durante el propio proceso de desarrollo, antes de que el modelo llegue al público.
OpenAI también está ampliando el trabajo de alineación. Eso incluye mejorar los sistemas que recompensan al modelo, entrenarlo para describir con honestidad sus acciones y reducir conductas como el reward hacking, que consiste en encontrar una forma de obtener una buena puntuación sin cumplir realmente el objetivo.
La empresa prepara una actualización de su Preparedness Framework para integrar estas medidas durante el entrenamiento y el despliegue. El siguiente punto a vigilar será si consigue mantener la velocidad de desarrollo mientras demuestra que sus modelos más capaces pueden permanecer controlables, observables y aislados cuando tienen acceso a código, herramientas o redes.