OpenAI presenta GPT-Red para hacer más robusta la IA
OpenAI presenta GPT-Red, un modelo diseñado para atacar sistemas de IA y descubrir vulnerabilidades antes de su despliegue. La empresa afirma que sus ataques ayudaron a hacer a GPT-5.6 Sol seis veces más resistente a las inyecciones de instrucciones, sin reducir sus capacidades normales.

OpenAI ha creado GPT-Red, un modelo que intenta atacar a otros sistemas de IA para descubrir sus puntos débiles antes de que lleguen a más usuarios. La empresa lo está usando para entrenar GPT-5.6 Sol contra uno de los problemas más difíciles de los agentes actuales: las inyecciones de instrucciones.
Una inyección de instrucciones ocurre cuando una orden maliciosa se cuela dentro de un correo, una página web, un archivo o la respuesta de una herramienta. El agente puede confundir esa orden con una instrucción legítima y, por ejemplo, intentar enviar datos privados a un servidor externo.
Un atacante automático que aprende de sus propios fracasos
Hasta ahora, buena parte de estas pruebas dependía de equipos humanos de seguridad. Son útiles, pero lentos y difíciles de ampliar. Cada nuevo modelo puede necesitar miles de ataques distintos para revelar comportamientos inesperados.
GPT-Red automatiza ese trabajo. Envía una instrucción, observa cómo responde el modelo objetivo y cambia de estrategia si el ataque falla. Su entrenamiento utiliza aprendizaje por refuerzo mediante competición: GPT-Red recibe una recompensa cuando consigue provocar un fallo, mientras varios modelos defensores reciben otra cuando resisten y completan su tarea original.
A medida que los defensores mejoran, el atacante tiene que encontrar métodos más complejos. OpenAI entrenó GPT-Red con una cantidad de computación comparable a algunas de sus mayores fases de ajuste posteriores al entrenamiento, dedicada específicamente a seguridad.
Qué resultados ha conseguido
La empresa asegura que GPT-Red puede romper casi todos los modelos con los que fue enfrentado, incluidos modelos internos y de producción hasta GPT-5.5. Después utilizó los ataques generados por GPT-Red para entrenar GPT-5.6 Sol.
Según OpenAI, el nuevo modelo registra seis veces menos fallos en su prueba más difícil de inyección directa que el mejor modelo de producción de la compañía de cuatro meses antes. En un conjunto amplio de pruebas, GPT-5.6 Sol solo cedió ante el 0,05% de las inyecciones directas de GPT-Red.
El modelo también fue probado en escenarios que no había visto durante su entrenamiento:
- Encontró ataques con éxito en el 84% de los escenarios de una prueba independiente, frente al 13% conseguido por equipos humanos.
- Manipuló un agente que gestionaba una máquina expendedora para bajar a 0,50 dólares el precio de un producto caro, vender por ese importe otro artículo de más de 100 dólares y cancelar el pedido de otro cliente.
- Logró provocar la extracción de datos sensibles en más escenarios que un modelo
GPT-5.5usado como referencia al atacar un agente de línea de comandos basado enGPT-5.4 mini.
Las vulnerabilidades de la máquina expendedora fueron comunicadas y las nuevas defensas todavía se están probando. El caso funciona como una demostración controlada de lo que puede ocurrir cuando un agente tiene acceso a herramientas y capacidad para ejecutar acciones.
El reto: mejorar la seguridad sin volver inútil al modelo
Un sistema puede parecer más seguro simplemente rechazando casi todo. Eso reduciría algunos ataques, pero también impediría que el agente hiciera tareas legítimas.
OpenAI afirma que comprobó las capacidades generales y pruebas específicas de rechazo excesivo de GPT-5.6 Sol. Según sus resultados, las capacidades normales se mantuvieron mientras aumentaba la resistencia a las instrucciones maliciosas. La mejora vendría de distinguir mejor entre una orden válida y una manipuladora, no de bloquear más solicitudes por defecto.
GPT-Red no se desplegará como producto. OpenAI lo mantiene separado de sus modelos públicos para no entregar a posibles atacantes las capacidades ofensivas que recibió durante el entrenamiento.
El enfoque ya se ha aplicado a versiones sucesivas desde GPT-5.3. Un ataque llamado “Fake Chain-of-Thought”, que superaba el 95% de éxito contra GPT-5.1, ahora baja del 10% frente a GPT-5.6 Sol, según la empresa.
La idea central es crear un ciclo de mejora: un modelo busca fallos, otro aprende a resistirlos y el siguiente modelo parte de una defensa más exigente. OpenAI prevé ampliar ese proceso con más datos y computación, aunque seguirá combinándolo con evaluadores humanos, pruebas externas y vigilancia en tiempo real. El punto decisivo será comprobar si esa resistencia también se mantiene en aplicaciones nuevas, donde los ataques todavía no están definidos.