OpenAI presenta GPT-5.3-Codex, agente de código
OpenAI presenta `GPT-5.3-Codex`, un agente que combina programación, razonamiento y uso de ordenadores para completar tareas de principio a fin. Está disponible para planes de pago y llega con un 25% más de velocidad, mejores resultados en varias pruebas y controles reforzados para ciberseguridad.

OpenAI presenta GPT-5.3-Codex, un agente que no solo escribe y revisa código: también puede investigar, usar herramientas, operar un ordenador y completar tareas complejas de principio a fin. La compañía afirma que es su modelo de programación con capacidades agénticas más avanzado hasta ahora y que funciona un 25% más rápido que antes.
La diferencia está en cómo trabaja. Puedes darle una tarea larga, como crear una aplicación, analizar datos o preparar una presentación, y seguir hablando con él mientras avanza. El agente comparte decisiones y progreso, recibe correcciones y mantiene el contexto sin obligarte a empezar de nuevo.
De escribir código a completar trabajos
GPT-5.3-Codex combina las mejoras de programación de GPT-5.2-Codex con las capacidades de razonamiento y conocimiento profesional de GPT-5.2. Según OpenAI, esto permite usarlo en más partes del trabajo diario de un equipo:
- Depurar y desplegar software.
- Crear pruebas, métricas y documentación.
- Redactar requisitos de producto y editar textos.
- Investigar usuarios y analizar datos.
- Preparar presentaciones y hojas de cálculo.
- Usar aplicaciones desde un entorno visual de escritorio.
La idea es que no tengas que convertir cada tarea en una petición técnica. Si le pides una página web sencilla, por ejemplo, ahora tiende a tomar más decisiones por su cuenta: puede mostrar el precio anual como una tarifa mensual rebajada o añadir un carrusel de testimonios con varias opiniones, en vez de entregar una maqueta básica que tengas que completar manualmente.
OpenAI también probó el modelo con juegos web. En uno de los experimentos, GPT-5.3-Codex creó y mejoró juegos durante días, aplicando instrucciones como “corrige el error” o “mejora el juego”. El agente realizó iteraciones autónomas usando millones de tokens, una unidad que sirve para medir la cantidad de texto que procesa un modelo.
Mejores resultados en pruebas de agentes
La compañía asegura que el modelo alcanza nuevos máximos en varias evaluaciones de programación y uso de ordenadores. Sus resultados publicados incluyen:
- 56,8% en SWE-Bench Pro, una prueba de ingeniería de software real que cubre cuatro lenguajes y busca evitar que los modelos memoricen las respuestas.
- 77,3% en Terminal-Bench 2.0, que mide la capacidad para trabajar desde una terminal.
- 64,7% en OSWorld-Verified, una prueba en la que el agente debe completar tareas dentro de un escritorio visual.
- 70,9% de victorias o empates en GDPval, una evaluación de tareas profesionales en 44 ocupaciones.
En Terminal-Bench 2.0, la mejora frente a GPT-5.2-Codex es especialmente amplia: pasa del 64% al 77,3%. OpenAI añade que consigue estos resultados usando menos tokens que sus modelos anteriores, aunque las cifras proceden de evaluaciones controladas y no garantizan el mismo rendimiento en cada proyecto.
Un modelo que ayudó a construirse
OpenAI afirma que las primeras versiones de GPT-5.3-Codex participaron en su propio desarrollo. El equipo las utilizó para detectar errores en el entrenamiento, analizar resultados, mejorar el despliegue y encontrar problemas en las evaluaciones.
Durante las pruebas, el modelo también ayudó a identificar fallos de renderizado, investigar una baja tasa de reutilización de datos y crear herramientas para analizar miles de registros. En un caso, generó clasificadores sencillos para medir cuántas preguntas de aclaración hacía, cuánto avanzaba por turno y cómo respondían los usuarios.
Esto no significa que el modelo se haya diseñado sin intervención humana. Significa que OpenAI lo usó como una herramienta activa dentro del proceso de investigación y desarrollo, algo que puede acelerar la creación de versiones posteriores.
Más capacidad también implica más controles
La ciberseguridad es uno de los puntos más delicados. OpenAI clasifica GPT-5.3-Codex como su primer modelo con capacidad Alta para tareas relacionadas con ciberseguridad y afirma que lo entrenó directamente para identificar vulnerabilidades.
La empresa dice que todavía no tiene pruebas definitivas de que pueda automatizar ataques completos, pero ha aplicado controles adicionales por el carácter de doble uso de estas herramientas. Entre ellos incluye supervisión automática, acceso restringido a capacidades avanzadas, entrenamiento de seguridad y sistemas de respuesta ante amenazas.
Además, OpenAI anuncia 10 millones de dólares en créditos de API para investigación defensiva, especialmente en proyectos de código abierto e infraestructuras críticas. También amplía la beta privada de Aardvark, su agente para investigación de seguridad, y ofrece apoyo para analizar proyectos ampliamente utilizados como Next.js.
Disponibilidad
GPT-5.3-Codex ya está disponible para los planes de pago de ChatGPT en la aplicación, la línea de comandos, las extensiones de IDE y la web. OpenAI trabaja para habilitar el acceso mediante API más adelante.
Para ti, el cambio principal no es que el modelo escriba código más rápido, sino que puede hacerse cargo de una cadena completa de trabajo: entender un objetivo, investigar, construir, probar, corregir y explicar lo que hizo. Lo importante ahora será comprobar cuánto de esa autonomía se mantiene en proyectos reales, donde los requisitos cambian, los errores tienen consecuencias y la supervisión humana sigue siendo necesaria.