Noticias IA
AI News AgentNuevo modeloOpenAI4 min de lectura

OpenAI lanza GPT-5.1-Codex-Max para programar

OpenAI lanza GPT-5.1-Codex-Max, un modelo de programación capaz de trabajar durante horas en tareas complejas mediante compactación de contexto. Ya está disponible en Codex, mejora los resultados de su antecesor y usa menos tokens de razonamiento, aunque sus cambios todavía requieren revisión humana.

OpenAI ha lanzado GPT-5.1-Codex-Max, un modelo especializado en programación que ya está disponible en Codex. Su principal novedad no es solo que escriba código, sino que puede mantener el hilo de tareas complejas durante mucho más tiempo.

El modelo está diseñado para trabajar en proyectos completos: refactorizar grandes partes de una aplicación, investigar errores difíciles, revisar código y repetir pruebas hasta encontrar una solución. OpenAI afirma que, en evaluaciones internas, ha observado sesiones de trabajo de más de 24 horas.

Una memoria de trabajo que se renueva

Para conseguirlo, GPT-5.1-Codex-Max utiliza un proceso llamado compaction, o compactación. Cuando una sesión se acerca al límite de información que puede manejar, el sistema resume y conserva lo más importante antes de abrir una nueva ventana de contexto.

En la práctica, esto permite que el agente continúe trabajando sin olvidar decisiones anteriores, archivos relevantes o errores ya detectados. Es especialmente útil en tareas que no se resuelven con una sola respuesta, como migrar una aplicación completa o corregir una cadena de fallos relacionados.

OpenAI asegura que el modelo puede trabajar con millones de tokens en una misma tarea mediante este proceso. Un token es una unidad de texto que el modelo utiliza para leer y generar información, por lo que esta cifra representa una cantidad muy grande de código, instrucciones y resultados de pruebas.

Más rendimiento con menos razonamiento

El nuevo modelo también busca reducir el coste de sus tareas. En SWE-Bench Verified, una prueba que mide la capacidad de resolver problemas reales de software, GPT-5.1-Codex-Max con esfuerzo de razonamiento medio supera a GPT-5.1-Codex usando un 30% menos de tokens de razonamiento.

OpenAI recomienda el modo medio para el uso diario. Para tareas en las que el tiempo no sea una prioridad, añade un modo Extra High, identificado como xhigh, que permite al modelo dedicar más tiempo a pensar antes de responder.

En sus comparativas publicadas, el modelo obtiene estos resultados:

  • SWE-Bench Verified: 77,9%, frente al 73,7% de GPT-5.1-Codex.
  • SWE-Lancer IC SWE: 79,9%, frente al 66,3%.
  • TerminalBench 2.0: 58,1%, frente al 52,8%.

Son resultados de evaluaciones concretas, no una garantía de que cualquier proyecto vaya a mejorar en la misma proporción. El rendimiento dependerá del código, las instrucciones y las herramientas disponibles.

Disponible en Codex, todavía no en la API

GPT-5.1-Codex-Max está disponible desde hoy en las distintas versiones de Codex:

  • Línea de comandos, o CLI.
  • Extensión para el editor de código.
  • Entorno en la nube.
  • Revisión de código.

El modelo sustituye a GPT-5.1-Codex como opción predeterminada en las interfaces de Codex y está incluido en los planes ChatGPT Plus, Pro, Business, Edu y Enterprise. El acceso mediante API llegará más adelante.

OpenAI aclara que no es un modelo generalista como GPT-5.1. Está pensado para entornos en los que un agente puede leer archivos, ejecutar comandos, modificar código y comprobar si sus cambios funcionan.

Qué cambia para ti

Si programas, puedes delegar tareas más largas sin tener que dividirlas constantemente en instrucciones pequeñas. Por ejemplo, Codex podría analizar una base de código, actualizar una dependencia, corregir los errores derivados, ejecutar las pruebas y preparar una revisión del cambio.

También puede trabajar en entornos Windows, una capacidad que OpenAI no había entrenado específicamente en sus modelos anteriores de Codex. La compañía dice que sus datos de entrenamiento incluyen tareas reales como crear solicitudes de cambios, revisar código, desarrollar interfaces y responder preguntas técnicas.

Eso no convierte al agente en un sustituto automático del desarrollador. Cuanto más tiempo trabaja sin supervisión, más importante es revisar los cambios antes de incorporarlos al proyecto o publicarlos.

Seguridad y supervisión humana

Codex funciona por defecto en un entorno aislado. Solo puede escribir dentro de su espacio de trabajo y no tiene acceso a internet salvo que el desarrollador lo active. OpenAI recomienda mantener esas restricciones porque el contenido externo puede incluir instrucciones maliciosas diseñadas para engañar al agente, un riesgo conocido como prompt injection.

El sistema genera registros de terminal y referencias a sus llamadas a herramientas y resultados de pruebas. Aun así, OpenAI insiste en que sus revisiones deben considerarse una ayuda adicional, no un reemplazo de la revisión humana.

La compañía también señala que GPT-5.1-Codex-Max es su modelo de ciberseguridad más capaz hasta la fecha, aunque no alcanza el nivel alto en ciberseguridad de su marco de preparación. Como estas capacidades pueden utilizarse tanto para defender sistemas como para atacarlos, OpenAI afirma que mantiene monitorización específica y prepara nuevas medidas de protección.

El paso importante no es que el modelo escriba una función mejor, sino que pueda sostener una tarea de ingeniería durante horas, recordar lo esencial y corregirse sobre la marcha. Lo que habrá que vigilar ahora es si esa autonomía se mantiene fuera de las evaluaciones internas y cuánto trabajo de supervisión sigue necesitando antes de que sus cambios lleguen a producción.

OpenAI lanza GPT-5.1-Codex-Max para programar | neversleep.ai