OpenAI presenta GPT-5.6 para una IA más eficiente
OpenAI presenta la familia GPT-5.6 con tres modelos pensados para distintos niveles de capacidad y coste. La compañía asegura que Sol supera a Claude Fable 5 en una prueba de programación por menos de la mitad del precio, mientras Terra y Luna reducen aún más el coste mediante mejoras en el modelo, la infraestructura y los agentes.

OpenAI presenta la familia GPT-5.6 con una promesa concreta: ofrecer capacidades de frontera con menos coste, tanto al entrenar los modelos como al ejecutar cada respuesta. La compañía asegura que su modelo principal, GPT-5.6 Sol, supera a Claude Fable 5 en el Artificial Analysis Coding Agent Index usando el modo de razonamiento máximo y a menos de la mitad del coste.
La familia incluye tres modelos con objetivos distintos:
- Sol: el modelo más capaz, pensado para tareas complejas de razonamiento y programación.
- Terra: ofrece un rendimiento similar al de GPT-5.5 en las pruebas de inteligencia, pero a la mitad del precio.
- Luna: es el modelo más rápido y asequible, con un coste 80% menor que Sol.
La idea no es solo tener un modelo mejor. Es que puedas usarlo más veces sin que cada consulta resulte tan cara.
Más trabajo con menos tokens
OpenAI dice que GPT-5.6 ha sido entrenado para hacer más trabajo con cada token, la unidad básica con la que los modelos procesan y generan texto. En la práctica, esto significa que intenta seguir rutas más directas para completar una tarea, en lugar de gastar capacidad en pasos innecesarios.
Esta optimización afecta especialmente a tareas largas. Un agente de programación puede tener que leer archivos, revisar incidencias, modificar código y ejecutar pruebas. Si necesita menos pasos para llegar al resultado, se reducen el tiempo y los recursos empleados.
Según OpenAI, la familia GPT-5.6 alcanza su mayor eficiencia de inteligencia por token hasta la fecha. La compañía también afirma que ya presta servicio a 1.000 millones de usuarios activos y más de 2 millones de empresas, cifras que utiliza para explicar por qué reducir el coste de cada respuesta se ha vuelto una prioridad.
El modelo no es toda la historia
Una parte importante de las mejoras llega de la infraestructura que ejecuta los modelos. OpenAI optimizó cómo distribuye las peticiones entre servidores, cómo organiza los cálculos en los chips y qué información reutiliza en lugar de procesarla otra vez.
GPT-5.6 Sol, funcionando dentro de Codex, el entorno de OpenAI para trabajar con código, ayudó a analizar el tráfico real y a encontrar desequilibrios en la carga de los servidores. También escribió y mejoró código para las GPU, los chips especializados que ejecutan gran parte de estos cálculos.
OpenAI asegura que estas mejoras redujeron un 20% el coste total de servir el modelo. En otra optimización, llamada decodificación especulativa, un modelo pequeño propone varias palabras o fragmentos y el modelo principal los comprueba de una vez. El resultado, según la compañía, fue una mejora de más del 15% en la eficiencia de generación de tokens.
Sol también diseñó experimentos para mejorar ese modelo auxiliar y supervisó parte de su entrenamiento, interviniendo cuando aparecieron fallos de hardware o problemas de estabilidad. OpenAI señala que utilizó herramientas de verificación para comprobar que el código generado automáticamente funcionaba correctamente.
Menos contexto desperdiciado en los agentes
Los agentes como Codex y ChatGPT Work no responden con una sola llamada al modelo. Para resolver una tarea pueden hacer decenas de solicitudes y utilizar herramientas externas. Cada paso añade instrucciones, resultados anteriores y datos del entorno.
OpenAI desarrolló una capa de orquestación escrita en Rust, un lenguaje de programación, para controlar ese proceso. La compañía la llama agentic harness, o armazón de agentes. Su función es coordinar el modelo, las herramientas y el entorno de trabajo.
Entre sus cambios están:
- Mostrar herramientas, plugins e integraciones solo cuando hacen falta.
- Limitar por defecto las respuestas de las herramientas a 10.000 tokens.
- Reutilizar instrucciones y resultados que ya fueron procesados.
- Mantener el historial en un orden estable para aprovechar la caché, que evita repetir cálculos.
Esto importa porque un segundo extra en cada solicitud se acumula rápidamente. En una tarea con 30 llamadas al modelo, esos pequeños retrasos pueden convertirse en medio minuto adicional, además de aumentar el coste.
Para ti, el cambio más visible debería ser una combinación de menor precio, más velocidad y mayor disponibilidad, especialmente en tareas largas o con muchas herramientas. Pero las cifras proceden de las pruebas y mediciones internas comunicadas por OpenAI, así que habrá que comprobar cómo se comportan los modelos en el uso diario y frente a otras alternativas.
La dirección que marca GPT-5.6 es clara: el avance de la IA ya no depende solo de hacer modelos más inteligentes. También depende de ejecutarlos mejor, desperdiciar menos cómputo y convertir cada mejora pequeña en un sistema más barato y capaz.