GPT-5.6 reduce el coste de los agentes de IA
OpenAI presenta GPT-5.6 como una familia de modelos que mantiene o mejora el rendimiento de agentes de IA con un coste menor. La estrategia combina modelos más pequeños, razonamiento ajustable, memoria persistente, trabajo en paralelo y procesamiento de datos mediante código.

OpenAI presenta GPT-5.6 como una familia de modelos capaz de ejecutar tareas largas y usar herramientas con un coste mucho menor. La clave no está solo en el modelo: también está en cómo conserva el trabajo previo, reparte tareas y procesa datos fuera de la ventana de contexto.
La compañía explica en una guía basada en pruebas con startups que GPT-5.6 puede mantener un rendimiento similar o superior al de modelos anteriores usando menos tokens, es decir, menos unidades de texto procesadas. Para quien construye productos con IA, eso puede traducirse en agentes más baratos de operar sin tener que rehacer toda su arquitectura.
Más rendimiento con menos razonamiento
Una de las mejoras está en elegir mejor cuánto razonamiento necesita cada tarea. En el benchmark Agents’ Last Exam, GPT-5.6 Sol con un nivel de razonamiento bajo superó a GPT-5.5 con un nivel alto, manteniendo el mismo sistema de herramientas y reglas.
La diferencia de coste aparece con más claridad en BrowseComp, una prueba que mide la capacidad de encontrar información poco común mediante búsquedas. Según OpenAI:
GPT-5.5con razonamiento Extra High logró un 84,36% y costó 33,27 dólares.GPT-5.6 Lunacon el mismo nivel obtuvo un 84,04% y costó 1,33 dólares.
La comparación corresponde a los precios y resultados indicados por OpenAI en el momento del lanzamiento. La empresa también señala que después redujo aún más los precios.
Los modelos más pequeños de la familia, como Luna y Terra, están pensados para tareas frecuentes o sensibles a la latencia. Por ejemplo, una empresa legal podría usar uno de ellos para extraer información de memos manuscritos y reservar un modelo más potente para el análisis complejo posterior.
Tres cambios para construir agentes más eficientes
OpenAI también añade nuevas funciones a la Responses API, la interfaz que permite crear aplicaciones capaces de razonar y utilizar herramientas.
Primero, el agente puede conservar su razonamiento. La memoria del trabajo realizado entre turnos y la compactación nativa, que resume conversaciones largas, evitan que el modelo tenga que reconstruir todo desde cero. Esto ayuda en tareas que duran mucho tiempo.
Segundo, puede dividir el trabajo entre varios agentes. Un agente principal coordina a otros que trabajan en paralelo y después combina sus resultados. Una búsqueda compleja, por ejemplo, puede separarse por fuentes, periodos o tipos de documento en lugar de ejecutarse en una sola cadena de pasos.
Tercero, los datos repetitivos pasan al código. Con la llamada programática a herramientas, el modelo puede escribir JavaScript para filtrar, ordenar y combinar resultados fuera de su contexto. Así, si necesita revisar 100 documentos y quedarse solo con los de una fecha concreta, no tiene que analizar cada resultado intermedio como si fuera una decisión nueva.
El modelo se reserva para lo que sí requiere criterio: interpretar la información, detectar relaciones y decidir qué hacer después.
Un ejemplo del impacto
En ARC-AGI-3, GPT-5.6 Sol obtuvo un 13,3% con el sistema estándar. Al activar el razonamiento persistente y la compactación, la puntuación subió al 38,3% y se usaron aproximadamente seis veces menos tokens de salida.
No se cambió el modelo. Se cambió la forma de organizar el trabajo. El resultado muestra que el rendimiento de un agente depende tanto de su arquitectura como del modelo que utiliza.
OpenAI también amplió a un mínimo de 30 minutos la duración de la caché de instrucciones en toda la familia. La caché guarda partes repetidas de una solicitud para no procesarlas de nuevo, lo que puede reducir el tiempo de respuesta y el coste en aplicaciones que repiten el mismo contexto.
Para ti, el cambio más importante es práctico: ya no siempre necesitas usar el modelo más potente en cada paso. Una aplicación puede combinar modelos pequeños para extracción y tareas repetitivas, ajustar el nivel de razonamiento y reservar los modelos grandes para las decisiones difíciles.
La siguiente cuestión será comprobar cuánto de estas mejoras se mantiene fuera de los benchmarks y en productos reales. Si los resultados de las startups se repiten, construir agentes de IA dejará de consistir en pagar por un modelo potente en cada llamada y pasará a depender mucho más de diseñar bien el flujo de trabajo.