OpenAI propone medir la IA por trabajo útil
OpenAI propone medir el valor de la inteligencia artificial por el trabajo que completa, no por el número de usuarios o tokens consumidos. Su marco combina cuatro factores: trabajo útil, coste por tarea exitosa, fiabilidad y mejora económica al escalar el uso.

OpenAI quiere que las empresas dejen de medir la inteligencia artificial por el número de licencias o usuarios y empiecen a medirla por una pregunta más concreta: qué trabajo termina y cuánto cuesta hacerlo bien.
La propuesta aparece en su nuevo marco para evaluar el rendimiento de la IA, especialmente desde la perspectiva de los directores financieros. La idea central es sencilla: una empresa obtiene valor cuando la IA completa tareas importantes por menos dinero, en menos tiempo y con menos correcciones humanas.
De los tokens al trabajo terminado
Durante años, el éxito del software se calculó con indicadores como las licencias vendidas, los usuarios activos o las renovaciones. En la IA, OpenAI considera que esas cifras se quedan cortas.
Un modelo puede tener un precio bajo por cada token, que es la unidad de texto que procesa, y aun así resultar caro si necesita varios intentos, tarda demasiado o exige una revisión humana extensa. Otro modelo puede costar más por uso, pero resolver la tarea correctamente a la primera.
Por eso, OpenAI propone medir algo parecido a la inteligencia útil por dólar. El indicador debería responder cuatro preguntas:
- ¿La IA está completando trabajo que importa?
- ¿Cuánto cuesta cada tarea que termina correctamente?
- ¿Se puede confiar en el resultado?
- ¿El valor aumenta cuando la empresa amplía el uso?
El punto de partida es definir qué significa que una tarea esté terminada. Para un equipo de soporte, puede ser resolver el problema de un cliente. Para ingeniería, entregar un cambio de código que supere las pruebas. Para un equipo legal, revisar un contrato con precisión y dentro del plazo.
Un ejemplo: preparar una previsión financiera
OpenAI pone como ejemplo una reunión de revisión de previsiones financieras. Antes de tomar una decisión, el equipo suele tener que localizar la versión más reciente de los datos, pasarlos a Excel o Sheets, comparar cambios, cuadrar pestañas, actualizar presentaciones y comprobar que todas las cifras coinciden.
Según la empresa, ChatGPT Work puede encargarse de buena parte de ese proceso. Así, las personas pueden concentrarse en preguntas de mayor valor: qué cambió, por qué cambió y qué deberían hacer después.
La diferencia es importante. La IA no se evalúa solo por haber generado una respuesta, sino por haber acercado al equipo a una decisión real.
El coste real es más que el precio del modelo
Para calcular el coste de una tarea, OpenAI recomienda sumar todos los recursos necesarios para completarla:
- El uso del modelo y la capacidad de cálculo.
- El tiempo de los empleados.
- Las revisiones humanas.
- Los intentos adicionales.
- Las correcciones y el trabajo repetido.
Después, hay que contar cuántas tareas alcanzaron el nivel de calidad exigido y dividir el coste total entre ellas. El resultado es el coste por tarea exitosa.
Esto cambia la forma de comparar modelos. El más barato por token no siempre es el más barato para la empresa. Si falla más, tarda más o requiere más supervisión, puede terminar costando más que un modelo capaz de resolver el trabajo en un solo intento.
OpenAI también defiende el uso de familias con distintos niveles de capacidad. En su ejemplo, GPT-5.6 ofrece tres opciones: Sol, como modelo principal; Terra, como equilibrio entre rendimiento y precio; y Luna, como alternativa rápida y económica.
La elección dependería del trabajo. Luna podría servir para tareas sencillas y numerosas, mientras que Terra o Sol tendrían sentido cuando una respuesta más profunda reduzca los errores y los intentos necesarios.
La empresa afirma que GPT-5.6 Sol con el máximo nivel de razonamiento logró un resultado destacado en el índice Artificial Analysis Coding Agent y utilizó un 54 % menos de tokens de salida que otro modelo líder. Ese dato corresponde a una prueba concreta, no a todas las tareas ni a todos los usos empresariales.
La confianza también tiene un precio
La tercera medida es la fiabilidad. Una IA puede redactar, buscar información y usar herramientas, pero su valor aumenta cuando entrega resultados que las personas pueden utilizar sin rehacer el trabajo.
OpenAI propone clasificar cada resultado en tres grupos:
- Listo para usar: cumple el nivel de calidad desde el primer intento.
- Necesita corrección: requiere otra ejecución o cambios humanos.
- Necesita escalamiento: una persona debe intervenir y terminar la tarea.
Estas categorías muestran algo que una simple prueba de precisión no refleja: cuánto trabajo adicional sigue recayendo en los empleados.
Antes de permitir que la IA pase de redactar a actuar por sí sola, las empresas también deberían fijar límites claros: qué datos puede consultar, qué sistemas puede modificar y cuándo debe pedir aprobación humana.
La seguridad, la privacidad y el control no son detalles separados del rendimiento. Si una empresa no puede gobernar las acciones del sistema, tendrá más dificultades para usarlo en procesos importantes.
La prueba definitiva llega con la escala
La última medida es comprobar si la economía mejora con el tiempo. Para ello, una empresa puede seguir el mismo flujo de trabajo y registrar cuántas tareas se completan, cuánto cuesta cada una y cuántas necesitan intervención humana.
Si el volumen de trabajo terminado crece más rápido que el coste total, mientras la calidad se mantiene o mejora, cada dólar invertido en IA está generando más valor.
Ahí entra el cálculo informático que sostiene a los modelos. OpenAI señala que mejores algoritmos, hardware especializado, sistemas más eficientes y una distribución más inteligente de los recursos pueden reducir el coste de producir cada resultado.
Para ti, el cambio de enfoque es práctico: no basta con tener acceso a una herramienta de IA ni con que muchas personas la prueben. La pregunta útil es si la herramienta resuelve tareas concretas, reduce el trabajo repetitivo y libera tiempo sin crear una nueva carga de revisiones.
La métrica que OpenAI propone todavía necesita adaptarse a cada empresa y cada proceso. Pero marca una dirección clara: el valor de la IA se decidirá menos por cuánto se usa y más por cuánto trabajo fiable consigue completar por cada dólar.