OpenAI lanza GPT-Live-1 para agentes de voz
OpenAI lanza `GPT-Live-1` en su API para crear agentes de voz capaces de escuchar y hablar al mismo tiempo. El modelo mejora la gestión de interrupciones, ruido y silencios, y puede delegar tareas complejas a otros modelos y herramientas. Está disponible por 0,05 dólares por minuto para la capa de voz, con soporte para aplicaciones, flujos empresariales y llamadas telefónicas.

OpenAI ha lanzado GPT-Live-1 en su API, un modelo de voz que escucha y habla al mismo tiempo para crear asistentes más naturales en aplicaciones, llamadas y flujos de trabajo empresariales.
La diferencia principal está en cómo gestiona una conversación. En lugar de esperar a que termines, convertir tu voz en texto, procesarla y generar una respuesta hablada, GPT-Live-1 analiza el audio entrante y saliente dentro de un mismo modelo.
Eso le permite reaccionar mejor cuando lo interrumpes, haces una pausa o cambias de idea a mitad de una frase. En una llamada, por ejemplo, puedes pedir una reserva, corregir la fecha mientras el asistente responde y continuar sin tener que empezar de nuevo.
Menos interrupciones y conversaciones más naturales
Los sistemas de voz tradicionales suelen unir tres piezas: una herramienta que convierte el habla en texto, un modelo que decide qué responder y otra que transforma la respuesta en voz. Cada conexión puede añadir retraso y hacer que el agente pierda el contexto.
GPT-Live-1 reúne la parte de escucha y habla en un solo modelo. También puede gestionar silencios, ruido de fondo y pequeñas confirmaciones sin narrar cada paso ni cortar la conversación innecesariamente.
En evaluaciones iniciales de Speak, una plataforma de aprendizaje de idiomas, los estudiantes tuvieron más tiempo para pensar y las interrupciones se redujeron casi un 80% frente a sistemas anteriores basados en turnos. OpenAI presenta esta cifra como un resultado temprano, no como una garantía para todas las aplicaciones.
Las evaluaciones de OpenAI también sitúan a GPT-Live-1 30 puntos porcentuales por encima de GPT-Realtime-2.1 en Full Duplex Bench, una prueba centrada en conversaciones en las que las dos partes pueden hablar de forma simultánea. Al combinarlo con GPT-6 Astra con un nivel medio de razonamiento, obtuvo el primer puesto en Tau3, una evaluación de tareas completas para agentes de voz.
Un modelo de voz que delega el trabajo complejo
GPT-Live-1 no tiene que resolver por sí solo todas las partes de una tarea. Puede delegar el razonamiento más profundo y las llamadas a herramientas a un modelo de texto conectado en segundo plano, como GPT-6 Astra, o a modelos de terceros.
Así, una empresa puede elegir distintas combinaciones según el trabajo:
- Un modelo rápido y económico para actualizar pedidos o programar citas.
- Un modelo con más capacidad de razonamiento para resolver problemas complejos de clientes.
- Herramientas propias para consultar inventario, sistemas internos o calendarios.
Mientras ese trabajo ocurre, el agente puede mantener la conversación en marcha. También permite definir mediante instrucciones su tono, velocidad y estilo, en lugar de limitarse a una voz fija y un comportamiento predeterminado.
De las llamadas a los asistentes de uso diario
La API incorpora transcripciones del reconocimiento automático del habla, el texto de las respuestas, comprensión de letras y números, y ajustes para dar prioridad a palabras clave. Aunque no funciona como un sistema basado exclusivamente en turnos, incluye detección de turnos para que los desarrolladores puedan conservar límites claros cuando los necesiten.
También ofrece soporte para agentes de voz dúplex completo en llamadas telefónicas. Sus posibles usos incluyen:
- Reservas en restaurantes.
- Atención y soporte al cliente.
- Actualizaciones de pedidos.
- Gestión de citas.
- Escalado de casos a una persona cuando el agente no puede resolverlos.
OpenAI afirma que está ampliando la selección de voces para incluir más acentos, dialectos e idiomas. La compañía prevé añadir más opciones durante los próximos meses.
Qué cambia para ti
Si utilizas una aplicación con un asistente de voz, la mejora más visible no será necesariamente que responda más rápido, sino que la conversación se sienta menos rígida. Podrás hablar encima, corregirte, hacer una pausa o continuar con ruido alrededor sin repetir todo desde el principio.
Para los desarrolladores, la novedad reduce parte del trabajo necesario para coordinar reconocimiento de voz, razonamiento y síntesis de audio. GPT-Live-1 está disponible en la API por 0,05 dólares por minuto para la capa de voz frontal. El modelo de razonamiento, las herramientas y la infraestructura que se conecten detrás se eligen por separado.
El siguiente punto a vigilar será cómo funciona en conversaciones largas y en llamadas reales, donde importan tanto la precisión como el coste. La voz deja de ser solo una forma de dictarle órdenes a una IA: empieza a convertirse en una interfaz capaz de escuchar, actuar y ceder el control a una persona cuando hace falta.