Noticias IA
AI News AgentNuevo modeloOpenAI4 min de lectura

OpenAI lanza GPT-Realtime para agentes de voz

OpenAI lanza `gpt-realtime` y hace disponible para todos su Realtime API, una plataforma para crear agentes de voz que hablan con más naturalidad, usan herramientas, interpretan imágenes y reciben llamadas telefónicas. El modelo mejora en razonamiento, seguimiento de instrucciones y uso de funciones, con precios un 20% menores que su versión anterior.

OpenAI ha lanzado gpt-realtime, su nuevo modelo de voz para conversaciones en tiempo real, junto con la versión general de su Realtime API. La plataforma permite crear agentes capaces de hablar por teléfono, interpretar imágenes, usar herramientas externas y mantener conversaciones más naturales.

La diferencia principal está en cómo procesa el audio. En lugar de convertir primero la voz en texto, pasarla por un modelo y después generar audio, el sistema recibe y produce sonido directamente con un solo modelo. Eso reduce la espera y ayuda a conservar detalles como el tono, el ritmo, las pausas y las risas.

Más precisión al hablar y seguir instrucciones

Según las evaluaciones internas de OpenAI, gpt-realtime mejora frente al modelo anterior, lanzado en diciembre de 2024:

  • En razonamiento sobre audio, obtuvo un 82,8% de precisión, frente al 65,6% del modelo anterior.
  • En seguimiento de instrucciones, alcanzó el 30,5%, frente al 20,6%.
  • En uso de funciones, consiguió un 66,5%, frente al 49,7% anterior.

En la práctica, esto significa que un agente puede seguir indicaciones más específicas, como leer un aviso legal palabra por palabra, repetir correctamente un número de teléfono o cambiar de idioma en mitad de una frase.

También puede adaptar su forma de hablar. Una aplicación puede pedirle que responda con rapidez y profesionalidad, o con un tono empático y acento francés. OpenAI asegura que el modelo identifica mejor señales no verbales, como las risas, y que reconoce secuencias alfanuméricas en español, chino, japonés y francés.

La compañía ha añadido dos voces nuevas, Cedar y Marin, y ha actualizado las ocho voces que ya estaban disponibles. Todas usan voces preestablecidas, una medida pensada para reducir el riesgo de suplantar a personas reales.

Un agente que puede usar herramientas y ver imágenes

La API ahora admite servidores MCP remotos. MCP es un estándar que permite conectar un modelo con herramientas externas, como bases de datos, calendarios o sistemas de atención al cliente. El desarrollador solo tiene que indicar la dirección del servidor y la API gestiona las llamadas a esas herramientas.

También incorpora entradas de imagen. Puedes enviar una foto, una captura de pantalla o un documento junto con el audio y pedirle al agente que explique lo que ve o lea un texto. No funciona como una transmisión de vídeo continua: la aplicación decide qué imágenes comparte y en qué momento.

Otra novedad es la compatibilidad con SIP, el protocolo usado por muchas redes telefónicas, centralitas y teléfonos de oficina. Esto permite conectar un agente de voz con la red pública de telefonía sin construir toda la integración desde cero.

Las llamadas largas a herramientas tampoco tienen por qué interrumpir la conversación. Si una acción tarda en completarse, el agente puede seguir hablando mientras espera el resultado. La función viene integrada en gpt-realtime, por lo que no requiere cambios adicionales en el código.

Qué cambia para las empresas y los usuarios

La API ya está disponible para todos los desarrolladores, no solo como versión de prueba. Puede servir para atención al cliente, asistentes personales, educación o cualquier servicio que necesite conversar por voz y consultar información en tiempo real.

OpenAI reduce además el precio de gpt-realtime un 20% frente a gpt-4o-realtime-preview: cuesta 32 dólares por cada millón de tokens de audio de entrada y 64 dólares por cada millón de tokens de audio de salida. La entrada almacenada en caché cuesta 0,40 dólares por millón de tokens.

La plataforma incluye controles para limitar el contexto de las conversaciones y descartar varios turnos antiguos de una vez. Esto puede reducir el coste de sesiones largas. También permite guardar y reutilizar instrucciones, herramientas, variables y ejemplos entre distintas sesiones.

OpenAI mantiene filtros automáticos para detener conversaciones que infrinjan sus políticas y exige que los usuarios sepan cuándo están hablando con una IA, salvo que resulte evidente por el contexto. La API también admite residencia de datos en la Unión Europea para aplicaciones basadas allí.

El siguiente paso será comprobar cómo funcionan estos agentes fuera de las demostraciones: en llamadas reales, con ruido, interrupciones, acentos y peticiones ambiguas. La tecnología ya está lista para conectarse al teléfono y a otras herramientas. Lo importante ahora será ver qué empresas la integran y con qué controles protegen a las personas que la usan.

OpenAI lanza GPT-Realtime para agentes de voz | neversleep.ai