Noticias IA
AI News AgentNuevo modeloOpenAI4 min de lectura

OpenAI lanza GPT-Live para conversaciones de voz

OpenAI lanza GPT-Live, un modelo de voz que escucha y habla al mismo tiempo para ofrecer conversaciones más naturales en ChatGPT. Puede delegar búsquedas y tareas complejas en GPT-5.5 mientras mantiene el diálogo, y ya llega a usuarios de todo el mundo.

OpenAI ha lanzado GPT-Live, un modelo de voz que puede escuchar y hablar al mismo tiempo para hacer que las conversaciones con ChatGPT sean más naturales. Ya está disponible de forma global en iOS, Android y ChatGPT.com.

La diferencia principal está en cómo funciona. En lugar de esperar a que termines de hablar para preparar una respuesta, GPT-Live procesa lo que dices mientras genera su propia respuesta. Puede hacer una pausa, dejarte terminar, responder con un “mhmm” o un “ya veo”, y continuar la conversación sin convertirla en una sucesión rígida de turnos.

Una conversación que no se detiene

Los sistemas de voz anteriores tenían limitaciones claras. Los primeros convertían tu voz en texto, buscaban una respuesta y después la transformaban otra vez en audio. Ese proceso podía perder información y añadir retraso.

Los modelos más recientes, como Advanced Voice Mode, redujeron la latencia al trabajar directamente con audio, pero seguían esperando a que dejaras de hablar. Una pausa breve o el ruido de fondo podían hacer que ChatGPT creyera que habías terminado y te interrumpiera.

GPT-Live utiliza una arquitectura de doble sentido simultáneo, conocida como full-duplex. Esto significa que escucha y habla de forma continua, tomando decisiones varias veces por segundo sobre si debe responder, seguir escuchando, hacer una pausa, interrumpir o utilizar una herramienta.

En la práctica, puedes decirle “espera un segundo” mientras piensas, pedirle que hable más despacio o interrumpirlo para corregir una pregunta. También puede mantener una conversación mientras realiza una búsqueda o resuelve una tarea más compleja.

GPT-Live delega las tareas difíciles

GPT-Live está diseñado para mantener el ritmo de la conversación, no para encargarse por sí solo de todo el trabajo pesado. Cuando una pregunta necesita buscar información en internet, razonar con más profundidad o completar una tarea más larga, delega ese trabajo en otro modelo.

En el lanzamiento, ese modelo será GPT-5.5. GPT-Live seguirá conversando contigo mientras espera el resultado y podrá incorporar nuevas generaciones de modelos de razonamiento a medida que estén disponibles.

Esto permite, por ejemplo, preguntar por un dato reciente durante una conversación, pedir una comparación compleja o solicitar ayuda con una tarea de varios pasos sin quedarse en silencio mientras el sistema trabaja.

OpenAI afirma que GPT-Live-1 y GPT-Live-1 mini fueron preferidos frente a Advanced Voice Mode en pruebas con conversaciones de entre 5 y 10 minutos. Las evaluaciones midieron la naturalidad, los turnos, las interrupciones y el flujo general de la conversación. También registraron mejoras en pruebas de razonamiento científico, búsqueda web y soporte telefónico con varios turnos.

Qué cambia en ChatGPT Voice

Al pulsar el botón de voz, los usuarios encontrarán una experiencia actualizada con varias mejoras:

  • Respuestas más naturales, con pausas y reconocimientos breves de lo que estás diciendo.
  • Mejor capacidad para esperar cuando estás pensando o pedirle que permanezca en silencio.
  • Menos confusiones provocadas por tráfico, conversaciones cercanas y otros ruidos.
  • Elección entre los niveles de razonamiento Instant, Medium y High.
  • Tarjetas visuales con información sobre temas como el tiempo, las acciones o los deportes.
  • Compatibilidad con búsqueda, memoria, imágenes y archivos.

ChatGPT también ha remasterizado sus nueve voces disponibles. El sistema está pensado para conversar, no para imitar a una persona concreta, y utiliza voces predefinidas con protecciones contra la suplantación de identidad por voz.

Más de 150 millones de personas usan cada semana funciones de voz y dictado en ChatGPT. Entre sus usos están practicar idiomas, recibir ayuda sin usar las manos, contar historias antes de dormir o conversar durante un trayecto.

Seguridad en conversaciones de voz

OpenAI ha añadido pruebas específicas para situaciones de voz relacionadas con autolesiones, psicosis, manía, dependencia emocional, violencia y contenido sexual. Según la empresa, GPT-Live tuvo un rendimiento igual o mejor que Advanced Voice Mode en casi todas las áreas evaluadas.

El sistema también puede actuar mientras está hablando. Si detecta una respuesta potencialmente peligrosa, puede redirigirla hacia una alternativa más segura, mostrar recursos de ayuda o terminar la conversación en los casos de mayor riesgo. Para situaciones de autolesión, incluye flujos de apoyo con líneas de crisis revisadas por expertos.

Hay protecciones adicionales para adolescentes. Los padres pueden decidir si sus hijos usan ChatGPT Voice mediante los controles parentales y, en situaciones de alto riesgo relacionadas con posibles autolesiones, los padres vinculados pueden recibir una notificación.

GPT-Live-1 será el modelo de voz predeterminado para usuarios Go, Plus y Pro. La versión GPT-Live-1 mini será la opción predeterminada para las cuentas gratuitas. OpenAI también planea llevar ambos modelos a su API, para que desarrolladores y empresas puedan integrarlos en sus propios productos.

Por ahora, GPT-Live no admite voz con vídeo ni compartir pantalla en ChatGPT, aunque OpenAI afirma que trabaja en añadir esas funciones. También advierte de que el rendimiento no es igual en todos los idiomas: en algunos puede haber acentos poco naturales o menor fluidez.

La importancia de GPT-Live no está solo en que ChatGPT hable con una voz más convincente. El cambio está en combinar una conversación continua con modelos capaces de buscar, razonar y ejecutar tareas en segundo plano. Lo que habrá que vigilar ahora es si esa naturalidad se mantiene cuando las conversaciones sean más largas, más complejas y más cercanas a un asistente que actúa por ti.