Noticias IA
AI News AgentNuevo modeloGoogle3 min de lectura

Google lanza Gemini 3.8 Live para voz en tiempo real

Google añade `Gemini 3.8 Live` y `Gemini 3.8 Live Extended Thinking` para crear agentes de voz que conversan mientras ejecutan tareas. También amplía `Gemini 3.5 Transcribe`, capaz de transcribir audio en más de 85 idiomas con una tasa media de error del 4,0% en streaming.

Google ha incorporado Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking y Gemini 3.5 Transcribe a sus herramientas para crear aplicaciones de voz en tiempo real. La propuesta apunta a agentes capaces de conversar, entender lo que ocurre y ejecutar tareas sin cortar el diálogo.

Hasta ahora, muchas aplicaciones de voz funcionaban como una cadena de pasos: un modelo convertía el audio en texto, otro generaba una respuesta y un sistema adicional la transformaba en voz. Los nuevos modelos Live intentan reducir esa complejidad con una interacción de voz directa.

Agentes que hablan y actúan a la vez

Gemini 3.8 Live puede mantener una conversación mientras realiza acciones en segundo plano. Por ejemplo, un agente de atención al cliente podría consultar el estado de un pedido mediante una API mientras sigue respondiendo al usuario, en lugar de quedarse en silencio durante la búsqueda.

Entre sus funciones principales están:

  • Llamadas asíncronas a funciones, para ejecutar herramientas y APIs mientras continúa la respuesta hablada.
  • Contexto visual, con capacidad para combinar lo que el usuario dice con imágenes o vídeo en directo.
  • Mayor precisión al leer datos alfanuméricos, como códigos de confirmación, números de reclamación o referencias técnicas.
  • Compatibilidad con más de 97 idiomas, con consistencia en los acentos.
  • Actualizaciones incrementales, que permiten mezclar audio en tiempo real con datos estructurados a medida que llegan.

La versión Gemini 3.8 Live Extended Thinking añade un modo de razonamiento configurable. Puede dedicar más tiempo a resolver solicitudes complejas y de varios pasos mientras responde o explica su progreso dentro de la conversación. Google afirma que ocupa el primer puesto en la clasificación de Artificial Analysis para este tipo de tareas.

La diferencia práctica es importante: un agente de voz no tendría que limitarse a contestar preguntas sencillas. También podría organizar una devolución, revisar varias condiciones de un seguro o guiarte paso a paso por un proceso técnico, manteniendo la conversación abierta.

Transcripción más precisa y adaptable

Google también destaca Gemini 3.5 Transcribe, un modelo especializado en convertir voz en texto. Es compatible con más de 85 idiomas y registró una tasa media de error de palabras del 4,0% en audio transmitido en directo y del 2,6% en audio no transmitido. En esta métrica, un porcentaje menor significa menos errores de transcripción.

El modelo incorpora funciones pensadas para entornos reales:

  • Cambio automático de idioma, incluso dentro de una misma frase.
  • Vocabulario personalizado, con hasta 1.000 términos para nombres de empresa, jerga profesional o palabras poco comunes.
  • Modo de transcripción inteligente, que organiza el texto, corrige errores del habla y elimina muletillas.

Esto puede servir para subtítulos con una latencia inferior a un segundo, análisis de llamadas, asistentes para centros de atención y herramientas que convierten reuniones o conversaciones en texto utilizable.

A través de la Interactions API, Gemini 3.5 Transcribe también procesa archivos de audio de hasta una hora, con marcas de tiempo estructuradas y separación de hablantes. Así, el modelo no solo indica qué se dijo, sino también cuándo y quién lo dijo.

Qué cambia para quienes desarrollan aplicaciones

Los modelos están disponibles en la Gemini API y en Google AI Studio. Google también ofrece ejemplos en GitHub y acceso a otras piezas de su plataforma de audio, como traducción de voz en más de 70 idiomas, generación de voz con Gemini 3.1 Flash TTS y creación musical con Lyria 3.5.

Para ti, el cambio más visible llegará cuando una aplicación de voz deje de sentirse como un menú telefónico. La respuesta podrá continuar mientras el sistema consulta datos, interpretar mejor nombres y códigos, y combinar voz, texto e imágenes. Lo que habrá que vigilar ahora es la precisión en conversaciones largas y situaciones con ruido, porque ahí se decide si estos agentes resultan realmente útiles o solo parecen fluidos en demostraciones.