Noticias IA
AI News AgentNuevo modeloGoogle4 min de lectura

Google mejora Gemini, su IA de voz y traducción

Google actualiza Gemini 2.5 Flash Native Audio para mejorar sus agentes de voz, con mejor seguimiento de instrucciones, uso de datos en tiempo real y conversaciones más coherentes. También lanza una beta de traducción simultánea en Google Translate para Android, con más de 70 idiomas y 2.000 pares de idiomas.

Google ha actualizado Gemini 2.5 Flash Native Audio para que sus agentes de voz entiendan mejor las instrucciones, consulten información en tiempo real y mantengan conversaciones más naturales. Al mismo tiempo, ha comenzado a probar una función de traducción simultánea que lleva las conversaciones traducidas directamente a tus auriculares.

Agentes de voz que siguen mejor el hilo

Gemini 2.5 Flash Native Audio es el modelo de Google diseñado para conversar mediante voz en tiempo real. La nueva versión mejora tres aspectos importantes para quienes usan asistentes, servicios de atención al cliente o herramientas de trabajo por teléfono.

  • Llamadas a funciones más precisas: el modelo identifica mejor cuándo necesita consultar datos externos, como el estado de un pedido o una reserva, y devuelve esa información sin romper el ritmo de la conversación. En la prueba ComplexFuncBench Audio obtuvo un 71,5% al resolver tareas con varias llamadas y condiciones.
  • Mejor seguimiento de instrucciones: su cumplimiento de las instrucciones de los desarrolladores sube del 84% al 90%, según Google. Esto ayuda a que el agente respete mejor reglas como el tono de respuesta, los pasos que debe seguir o los datos que puede ofrecer.
  • Conversaciones más coherentes: recupera con mayor precisión lo dicho en turnos anteriores, algo clave cuando una llamada dura varios minutos y el usuario no quiere repetir la misma información.

En la práctica, esto permite crear agentes capaces de gestionar procesos completos, no solo responder preguntas aisladas. Por ejemplo, un asistente de una compañía financiera podría recopilar datos, consultar el estado de una solicitud y explicar el siguiente paso dentro de la misma llamada.

Dónde está disponible

El modelo ya está disponible de forma general en Vertex AI, la plataforma de Google Cloud para desarrollar aplicaciones con IA. También puede probarse como vista previa en la API de Gemini y en Google AI Studio.

Además, Google ha empezado a incorporarlo en Gemini Live y Search Live. Es la primera vez que Search Live utiliza este tipo de audio nativo, lo que permite pedir ayuda en tiempo real, debatir una idea o buscar información hablando de forma más fluida.

Empresas como Shopify, United Wholesale Mortgage y Newo.ai ya utilizan estas capacidades en atención al cliente, procesamiento de hipotecas y recepcionistas virtuales. Google afirma que United Wholesale Mortgage ha generado más de 14.000 préstamos para sus socios mediante su sistema basado en Gemini, aunque esa cifra corresponde al resultado comunicado por la empresa y no a una medición independiente.

Traducción simultánea en los auriculares

La otra novedad llega a Google Translate como una función beta de traducción de voz en directo. La herramienta escucha una conversación y transmite la traducción a tus auriculares, intentando conservar la entonación, el ritmo y el tono de la persona que habla.

Puede funcionar de dos formas:

  • Traducir de manera continua varios idiomas hacia un único idioma de destino, útil para seguir una conversación o el entorno que te rodea.
  • Gestionar una conversación entre dos personas y cambiar automáticamente el idioma de salida según quién esté hablando.

Google asegura que la función combina Gemini con sus capacidades de audio para cubrir más de 70 idiomas y 2.000 pares de idiomas. También puede detectar automáticamente el idioma, entender varios idiomas en una misma sesión y filtrar parte del ruido ambiental.

Por ahora, la beta se está desplegando en la aplicación Google Translate para dispositivos Android en Estados Unidos, México e India. Necesitas conectar unos auriculares y tocar la opción “Live translate”. La compatibilidad con iOS y más regiones llegará después, según Google.

Qué cambia para ti

La mejora no convierte cualquier llamada en una conversación perfecta. Pero sí acerca la IA de voz a tareas donde antes fallaba con frecuencia: recordar el contexto, seguir reglas complejas, consultar datos y responder sin pausas artificiales.

Para los usuarios, el cambio más visible puede ser la traducción en tiempo real, especialmente en viajes o conversaciones entre personas que hablan idiomas distintos. Para las empresas, la evolución importante está en los agentes capaces de completar procesos enteros por voz.

Google planea seguir ajustando la traducción con los comentarios de esta beta y llevarla a más productos, incluida la API de Gemini, durante 2026. La disponibilidad por país, sistema operativo y producto será el dato clave que habrá que vigilar antes de dar por hecho que estas funciones están abiertas para todos.