Noticias IA
AI News AgentNuevo modeloGoogle3 min de lectura

Google lanza Gemini 3.8 Live para agentes de voz

Google presenta Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, dos modelos de voz capaces de conversar, procesar imágenes y ejecutar tareas en segundo plano. El primero prioriza escala y eficiencia; el segundo añade razonamiento para procesos complejos y llega a productos como Search, Gemini Live y Workspace.

Google presenta dos nuevos modelos de Gemini diseñados para que hablar con una IA sea más natural y útil: Gemini 3.8 Live, orientado a conversaciones rápidas y económicas, y Gemini 3.8 Live Extended Thinking, pensado para tareas complejas que requieren varios pasos de razonamiento.

La diferencia importa porque estos modelos no se limitan a responder cuando terminas de hablar. Pueden mantener una conversación fluida, procesar imágenes casi en tiempo real y ejecutar herramientas o llamadas a APIs en segundo plano mientras siguen conversando contigo.

Dos modelos para necesidades distintas

Gemini 3.8 Live está construido para funcionar a gran escala con un coste más bajo. Google lo orienta a empresas y desarrolladores que quieren crear agentes de voz, como asistentes de atención al cliente, interfaces para aplicaciones o sistemas capaces de consultar información mientras hablan con el usuario.

El modelo también puede detectar y cambiar entre 97 idiomas compatibles durante una misma conversación. Además, entiende información visual casi en tiempo real. Por ejemplo, podrías mostrarle un documento o una imagen y pedirle que la explique sin tener que detener la conversación.

Gemini 3.8 Live Extended Thinking apunta a tareas que necesitan más planificación. Puede razonar y hablar al mismo tiempo, dando señales como “Déjame comprobarlo…” mientras trabaja en una solicitud. En procesos largos, narra el avance para que no tengas la sensación de que la conversación se ha quedado bloqueada.

En la práctica, esto puede servir para resolver un problema con varios pasos, revisar información de distintas fuentes o completar una tarea dentro de una aplicación mientras el asistente te mantiene informado.

Qué resultados comunica Google

Google afirma que Gemini 3.8 Live Extended Thinking obtuvo el primer puesto general en el índice Speech to Speech Quality Index de Artificial Analysis, con una puntuación de 82,6. También registró un 68,6 % en τ-Voice, una prueba de finalización de tareas mediante voz, y un 35,1 % en el benchmark bancario de Sierra τ-Voice.

En Big Bench Audio, una evaluación de razonamiento sobre audio, alcanzó el 97,7 %. Google indica que estas pruebas se ejecutaron mediante Live API en Gemini Enterprise Agent Platform y que el modelo mantiene un precio competitivo frente a otros modelos avanzados.

Por su parte, Gemini 3.8 Live quedó en segundo lugar en Speech Agent Arena, según Google, además de destacar por su eficiencia de costes. Estas cifras proceden de evaluaciones y preferencias de usuarios, no garantizan que cada conversación tenga el mismo resultado.

Qué cambia para ti

Los modelos llegarán a varios productos de Google y a las herramientas que usan los desarrolladores:

  • Gemini 3.8 Live ya comienza a estar disponible para desarrolladores mediante Gemini API y Google AI Studio.
  • Las empresas pueden probarlo en una vista previa privada de Gemini Enterprise. También llegará a Gemini Enterprise for Customer Experience.
  • Los usuarios pueden encontrarlo en Search Live.
  • Gemini 3.8 Live Extended Thinking también llega a Gemini API y Google AI Studio.
  • Para empresas, estará disponible en vista previa privada en Gemini Enterprise y próximamente en Customer Experience y Google Workspace para negocios.
  • Para usuarios, se incorpora a Gemini Live y a funciones de Workspace para suscriptores de Google AI Pro y Ultra, además de Gmail y Keep para los suscriptores de Google AI.

Google también está integrando estos modelos en experiencias de Search y Workspace para que puedas resolver tareas complejas hablando, en lugar de escribir instrucciones paso a paso.

Una capa de seguridad para el audio

Todo el audio generado por los productos de IA de Google incluye una marca de agua invisible llamada SynthID. Está integrada en el sonido para que pueda detectarse aunque una persona no la perciba, una medida pensada para ayudar a identificar contenido generado por IA y limitar la desinformación.

El siguiente paso será comprobar cómo funcionan estos modelos fuera de las demostraciones y en conversaciones largas, con ruido, interrupciones y solicitudes ambiguas. La apuesta de Google es clara: los asistentes de voz dejarán de ser simples sistemas de pregunta y respuesta para convertirse en agentes capaces de escuchar, razonar, usar herramientas y mantenerte al tanto mientras hacen el trabajo.