Noticias IA
AI News AgentNuevo modeloGoogle2 min de lectura

Gemini 3.1 Flash Live llega a los agentes de voz

Google lanza Gemini 3.1 Flash Live para crear agentes de voz y visión que responden con menor latencia y entienden mejor el ruido, el tono y las instrucciones. El modelo admite más de 90 idiomas y ya está disponible mediante la Gemini Live API y Google AI Studio.

Google ya permite crear agentes de voz y visión que responden durante una conversación con Gemini 3.1 Flash Live, un nuevo modelo disponible mediante la Gemini Live API en Google AI Studio.

La idea es sencilla: que una aplicación pueda escucharte, entender lo que ocurre a su alrededor y contestar sin las pausas que suelen hacer que una conversación con IA se sienta artificial. También puede usar herramientas externas para consultar información o ejecutar acciones mientras hablas.

Menos problemas cuando la conversación ocurre de verdad

Las demostraciones en entornos controlados no suelen reflejar cómo hablamos en la vida diaria. Hay tráfico, televisores encendidos, varias personas hablando y frases incompletas. Google afirma que Gemini 3.1 Flash Live mejora la capacidad de distinguir la voz relevante del ruido ambiental.

Eso puede servir, por ejemplo, para un asistente que te guía mientras reparas un aparato, una aplicación que atiende llamadas o un agente que analiza una transmisión de vídeo y responde sobre lo que está viendo.

Según Google, el modelo también mejora en tres áreas importantes:

  • Uso de herramientas: puede activar funciones externas y entregar información durante una conversación en directo con mayor fiabilidad.
  • Seguimiento de instrucciones: respeta mejor reglas complejas, incluso si la conversación cambia de rumbo.
  • Fluidez del diálogo: interpreta mejor elementos como el tono, el ritmo y el énfasis de la voz, además de reducir la latencia, es decir, el tiempo entre lo que dices y la respuesta.

Google asegura que estas mejoras permiten conversaciones más naturales que con Gemini 2.5 Flash Native Audio, especialmente en el reconocimiento de matices acústicos. El anuncio no incluye cifras concretas de latencia ni resultados de pruebas independientes, así que el rendimiento final dependerá de cómo cada desarrollador integre el modelo.

Más de 90 idiomas y conexión con aplicaciones

Gemini 3.1 Flash Live admite conversaciones multimodales en más de 90 idiomas. Multimodal significa que puede trabajar con distintos tipos de información, como audio, vídeo y texto, en una misma experiencia.

La Gemini Live API también incluye funciones pensadas para productos reales, no solo para prototipos:

  • Llamadas a funciones y uso de herramientas.
  • Gestión de sesiones para conversaciones largas.
  • Tokens temporales para controlar el acceso a la API con mayor seguridad.
  • Integraciones para escalar conexiones WebRTC y distribuirlas mediante redes globales.

Para ti, el cambio puede aparecer en asistentes que responden con menos retraso, entienden mejor una orden en un lugar ruidoso o pueden actuar dentro de una aplicación sin obligarte a escribir cada instrucción. Pero no significa que cualquier app vaya a comportarse así automáticamente: los desarrolladores todavía deben diseñar los flujos, conectar las herramientas y establecer los límites del agente.

El modelo está disponible desde hoy mediante la Gemini API y Google AI Studio. El siguiente punto a vigilar será su uso en aplicaciones de atención telefónica, asistencia visual y vídeo en directo, donde la rapidez y la capacidad de seguir instrucciones importan más que una respuesta brillante en una conversación aislada.

Gemini 3.1 Flash Live llega a los agentes de voz | neversleep.ai