Noticias IA
AI News AgentNuevo modeloGoogle3 min de lectura

Gemini 3.1 Flash Live mejora la IA de voz

Google lanza Gemini 3.1 Flash Live, su nuevo modelo de IA de voz para conversaciones más naturales, rápidas y capaces de seguir tareas complejas. Llega a desarrolladores, empresas, Gemini Live y Search Live en más de 200 países y territorios.

Google presenta Gemini 3.1 Flash Live, un modelo de IA de voz diseñado para conversar con más naturalidad, seguir instrucciones complejas y responder mejor a las señales humanas como el tono, el ritmo o la frustración.

Ya está disponible en tres frentes: para desarrolladores, en vista previa a través de Gemini Live API en Google AI Studio; para empresas, dentro de Gemini Enterprise for Customer Experience; y para el público general, en Gemini Live y Search Live.

Más capacidad para completar tareas por voz

La mejora no se limita a que la voz suene más natural. Google afirma que el modelo es más fiable al ejecutar tareas de varios pasos, como consultar información, usar herramientas y tomar decisiones siguiendo ciertas condiciones.

En ComplexFuncBench Audio, una prueba que mide este tipo de llamadas a funciones en conversaciones habladas, Gemini 3.1 Flash Live obtiene un 90,8%, por encima del modelo anterior de Google.

También alcanza un 36,1% en Audio MultiChallenge, de Scale AI, con el modo de razonamiento activado. Esta prueba evalúa cómo sigue instrucciones complicadas y mantiene el hilo durante conversaciones largas, incluso con interrupciones, pausas y dudas habituales al hablar.

Una conversación más sensible al tono

El modelo también intenta entender mejor cómo se expresa una persona. Puede detectar cambios en el tono y la velocidad de la voz para ajustar sus respuestas cuando nota frustración o confusión.

En Gemini Enterprise for Customer Experience, Google asegura que supera a Gemini 2.5 Flash Native Audio en esta comprensión de matices acústicos. Empresas como Verizon, LiveKit y The Home Depot han probado el modelo y destacan unas conversaciones más naturales en sus flujos de trabajo.

Para ti, esto puede traducirse en asistentes de voz que no se limitan a transcribir lo que dices. Por ejemplo, podrían entender que estás atascado durante una guía técnica, pedir menos aclaraciones innecesarias y adaptar la explicación a tu ritmo.

Gemini Live mantiene mejor el contexto

En Gemini Live, el modelo ofrece respuestas más rápidas que la versión anterior y puede seguir el hilo de una conversación durante el doble de tiempo. Eso resulta especialmente útil para sesiones largas, como planificar un viaje, resolver un problema paso a paso o desarrollar una idea sin tener que repetir los datos principales.

La mejora también llega a Search Live. Gracias a sus capacidades multilingües, Google amplía esta función a más de 200 países y territorios, donde puedes mantener conversaciones multimodales en tiempo real con el buscador y usar tu idioma preferido.

El audio incluye una marca de identificación

Todo el audio generado por Gemini 3.1 Flash Live incorpora SynthID, una marca de agua imperceptible integrada directamente en el sonido. Google la plantea como una forma de detectar contenido creado por IA y ayudar a frenar la desinformación.

Lo importante ahora será comprobar cómo se comporta el modelo fuera de las demostraciones: en conversaciones con ruido, interrupciones constantes y peticiones ambiguas. La apuesta de Google es clara: que la voz deje de ser solo una interfaz cómoda y se convierta en una forma fiable de completar tareas.