Gemini 2.5 mejora el diálogo de voz en tiempo real
Google amplía Gemini 2.5 con conversaciones de voz en tiempo real y generación de audio controlable. El modelo puede interpretar vídeo, usar herramientas, adaptarse al tono del usuario y crear narraciones en más de 24 idiomas.

Google presentó nuevas capacidades de audio nativo para Gemini 2.5: el modelo puede mantener conversaciones de voz más naturales, interpretar lo que ocurre en un vídeo y generar narraciones con control sobre el tono, la velocidad y las emociones.
La novedad está disponible en vista previa para desarrolladores. No es solo un sistema que convierte texto en voz. Gemini 2.5 procesa y genera audio directamente, lo que le permite captar matices de una conversación, como el ritmo, el acento, la risa o el tono con el que dices algo.
Conversaciones de voz más naturales
La versión Gemini 2.5 Flash puede responder con poca latencia, es decir, sin pausas largas que rompan el ritmo de una conversación. También puede adaptar su forma de hablar mediante instrucciones en lenguaje normal: usar un acento concreto, susurrar, cambiar el tono o expresarse con más entusiasmo.
El sistema está diseñado para entender cuándo debe hablar y cuándo no. Puede ignorar conversaciones de fondo, ruido ambiental u otras voces que no forman parte de la interacción principal. En la práctica, esto evita que el asistente responda a cada sonido que capta el micrófono.
Además, Gemini puede usar herramientas durante el diálogo. Por ejemplo, puede consultar información actualizada mediante Google Search o conectarse a herramientas creadas por un desarrollador. Eso permite pasar de una charla general a tareas concretas, como buscar un dato, consultar un sistema o ejecutar una acción.
También puede analizar audio y vídeo en streaming. Si compartes la pantalla o una transmisión de vídeo, puedes preguntarle qué está ocurriendo y mantener una conversación sobre ese contenido.
Estas funciones son compatibles con más de 24 idiomas, incluso mezclados dentro de una misma frase. El modelo también intenta interpretar el tono de voz: las mismas palabras pueden significar cosas distintas si se dicen con enfado, ironía o preocupación.
Voces generadas con más control
Gemini 2.5 también amplía las funciones de texto a voz. A partir de un texto, puede crear desde una frase breve hasta una narración larga y seguir indicaciones sobre cómo debe sonar.
Puedes pedirle, por ejemplo:
- Una lectura de poesía con un tono dramático.
- Una noticia con ritmo y pronunciación clara.
- Un relato con distintas emociones.
- Un diálogo entre dos personas, similar a los resúmenes de audio de NotebookLM.
- Una narración en varios idiomas.
El desarrollador también puede controlar la velocidad de lectura y la pronunciación de palabras concretas. Esto resulta útil para crear anuncios, audiolibros, podcasts, videojuegos o vídeos sin tener que grabar cada línea manualmente.
Para esta generación de voz, Google ofrece Gemini 2.5 Pro Preview para instrucciones complejas y Gemini 2.5 Flash Preview para aplicaciones cotidianas con un coste menor. Ambos modelos están en vista previa.
Qué cambia para ti
Estas capacidades pueden hacer que los asistentes de voz dejen de sentirse como turnos rígidos de pregunta y respuesta. Un asistente podría consultar información mientras hablas, entender una pantalla compartida o cambiar su forma de expresarse sin que tengas que abrir un menú de ajustes.
Para quienes crean productos, la función abre la puerta a interfaces de voz más útiles: tutores que explican un vídeo, aplicaciones que leen contenido con distintos estilos o personajes de videojuegos capaces de conversar en varios idiomas.
Google afirma que ha sometido estas funciones a evaluaciones internas y externas de seguridad, incluido el llamado red teaming, que consiste en intentar encontrar usos problemáticos y fallos antes del lanzamiento. Además, el audio generado incorpora SynthID, una marca de agua que busca facilitar la identificación de contenido creado por IA.
Los desarrolladores pueden probar el diálogo de audio de Gemini 2.5 Flash Preview en la pestaña Stream de Google AI Studio. La generación de voz está disponible en vista previa para Gemini 2.5 Pro y Gemini 2.5 Flash desde la pestaña Generate Media. Lo que habrá que vigilar ahora es cómo funcionan estas voces fuera de las demostraciones: con ruido real, conversaciones ambiguas y tareas que requieran información actualizada.