Gemini 3.8 estrena voces con control creativo
Google lanza Gemini 3.8 Flash TTS y Flash-Lite TTS, dos modelos para crear voces personalizadas y dirigir su interpretación línea por línea. Incluyen soporte para más de 100 idiomas, replicación con consentimiento y herramientas para audiolibros, doblaje, podcasts y agentes de voz.

Google presenta dos modelos de texto a voz de la familia Gemini 3.8 que permiten crear voces desde cero, copiar una voz con autorización y dirigir cada frase con indicaciones precisas. La idea es pasar de elegir una voz predeterminada a controlar una interpretación completa.
Gemini 3.8 Flash TTS está pensado para diseñar personajes y actuaciones. Puedes describir en lenguaje natural el acento, el papel y las características de una voz, y después indicar línea por línea cómo debe hablar: con pausas, cambios de ritmo, susurros, dialectos o reacciones como risas y suspiros.
Gemini 3.8 Flash-Lite TTS busca otro objetivo: generar grandes volúmenes de audio con un coste más eficiente. Google lo orienta a tareas como doblaje, creación de contenido y agentes de voz que necesitan responder de forma expresiva a escala.
De una voz predeterminada a un estudio vocal
El modelo Flash TTS amplía la biblioteca disponible de 30 voces originales a más de 2.000 voces listas para producción. Incluye variedades regionales como español mexicano, francés de Quebec e inglés escocés, además de soporte para más de 100 idiomas y dialectos.
También permite crear una voz personalizada describiéndola con texto. Por ejemplo, puedes pedir la voz de un narrador con un acento regional concreto o diseñar un personaje de ficción con una forma de hablar específica.
La replicación funciona a partir de una muestra de voz de 30 segundos, pero solo cuando el usuario tiene autorización para utilizarla. Google asegura que el sistema exige una grabación verbal de consentimiento del propietario de la voz y añade marcas de agua SynthID y credenciales C2PA para facilitar la identificación del contenido generado.
La opción para mezclar y ajustar voces de la biblioteca, modificando características como el timbre, el tono, la velocidad o el acento, llegará más adelante. Las voces personalizadas también se pueden guardar para mantener una interpretación consistente entre episodios, vídeos o proyectos.
Control línea por línea y conversaciones de dos voces
Los dos modelos permiten añadir instrucciones de actuación directamente al guion. Una misma escena puede pedir una atención calmada en una frase y un tono de suspense en la siguiente, sin tener que generar todo el audio con una única configuración.
Entre sus funciones están:
- Generación de audio largo con ritmo y timbre estables durante horas.
- Escenas con dos interlocutores a partir de un solo guion.
- Turnos de conversación diferenciados entre las dos voces.
- Indicaciones no verbales como
<laughs>,<sigh>o<gasp>. - Interjecciones de escucha activa como
<mhm>o<yeah>para hacer más naturales los diálogos.
En la práctica, esto puede servir para producir un audiolibro con personajes consistentes, crear un podcast con dos voces o doblar un vídeo conservando matices regionales. También puede dar más control a los agentes de voz que atienden conversaciones en tiempo real.
Qué resultados presenta Google
Google afirma que Gemini 3.8 Flash TTS ocupa el primer puesto general en el Voice Design Benchmark de Hume AI, con una puntuación de 71,4, y lidera también la medición de modelado de acentos, con 60,8.
En el índice general de calidad de Hume AI, los modelos Flash TTS y Flash-Lite TTS ocupan, respectivamente, el primer y segundo puesto, según la compañía. Google también asegura que ambos obtuvieron posiciones destacadas en evaluaciones a ciegas de Voice Arena en idiomas como japonés, portugués brasileño, vietnamita, árabe estándar moderno, español mexicano e hindi.
Son resultados comunicados por Google y corresponden a pruebas concretas, no a una garantía de que todas las voces o idiomas suenen igual de bien en cualquier situación.
Dónde se puede probar
Los modelos empiezan a llegar a Google AI Studio y a la API de Gemini para desarrolladores. El modelo Flash TTS también se incorpora a Gemini Notebook para usuarios generales, mientras que Flash-Lite TTS llega a Google Vids.
Para empresas, ambos modelos estarán disponibles próximamente mediante la API de Gemini Enterprise. Google también trabaja con plataformas como Agora, LiveKit, Pipecat y Vercel, además de compañías de doblaje y creación de contenido como HeyGen, Wondercraft y Ollang.
El cambio importante no es solo que Gemini lea texto en voz alta. Es que permite tratar la voz como una parte editable de la producción: puedes diseñar quién habla, dirigir cómo interpreta cada frase y mantener ese estilo a lo largo de un proyecto. Lo que habrá que vigilar ahora es si sus controles de consentimiento y detección son suficientes cuando estas voces empiecen a utilizarse en contenidos comerciales y conversaciones automatizadas a gran escala.