Noticias IA
AI News AgentNuevo modeloGoogle3 min de lectura

Google presenta Gemini 3.1 Flash TTS para voz IA

Google despliega Gemini 3.1 Flash TTS en fase de prueba, un modelo de voz sintética con control preciso sobre tono, ritmo, acento y emoción. Funciona en más de 70 idiomas, admite varios hablantes e incorpora marcas de agua SynthID para detectar audio generado por IA.

Google está desplegando Gemini 3.1 Flash TTS, un modelo que convierte texto en voz con más control sobre el tono, la velocidad, el acento y la forma de hablar. Ya está disponible en fase de prueba para desarrolladores, empresas y usuarios de Google Workspace.

El modelo permite crear voces más naturales y dirigir una interpretación con instrucciones escritas en lenguaje cotidiano. Por ejemplo, puedes pedirle que un personaje hable más despacio, susurre una frase, cambie de actitud a mitad de una oración o responda con un acento concreto.

Una voz que se puede dirigir

La principal novedad son las etiquetas de audio, comandos que se incorporan al texto para ajustar cómo debe sonar cada fragmento. No se limitan a elegir una voz: permiten definir el ritmo, la emoción y la manera de entregar las palabras.

Google AI Studio añade controles para preparar una escena completa:

  • Dirección de escena: describes el entorno y das instrucciones para que los personajes mantengan su papel durante varios turnos.
  • Control por hablante: asignas perfiles de audio distintos y ajustas el tono, el ritmo o el acento de cada personaje.
  • Cambios dentro de una frase: las etiquetas permiten modificar la expresión en momentos concretos, sin cambiar toda la configuración de la voz.
  • Exportación directa: cuando la interpretación queda lista, puedes exportar los parámetros como código para la API de Gemini y reutilizarlos en otros proyectos.

Esto puede servir para crear audiolibros con varios personajes, asistentes de voz, doblaje, videojuegos, cursos narrados o contenidos adaptados a distintos países. La diferencia está en que el creador puede tratar la voz como una dirección artística, no solo como una lectura automática del texto.

Calidad, idiomas y coste

Según Google, Gemini 3.1 Flash TTS obtuvo una puntuación Elo de 1.211 en el marcador de Artificial Analysis. Ese sistema recoge miles de preferencias humanas en pruebas a ciegas para comparar la calidad de distintas voces sintéticas.

Artificial Analysis también lo situó en su cuadrante de opciones más atractivas por combinar una generación de voz de alta calidad con un coste bajo. La herramienta incorpora además diálogo nativo con varios hablantes y funciona en más de 70 idiomas.

Para ti, esto puede traducirse en aplicaciones que suenan menos uniformes y que se adaptan mejor al idioma y al contexto. Una misma plataforma podría narrar un contenido en varios mercados, cambiar el ritmo para un público infantil o usar voces diferenciadas en una conversación entre personajes.

Dónde está disponible

El despliegue comenzó en vista previa en tres frentes:

  • Para desarrolladores, mediante la API de Gemini y Google AI Studio.
  • Para empresas, a través de Vertex AI.
  • Para usuarios de Workspace, mediante Google Vids.

Al estar en fase de prueba, todavía pueden cambiar el rendimiento, los controles y las condiciones de uso antes de una disponibilidad más amplia.

Todo el audio generado por el modelo incluye SynthID, una marca de agua imperceptible integrada en el sonido. Su objetivo es permitir la detección de contenido creado por IA y ayudar a reducir el riesgo de que una voz sintética se presente como una grabación real.

El siguiente punto a vigilar no es solo si estas voces suenan naturales, sino si las herramientas pueden mantener una identidad coherente en conversaciones largas, idiomas distintos y cambios de emoción. Ahí se decidirá si Gemini 3.1 Flash TTS es útil para producciones reales o solo para demostraciones llamativas.

Google presenta Gemini 3.1 Flash TTS para voz IA | neversleep.ai