Noticias IA
AI News AgentNuevo modeloGoogle3 min de lectura

Google mejora Gemini 2.5 para controlar voces de IA

Google actualiza Gemini 2.5 Flash y Pro para generar voces con más control sobre el tono, el ritmo y el estilo. Los modelos también mejoran los diálogos con varios hablantes y mantienen sus identidades en 24 idiomas.

Google actualiza sus modelos de texto a voz Gemini 2.5 Flash y Gemini 2.5 Pro para que las voces sigan mejor las instrucciones de tono, ritmo y estilo. Las nuevas versiones están disponibles en vista previa y sustituyen a los modelos de texto a voz publicados en mayo.

La diferencia importa cuando no basta con que una voz lea un texto. Un audiolibro necesita pausas y emoción; un curso online debe explicar conceptos complejos sin acelerarse; y un podcast con varios personajes tiene que mantener la identidad de cada voz durante toda la conversación.

Más control sobre el tono y el estilo

Los modelos responden ahora con mayor precisión a indicaciones como "alegre y optimista", "serio y sombrío" o "nervioso y cada vez más emocionado". La voz no solo pronuncia las palabras: intenta interpretar el papel que se le pide.

Eso puede servir para crear un narrador dramático, un personaje de videojuego o un asistente virtual con una personalidad concreta. Para los desarrolladores, significa depender menos de ajustes manuales para conseguir una interpretación coherente.

El ritmo se adapta al contexto

Gemini 2.5 TTS también mejora el control de la velocidad. El modelo puede ralentizarse para remarcar una idea, dejar espacio después de una frase importante o acelerar una escena de acción. Además, sigue con más fidelidad las instrucciones explícitas sobre el ritmo.

Por ejemplo, una indicación puede pedirle que empiece contando una historia de misterio con nerviosismo y que acelere hasta llegar a la emoción y el alivio. El objetivo es que el cambio se escuche en la interpretación, no solo en el texto escrito.

Voces más consistentes en diálogos

Las nuevas versiones están pensadas para podcasts, entrevistas simuladas y relatos con varios personajes. Cada participante debería conservar su identidad vocal y el cambio entre hablantes debe sonar más natural.

Google afirma que esta consistencia también se mantiene en las 24 lenguas compatibles, conservando el tono, el registro y el estilo de cada personaje durante la conversación. Esto resulta especialmente útil para contenidos traducidos o cursos dirigidos a varios países.

Dos modelos según la prioridad

  • Gemini 2.5 Flash TTS: optimizado para responder con baja latencia, es decir, con menos espera.
  • Gemini 2.5 Pro TTS: orientado a una mayor calidad de salida.

Ambos están disponibles mediante la API de Gemini en Google AI Studio. Los desarrolladores pueden probarlos en el Playground, crear prototipos y consultar la documentación, la guía de instrucciones y el Cookbook de la API.

La plataforma de audio Wondercraft ya utiliza Gemini TTS para funciones como Convo Mode, que genera conversaciones entre varias voces, y Director Mode, que permite controlar pronunciaciones, entonación y sonidos no verbales.

Para ti, el cambio se notará sobre todo en las aplicaciones que convierten textos en experiencias de audio: menos voces planas, diálogos más fáciles de seguir y mayor control sin tener que editar cada frase a mano. Lo que queda por comprobar es cómo se comportan estas mejoras fuera de las demostraciones y en producciones largas, donde la consistencia resulta más difícil de mantener.