Google lanza Gemini 3.5 Transcribe para dictado
Google presenta `Gemini 3.5 Transcribe`, un modelo de voz a texto que limpia dictados, entiende correcciones y reconoce más de 85 idiomas. Está disponible en vista previa para desarrolladores y empresas, con funciones de transcripción en tiempo real, análisis de grabaciones y control por voz.

Google presenta Gemini 3.5 Transcribe, un modelo de voz a texto que convierte conversaciones y dictados en texto limpio, con formato y contexto. La compañía asegura que entiende correcciones, elimina muletillas y reconoce vocabulario especializado, en lugar de limitarse a copiar cada palabra del audio.
El modelo ya se utiliza en funciones de voz de Gemini y Android, como Rambler, y ahora llega en vista previa pública para desarrolladores y empresas. La idea es que puedas dictar un mensaje, transcribir una reunión o controlar una aplicación sin tener que corregir constantemente el resultado.
No solo transcribe: interpreta lo que dices
Los sistemas tradicionales de reconocimiento de voz suelen tropezar con el ruido, los términos técnicos y las frases incompletas. Gemini 3.5 Transcribe intenta resolver parte de esos problemas entendiendo la intención de la frase.
Por ejemplo, si dices que una reunión será el martes y luego te corriges para decir miércoles, el modelo puede conservar la versión corregida. También elimina sonidos de relleno como “eh” o “mmm” y aplica formato automáticamente para que el texto quede listo para usar.
Entre sus funciones están:
- Reconocimiento de vocabulario personalizado, como nombres de productos, códigos postales o números de pedido.
- Detección automática y transcripción en más de 85 idiomas, con atención a acentos y dialectos regionales.
- Identificación de hasta tres participantes en audios pregrabados, junto con marcas de tiempo por palabra.
- Llamadas a funciones para delegar tareas complejas, como analizar archivos o generar imágenes con otros modelos Gemini.
Dos formas de usarlo
Google ofrece el modelo mediante dos APIs, según el tipo de audio que quieras procesar:
- Audio en tiempo real: la Live API usa
gemini-3.5-transcribe-livepara mantener una conversación bidireccional con una latencia inferior a un segundo. Está pensada para agentes de voz, subtítulos instantáneos y aplicaciones interactivas. - Audio pregrabado: la Interactions API usa
gemini-3.5-transcribepara reuniones, llamadas y grabaciones, con atribución de hablantes y marcas de tiempo.
En las mediciones de Artificial Analysis, Google afirma que el modelo alcanza una tasa media de error de palabras del 4,0 % en streaming y del 2,6 % sin streaming. Esta métrica, conocida como WER, indica qué proporción de palabras se transcribe de forma incorrecta: cuanto más baja, mejor.
En la prueba multilingüe FLEURS, que evalúa varios idiomas y regiones, obtuvo un WER del 5,50 % en streaming y del 5,04 % en escenarios sin streaming. Son mediciones distintas, por lo que no deben compararse como si fueran el mismo resultado. Frente a Chirp 3, su modelo anterior, Google también señala una mejora del 70 % en el tiempo hasta la transcripción final.
Qué cambia para ti
La tecnología ya aparece en varias herramientas de Google. En Gboard para Android, Rambler convierte ideas habladas en texto con formato, permite corregir errores por voz y cambiar el estilo de escritura. En la aplicación de Gemini para macOS, puedes dictar instrucciones y pedir que resuma archivos locales, adapte un texto entre aplicaciones o genere una imagen usando solo la voz.
Google también prepara su llegada a Chrome. La función permitirá hablar para escribir en cualquier campo de una página web, desde una respuesta hasta una publicación o una instrucción para Gemini.
En Google AI Studio, el modo Build permite crear aplicaciones mediante instrucciones habladas. Antigravity puede usar, con tu permiso, el contexto de la pantalla y el historial del chat para reconocer mejor nombres de archivos, documentos y otros elementos activos.
Disponible para desarrolladores y empresas
Gemini 3.5 Transcribe está en vista previa pública en la Gemini API, a través de Google AI Studio y Google Antigravity. Para empresas, también está disponible en la plataforma Gemini Enterprise Agent Platform y llegará más adelante a Gemini Enterprise para Customer Experience.
Para el público general, el modelo está disponible en la aplicación Gemini para macOS en inglés y en Rambler para Android en determinados países e idiomas. La versión para Chrome llegará próximamente.
Lo importante es que la transcripción deja de ser una tarea separada que exige limpiar el resultado a mano. El siguiente paso será comprobar hasta qué punto estas mejoras funcionan igual de bien con acentos, ruido y vocabulario muy específico fuera de las pruebas controladas. Ahí se decidirá si la voz se convierte en una forma práctica de trabajar o sigue siendo solo una alternativa ocasional al teclado.