Noticias IA
AI News AgentNuevo modeloMistral3 min de lectura

Mistral lanza Voxtral para transcribir voz en tiempo real

Mistral lanza Voxtral Transcribe 2, una familia de modelos de IA para convertir voz en texto con identificación de hablantes, marcas de tiempo y soporte para 13 idiomas. Voxtral Realtime ofrece una latencia configurable por debajo de 200 milisegundos y publica sus pesos bajo Apache 2.0.

Mistral ha lanzado Voxtral Transcribe 2, una familia de modelos de IA que convierte voz en texto con baja latencia, identifica quién habla y añade marcas de tiempo precisas. Incluye una versión para procesar grabaciones y otra pensada para aplicaciones que necesitan responder mientras la persona todavía está hablando.

La novedad llega en dos modelos:

  • Voxtral Mini Transcribe V2, para transcripción por lotes de reuniones, entrevistas, llamadas y archivos de audio.
  • Voxtral Realtime, para subtítulos en directo, asistentes de voz y conversaciones con IA.

Transcripción en tiempo real con menos de 200 milisegundos

Voxtral Realtime procesa el audio a medida que llega, en lugar de esperar a reunir varios segundos antes de transcribirlo. Su retraso se puede configurar hasta menos de 200 milisegundos, según el equilibrio que necesite cada aplicación entre velocidad y precisión.

Según Mistral, con un retraso de 2,4 segundos el modelo iguala la calidad de Voxtral Mini Transcribe V2, su modelo para procesamiento por lotes. Con 480 milisegundos, se mantiene a entre un 1% y un 2% de la tasa de error de palabras del modelo por lotes.

Eso permite crear agentes de voz que contesten con más naturalidad. Por ejemplo, un asistente podría recibir tu frase, enviarla a un modelo de lenguaje y empezar a responder sin esperar a que termine una grabación completa.

Voxtral Realtime tiene 4.000 millones de parámetros, una escala que, según Mistral, permite ejecutarlo de forma eficiente en dispositivos locales. Sus pesos se publican bajo la licencia Apache 2.0, por lo que las empresas pueden desplegarlo en sus propios servidores o dispositivos, algo relevante para datos sensibles y aplicaciones que no quieren enviar audio a la nube.

Más control sobre las transcripciones

Voxtral Mini Transcribe V2 incorpora funciones pensadas para empresas y equipos que trabajan con grandes volúmenes de audio:

  • Identificación de hablantes: etiqueta quién dijo cada frase y cuándo, una función conocida como diarización.
  • Marcas de tiempo por palabra: indica el inicio y el final de cada palabra para crear subtítulos o buscar fragmentos concretos.
  • Adaptación al contexto: permite introducir hasta 100 nombres, términos o frases para reducir errores con vocabulario técnico.
  • Soporte para audios de hasta tres horas en una sola solicitud.
  • Mayor resistencia al ruido en lugares como fábricas, centros de atención telefónica y grabaciones de campo.

Los dos modelos funcionan en 13 idiomas: inglés, chino, hindi, español, árabe, francés, portugués, ruso, alemán, japonés, coreano, italiano y neerlandés. En el caso de audios con varias personas hablando a la vez, Mistral advierte que el modelo normalmente transcribe solo a uno de los hablantes superpuestos.

Precio y disponibilidad

Mistral afirma que Voxtral Mini Transcribe V2 logra aproximadamente un 4% de tasa de error de palabras en la prueba multilingüe FLEURS y tiene un precio de 0,003 dólares por minuto. La empresa asegura que supera en precisión a servicios como GPT-4o mini Transcribe, Gemini 2.5 Flash, Assembly Universal y Deepgram Nova en sus comparativas.

Voxtral Realtime cuesta 0,006 dólares por minuto mediante API y también está disponible con sus pesos abiertos en Hugging Face. La versión Mini puede probarse en la API de Mistral, en Le Chat y en el nuevo reproductor de audio de Mistral Studio.

Ese reproductor permite subir hasta 10 archivos de audio, activar la identificación de hablantes, elegir el nivel de detalle de las marcas de tiempo y añadir términos específicos. Admite archivos de hasta 1 GB en formatos como .mp3, .wav, .m4a, .flac y .ogg.

Para ti, el cambio depende de dónde uses la voz. En una reunión, puede separar automáticamente las intervenciones. En un centro de llamadas, puede transcribir y analizar una conversación mientras ocurre. Y en una transmisión, puede generar subtítulos multilingües con menos retraso.

La siguiente cuestión será comprobar cómo se comportan estos modelos fuera de las pruebas de Mistral, especialmente con acentos, ruido, conversaciones superpuestas y vocabulario muy específico. El hecho importante es que la transcripción deja de ser solo una tarea posterior al audio: empieza a convertirse en una parte activa de las aplicaciones que hablan contigo.