xAI lanza Grok Voice Transcribe 2.0 para audio real
xAI presenta Grok Voice Transcribe 2.0, un modelo de voz a texto que, según sus pruebas, duplica la precisión de la versión anterior al mismo precio. Mejora especialmente en llamadas ruidosas, frases cortas y audio multilingüe, y pronto será el modelo predeterminado de su API.

xAI ha lanzado Grok Voice Transcribe 2.0, un modelo que convierte voz en texto y que, según las pruebas de la compañía, duplica la precisión de su versión anterior sin subir el precio. Está diseñado para llamadas con ruido, varios hablantes, acentos locales y datos difíciles como números de teléfono o direcciones de correo.
La mejora no apunta solo a grabaciones limpias de una persona hablando frente a un micrófono. El modelo se ha entrenado con audio real y multilingüe procedente de distintos entornos, incluidos los que ya utilizan los sistemas de voz de Grok.
Más precisión en situaciones complicadas
En el ranking público de Artificial Analysis, Grok Voice Transcribe 2.0 ocupa el primer puesto en precisión entre 32 modelos de transcripción en streaming. xAI también lo comparó con la versión anterior usando cuatro conjuntos internos basados en tráfico de producción:
- Llamadas de atención al cliente en inglés.
- Conversaciones con Grok.
- Números de teléfono, correos y direcciones pronunciados en voz alta.
- Comandos de voz en 19 idiomas.
En todos ellos, la nueva versión mejora los resultados de Grok Voice Transcribe 1.0. En llamadas telefónicas, xAI afirma que supera a todos los modelos que probó.
El avance más grande está en los idiomas. El modelo detecta automáticamente qué idioma se está hablando y puede seguir un cambio de idioma durante la misma grabación. En frases cortas, donde hay poco contexto para identificar la lengua, el porcentaje de palabras con errores baja del 20,6% al 6,8%.
Ese detalle importa en asistentes de voz. Una orden como "enciende las luces" o una dirección de correo tiene pocas palabras y cualquier error puede inutilizar el resultado.
Qué cambia para quienes ya lo usan
Las integraciones existentes con la API de conversión de voz a texto reciben la mejora sin cambios de código. Atlassian, por ejemplo, probó el modelo en Loom, su servicio para grabar y compartir vídeos de pantalla, y lo consideró más preciso que su solución anterior.
Una transcripción más fiable también permite automatizar tareas posteriores. Un usuario puede grabar en Loom un plan de trabajo, enviar el texto a Cursor y utilizarlo como base para aplicar cambios en el código.
El precio se mantiene igual:
- Transcripción por lotes: 0,10 dólares por hora de audio.
- Transcripción en streaming: 0,20 dólares por hora.
- Diarización, marcas de tiempo y términos clave incluidos.
La diarización identifica qué persona habla en cada momento. Es especialmente útil en reuniones y llamadas de soporte.
La versión anterior será retirada
xAI planea convertir Grok Voice Transcribe 2.0 en el modelo predeterminado de su API de voz a texto. Grok Voice Transcribe 1.0 será retirado en las próximas semanas, según el anuncio.
Las aplicaciones que necesiten mantener la versión antigua deberán fijar explícitamente el identificador grok-voice-transcribe-1.0. Para el resto, el cambio llegará de forma automática cuando la nueva versión pase a ser la opción predeterminada.
La señal importante no es solo que el modelo cometa menos errores en una prueba. Es que la transcripción de voz empieza a centrarse en el audio que realmente existe: llamadas imperfectas, conversaciones cruzadas, cambios de idioma y datos que deben quedar escritos exactamente. Ahí se decidirá si los asistentes de voz pueden ejecutar tareas útiles sin necesitar una corrección humana constante.