xAI presenta Grok Voice Think Fast 2.0
xAI presenta Grok Voice Think Fast 2.0, un modelo de voz con menor latencia, mejor transcripción y más capacidad para usar herramientas durante una conversación. La versión actualizada llegará automáticamente a `grok-voice-latest` el 5 de agosto de 2026 y tendrá un precio de 0,08 dólares por minuto.

xAI ha presentado Grok Voice Think Fast 2.0, un modelo de voz que busca responder con más precisión, conversar de forma más natural y ejecutar herramientas con menos demora. La actualización llegará automáticamente a muchos usuarios de la API el 5 de agosto de 2026.
Según las pruebas de Artificial Analysis citadas por xAI, el modelo alcanza un 82,9% en calidad general de voz a voz, frente al 75,7% de la versión anterior. También obtiene mejores resultados que GPT-Realtime-2.1 y Gemini 3.1 Flash en ese índice concreto.
Qué mejora en la práctica
La principal diferencia es que Grok puede razonar mientras habla. En lugar de esperar a terminar todo el procesamiento antes de comenzar una respuesta, analiza la petición en paralelo con la generación de voz. xAI afirma que esto mejora su capacidad para resolver solicitudes sin aumentar la latencia.
El tiempo hasta el primer audio baja de 1,25 segundos a 0,70 segundos frente a la versión anterior. Para quien usa un asistente telefónico, la diferencia se nota en menos silencios después de hacer una pregunta.
El modelo también mejora en conversaciones con interrupciones y respuestas simultáneas, lo que se conoce como conversación full duplex. En esa prueba, Grok Voice Think Fast 2.0 logra un 95,1%, muy cerca del 95,7% de GPT-Realtime-2.1 y por encima del 77,8% de Grok 1.0.
Sus resultados en tareas que requieren actuar sobre herramientas también suben: el modelo alcanza un 56,5% en el benchmark τ-voice, frente al 52,1% anterior. xAI asegura que las llamadas a herramientas suelen ejecutarse antes de que el agente termine su primera frase.
Mejor transcripción, incluso con ruido
xAI afirma que el modelo supera a modelos especializados de transcripción en una evaluación con miles de frases cortas en 24 idiomas. Según sus mediciones, ofrece una mejora de entre 1,5 y 2 veces frente a Deepgram Nova 3 y ElevenLabs Scribe v2, y de 1,4 veces frente a Grok Voice Think Fast 1.0.
La diferencia sería mayor en situaciones difíciles, como llamadas telefónicas comprimidas o entornos con mucho ruido de fondo. En esos escenarios, xAI habla de una ventaja aproximada de 10 veces frente a modelos dedicados de voz a texto. Son resultados de la evaluación de la empresa, no una garantía para cada idioma o conversación.
Conversaciones más breves y menos mecánicas
El entrenamiento también se ha centrado en la forma de conversar. xAI dice que el modelo tiende a usar frases más cortas, hacer una pregunta cada vez y evitar explicaciones innecesarias.
Eso puede ser útil en flujos de atención al cliente. El agente puede guiarte paso a paso para resolver un problema, reservar un servicio o comprobar un pedido sin soltarte un discurso largo ni pedirte varias cosas a la vez.
La empresa asegura que las mejoras funcionan sin cambiar los mensajes de instrucciones existentes. En pruebas A/B realizadas en el servicio de atención y ventas de Starlink, xAI observó un aumento significativo tanto en la conversión de ventas como en la cantidad de consultas resueltas sin intervención humana.
Cambio automático y precio
El identificador grok-voice-latest pasará de grok-voice-think-fast-1.0 a la nueva versión el 5 de agosto de 2026. No habrá que modificar las integraciones para recibir la actualización.
Quienes necesiten mantener el modelo anterior deberán fijar manualmente grok-voice-think-fast-1.0 antes de esa fecha. El precio de Grok Voice Think Fast 2.0 será de 0,08 dólares por minuto de audio.
El siguiente punto que habrá que vigilar es si estas mejoras de laboratorio se mantienen en conversaciones largas, acentos variados y entornos ruidosos reales. Para el usuario final, la promesa es concreta: asistentes de voz que responden antes, transcriben mejor y pueden completar tareas sin sonar tan rígidos.