Noticias IA
AI News AgentHerramientasX.ai3 min de lectura

xAI lanza APIs de IA para voz Grok STT y TTS

xAI lanza `Grok Speech to Text` y `Grok Text to Speech`, dos APIs para transcribir audio y generar voces sintéticas desde cualquier aplicación. Incluyen identificación de hablantes, marcas de tiempo, más de 25 idiomas y controles de expresión, con precios por hora de audio y por caracteres.

xAI ha lanzado dos APIs independientes para añadir voz a cualquier aplicación: Grok Speech to Text convierte audio en texto y Grok Text to Speech transforma texto en una voz sintética. La compañía afirma que ambas usan la misma tecnología que alimenta Grok Voice, los vehículos Tesla y el soporte de clientes de Starlink.

La idea es sencilla: los desarrolladores ya no necesitan construir desde cero sistemas para transcribir llamadas, crear asistentes de voz o generar narraciones. Pueden conectar estas APIs a una aplicación, un servicio de atención al cliente, una herramienta de accesibilidad o un podcast interactivo.

Transcripción con más contexto

Grok Speech to Text no se limita a entregar una lista de palabras. Puede incluir marcas de tiempo a nivel de palabra, identificar quién habla y separar los canales de audio. Esto permite, por ejemplo, distinguir automáticamente al cliente y al agente en una llamada grabada.

También incorpora normalización inversa del texto, una función que convierte lo que se dice en una versión escrita más útil. En lugar de transcribir literalmente “cien euros el quince de mayo”, puede organizarlo como “100 euros, 15 de mayo”, según el contexto.

La API admite más de 25 idiomas y permite cambiar de idioma durante una conversación. Está pensada tanto para archivos ya grabados como para transcripción en tiempo real, algo útil en reuniones, subtítulos y centros de atención.

xAI compara el rendimiento de Grok STT con modelos comerciales de ElevenLabs, Deepgram y AssemblyAI. La métrica utilizada es la tasa de error de palabras, o WER: cuanto más baja, menos errores contiene la transcripción.

Tipo de audioGrok STTElevenLabsDeepgramAssemblyAI
Entidades en llamadas5,0%12,0%13,5%21,3%
Vídeos y podcasts2,4%2,4%3,0%3,2%
Reuniones10,9%12,2%16,3%15,7%
Telefonía9,3%9,4%11,0%11,2%
Resultado general6,9%9,0%11,0%12,9%

Estos resultados proceden de las evaluaciones publicadas por xAI, no de una prueba independiente. Aun así, apuntan a uno de los usos que la empresa destaca: reconocer nombres, términos y datos importantes en sectores como el médico, legal y financiero.

Voces con instrucciones directas

Grok Text to Speech permite generar voces con cambios de ritmo y expresión mediante etiquetas sencillas. Un desarrollador puede añadir indicaciones como [laugh], [sigh], [whisper], <emphasis>, <slow> o <pause> para controlar cómo se entrega una frase.

En la práctica, eso permite crear un asistente que haga una pausa antes de una respuesta importante, lea una noticia con mayor énfasis o adapte su tono en una experiencia educativa. No hace falta diseñar un sistema complejo de marcado de audio.

Precios y qué cambia para ti

La transcripción cuesta 0,10 dólares por hora en procesamiento por lotes y 0,20 dólares por hora en streaming, es decir, cuando el audio se procesa mientras ocurre. La generación de voz cuesta 15 dólares por cada millón de caracteres.

Para los usuarios, el cambio no es una nueva aplicación de voz que instalar, sino que más servicios pueden incorporar conversación, subtítulos o lectura automática sin desarrollar toda la infraestructura. Lo que habrá que vigilar ahora es el rendimiento real en distintos acentos, idiomas y entornos ruidosos, además de los límites de uso que xAI establece en su consola de API.

xAI lanza APIs de IA para voz Grok STT y TTS | neversleep.ai