IBM presenta Granite 4.0 1B Speech para IA en el borde
IBM presenta Granite 4.0 1B Speech, un modelo de voz compacto para transcripción y traducción en seis idiomas, incluido el japonés. Usa la mitad de parámetros que su antecesor y añade reconocimiento de palabras clave, con un diseño pensado para funcionar en dispositivos con recursos limitados.

IBM ha presentado Granite 4.0 1B Speech, un modelo compacto capaz de transcribir y traducir conversaciones en varios idiomas desde dispositivos con recursos limitados. Está pensado para empresas que necesitan procesar voz sin depender siempre de la nube.
El modelo tiene la mitad de parámetros que su antecesor, granite-speech-3.3-2b, pero mejora la precisión de las transcripciones en inglés. También incorpora inferencia más rápida mediante decodificación especulativa, una técnica que acelera la generación de resultados al anticipar parte de la respuesta.
Seis idiomas y traducción de voz
Granite 4.0 1B Speech admite reconocimiento automático del habla, conocido como ASR, y traducción bidireccional de voz, o AST. En la práctica, puede convertir una conversación hablada en texto y traducirla entre idiomas.
La nueva versión funciona con:
- Inglés
- Francés
- Alemán
- Español
- Portugués
- Japonés
El japonés es una de las novedades de esta entrega. La otra es el sesgo mediante listas de palabras clave, una función que ayuda al modelo a reconocer nombres propios, siglas y términos concretos. Por ejemplo, una empresa podría darle una lista con sus marcas, productos o acrónimos internos para reducir errores durante una llamada.
Un modelo pequeño con resultados competitivos
IBM mide la precisión con la tasa de error de palabras, o WER. Este indicador representa el porcentaje de palabras que el sistema transcribe de forma incorrecta: cuanto más bajo es el resultado, mejor funciona.
Según las evaluaciones de IBM, el modelo obtiene resultados competitivos en varias pruebas estándar de reconocimiento de voz en inglés, pese a tener muchos menos parámetros que otros sistemas comparables. La compañía también afirma que iguala o supera a modelos considerablemente más grandes en distintas tareas de reconocimiento y traducción.
Además, Granite 4.0 1B Speech ocupó recientemente el primer puesto del listado OpenASR, que compara sistemas abiertos de reconocimiento automático del habla. Ese resultado indica un buen rendimiento entre los modelos disponibles públicamente, aunque no elimina la necesidad de probarlo con los acentos, ruidos y vocabulario de cada caso de uso.
Qué cambia para ti
El tamaño reducido permite ejecutar el modelo en equipos más modestos, como dispositivos industriales, sistemas de atención al cliente o aplicaciones que necesitan responder sin enviar cada grabación a un servidor externo. Eso puede reducir la latencia, los costes de infraestructura y la exposición de datos sensibles.
El modelo se publica con licencia Apache 2.0 y cuenta con soporte nativo en transformers y vLLM, dos herramientas habituales para ejecutar modelos de IA. IBM recomienda combinarlo con Granite Guardian en entornos de producción que necesiten detectar riesgos adicionales.
Lo importante ahora es comprobar su rendimiento fuera de las pruebas de referencia: con ruido de fondo, distintos acentos y conversaciones reales. Si mantiene sus resultados en esas condiciones, los modelos de voz pequeños pueden convertirse en una opción práctica para llevar la IA directamente al dispositivo.