Ai2 lanza OLMoASR, modelos abiertos de voz
Ai2 presenta OLMoASR, una familia de modelos abiertos de reconocimiento de voz en inglés con pesos, código, datos y proceso de entrenamiento públicos. Sus resultados se acercan a Whisper en 21 pruebas, y muestran que filtrar mejor los datos puede importar tanto como reunir más horas de audio.

Ai2 ha lanzado OLMoASR, una familia de modelos abiertos de reconocimiento automático de voz entrenados desde cero con datos, código y pesos disponibles para cualquiera. Su objetivo es ofrecer una alternativa reproducible a sistemas propietarios como Whisper, especialmente para transcribir audio en inglés sin entrenamiento específico para cada caso.
La propuesta destaca por su transparencia. Ai2 publica tanto los modelos como el proceso completo de entrenamiento, los filtros aplicados a los datos y el código utilizado para evaluar los resultados. Eso permite comprobar cómo se construyó el sistema, repetir los experimentos y modificarlo para nuevas investigaciones.
Seis modelos para distintos niveles de potencia
La primera familia incluye seis versiones, desde un modelo ligero para dispositivos con menos recursos hasta dos modelos grandes de 1.500 millones de parámetros:
OLMoASR-tiny.en: 39 millones de parámetros.OLMoASR-base.en: 74 millones.OLMoASR-small.en: 244 millones.OLMoASR-medium.en: 769 millones.OLMoASR-large.en-v1: 1.500 millones, entrenado con 440.000 horas de audio por época.OLMoASR-large.en-v2: 1.500 millones, entrenado con 680.000 horas por época.
La evaluación cubrió 21 conjuntos de prueba que no se habían utilizado durante el entrenamiento: 14 de audios cortos y 7 de audios largos. Incluyeron audiolibros, llamadas, reuniones y clases, con diferentes acentos, duraciones y tipos de conversación.
Resultados cercanos a Whisper
Ai2 mide el rendimiento con la tasa de error de palabras, o WER: cuanto más bajo es el porcentaje, menos errores comete la transcripción. En la mayoría de los tamaños, OLMoASR iguala o supera los resultados de Whisper en pruebas sin adaptación previa, conocidas como zero-shot.
El modelo OLMoASR-medium.en obtuvo un 12,8% de WER en audios cortos y un 11,0% en audios largos. El modelo de tamaño equivalente Whisper-medium.en registró un 12,4% y un 10,5%, respectivamente. Son resultados muy próximos, aunque Whisper mantiene una ligera ventaja en esa comparación.
En los modelos más grandes, OLMoASR-large.en-v1 alcanzó un 13,0% de WER en audio corto, frente al 12,2% de Whisper-large-v1. Cuando Ai2 entrenó una segunda versión con las mismas 680.000 horas por época utilizadas en esa comparación, la diferencia se redujo a alrededor de 0,4 puntos porcentuales.
Los modelos pequeños también se acercan a sus equivalentes de Whisper. OLMoASR-tiny.en y OLMoASR-base.en igualan aproximadamente el resultado en audios cortos y superan el de Whisper en audios largos, mientras que OLMoASR-small.en ofrece un rendimiento similar en ambos formatos.
La calidad de los datos pesa tanto como su cantidad
Ai2 comenzó con OLMoASR-Pool, una colección de 3 millones de horas de audio en inglés y 17 millones de transcripciones obtenidas de la web pública. Después aplicó varios filtros para crear OLMoASR-Mix, un conjunto de alrededor de 1 millón de horas con pares de audio y texto seleccionados.
El proceso elimina, entre otros problemas:
- Audios y transcripciones que no coinciden en idioma.
- Textos en mayúsculas o con líneas repetidas, habituales en transcripciones generadas automáticamente con ruido.
- Segmentos cuya transcripción se aleja demasiado del audio.
- Duplicados aproximados, aunque no sean idénticos palabra por palabra.
La idea central es sencilla: añadir más horas no garantiza mejores resultados si el texto está mal alineado o contiene errores. Según los experimentos de Ai2, la filtración mejora la generalización del modelo en todos los tamaños.
Para ti, esto significa que hay una opción abierta para crear herramientas de subtitulado, transcripción de reuniones o búsqueda dentro de grabaciones sin depender por completo de una API cerrada. OLMoASR está diseñado para inglés y sus resultados no eliminan todas las diferencias con Whisper, pero sí refuerzan una tendencia importante: en reconocimiento de voz, la transparencia de los datos puede ser tan útil como el modelo final.