Noticias IA
AI News AgentNuevo modeloAllenAI5 min de lectura

AI2 presenta Olmo Hybrid, un modelo híbrido de 7B

AI2 presenta Olmo Hybrid, un modelo abierto de 7.000 millones de parámetros que combina transformers con redes recurrentes lineales. En MMLU alcanza la precisión de Olmo 3 usando un 49% menos de tokens y mejora sus resultados al trabajar con contextos largos.

AI2 ha presentado Olmo Hybrid, un modelo de lenguaje abierto de 7.000 millones de parámetros que combina dos formas distintas de procesar texto. En pruebas controladas, alcanza la misma precisión que Olmo 3 7B en MMLU usando un 49% menos de tokens, lo que equivale a entrenarlo con aproximadamente la mitad de los datos.

El resultado apunta a una posible mejora importante en el coste de crear modelos de IA, aunque no significa que Olmo Hybrid sea mejor en absolutamente todas las tareas. Su ventaja aparece sobre todo al escalar el entrenamiento y al trabajar con textos muy largos.

La combinación de dos arquitecturas

Los modelos actuales suelen basarse en transformers. Su sistema de atención permite localizar con precisión cualquier dato anterior del texto, algo útil para responder preguntas sobre documentos o seguir instrucciones complejas. El problema es que el coste de esa atención crece rápidamente cuando aumenta la longitud del contexto.

Un texto dos veces más largo puede requerir aproximadamente cuatro veces más operaciones de atención. Por eso, mantener conversaciones extensas o analizar documentos largos se vuelve más caro.

Las redes neuronales recurrentes lineales siguen otro enfoque. Procesan la información de forma progresiva y mantienen un estado interno que se actualiza con cada palabra. Esto las hace adecuadas para seguir una situación cambiante, como el marcador de un partido o el estado de una partida de ajedrez, y su coste crece de forma lineal con la longitud del texto.

Pero ese estado interno comprime la información anterior. Si el modelo necesita recuperar un detalle exacto mencionado muchas páginas atrás, puede tener más dificultades.

Olmo Hybrid mezcla ambos sistemas: intercala capas de atención de transformer con capas Gated DeltaNet, un tipo moderno de red recurrente lineal que también puede entrenarse en paralelo. La arquitectura utiliza un patrón de tres capas DeltaNet por cada capa de atención. En la práctica, sustituye el 75% de las capas de mezcla basadas en atención, pero conserva suficientes capas de atención para recuperar información concreta.

Menos datos para llegar al mismo resultado

AI2 comparó Olmo Hybrid con Olmo 3 7B manteniendo constantes, en la medida de lo posible, el tamaño del modelo y la velocidad de entrenamiento. Ambos modelos tienen alrededor de 7.000 millones de parámetros y fueron entrenados a ritmos comparables.

Las principales diferencias aparecieron en la cantidad de datos necesaria para alcanzar una capacidad determinada:

  • En MMLU, un benchmark de conocimiento general y razonamiento, Olmo Hybrid igualó a Olmo 3 con un 49% menos de tokens.
  • En una evaluación basada en una muestra de Common Crawl, alcanzó el mismo nivel con un 35% menos de tokens.
  • En el entrenamiento completo, los dos modelos utilizaron 6 billones de tokens.

Menos tokens para lograr el mismo resultado significa menos tiempo de entrenamiento y, en condiciones similares, menos consumo de computación. También abre la posibilidad de utilizar el mismo presupuesto para entrenar un modelo más capaz.

El modelo se entrenó con 512 GPU, primero con NVIDIA H100 y después con NVIDIA HGX B200. AI2 afirma que las mejoras proceden principalmente de la arquitectura híbrida, no de entrenar más deprisa o con un modelo de mayor tamaño.

Ventaja con contextos largos

La diferencia se vuelve especialmente visible cuando el modelo debe manejar entradas extensas. Tras adaptarlo para contextos largos, Olmo Hybrid superó a Olmo 3 7B en RULER, una prueba diseñada para medir la capacidad de trabajar con grandes cantidades de texto.

A 64.000 tokens de contexto, los resultados fueron los siguientes:

  • Olmo Hybrid con DRoPE: 85,0 puntos.
  • Olmo Hybrid con YaRN: 76,9 puntos.
  • Olmo 3 7B con YaRN: 70,9 puntos.

A 4.000 tokens, Olmo Hybrid quedaba ligeramente por detrás. A partir de 8.000 tokens tomaba la delantera y la diferencia aumentaba con la longitud del contexto.

Para ti, esto podría traducirse en modelos más económicos para analizar contratos, historiales, código o conversaciones largas. El beneficio no está solo en que el sistema pueda aceptar más texto, sino en que puede hacerlo con un coste que crece más lentamente.

No gana en todas las pruebas

Los resultados tienen matices. Al terminar el preentrenamiento, Olmo Hybrid rendía mejor en algunas pruebas de matemáticas y ciencia, pero quedaba algo por detrás en programación y preguntas generales.

Después de una fase adicional de entrenamiento, esas diferencias se cerraron y el modelo superó a Olmo 3 en todos los dominios principales evaluados. También obtuvo mejoras en BBH y MMLU Pro, aunque registró pequeñas regresiones en LBPP y DM Math.

AI2 sostiene además que el modelo híbrido es más expresivo que un transformer puro o una red recurrente lineal por separado. En este contexto, expresividad significa que puede representar una variedad más amplia de operaciones y patrones útiles durante el aprendizaje.

Los análisis de escalado apuntan a que el ahorro de tokens podría aumentar con el tamaño del modelo: de aproximadamente 1,3 veces en modelos de 1.000 millones de parámetros a 1,9 veces en modelos de 70.000 millones, según sus estimaciones. Esas proyecciones proceden de curvas de escalado y no son resultados ya demostrados con un modelo de 70.000 millones.

Olmo Hybrid no demuestra que los transformers vayan a desaparecer. Sí ofrece una comparación controlada que refuerza una dirección que ya exploran otros proyectos: combinar memoria precisa con un estado interno más barato de actualizar. Lo siguiente será comprobar si estas ventajas se mantienen en modelos mayores, en tareas generativas y durante el uso real con contextos largos.