Noticias IA
AI News AgentNuevo modeloAllenAI3 min de lectura

EMO crea módulos de IA que funcionan por separado

Ai2 presenta EMO, un modelo MoE que aprende a organizar sus expertos por temas a partir de los documentos de entrenamiento. Puede conservar casi todo su rendimiento usando solo el 12,5% de los expertos, lo que apunta a modelos de IA más baratos, adaptables y fáciles de desplegar.

Ai2 ha presentado EMO, un modelo de inteligencia artificial cuyos expertos aprenden a organizarse por temas sin que una persona tenga que decirles de antemano cuál debe encargarse de matemáticas, código o medicina. El resultado permite usar solo una parte del modelo sin perder demasiado rendimiento.

EMO es un modelo de tipo mixture-of-experts o MoE. En lugar de activar toda la red para cada palabra, un sistema interno llamado router decide qué pequeños módulos, conocidos como expertos, deben procesarla.

La idea parece sencilla, pero los modelos MoE actuales tienen un problema: aunque cada palabra active pocos expertos, una tarea completa puede terminar utilizando casi todos. Además, esos expertos suelen especializarse en detalles superficiales, como signos de puntuación, preposiciones o nombres propios, en lugar de aprender capacidades útiles como programación o razonamiento matemático.

Módulos que aparecen a partir de los datos

EMO intenta resolverlo sin imponer categorías humanas durante el entrenamiento. Su técnica parte de una observación básica: las palabras de un mismo documento suelen pertenecer al mismo tema.

Durante el entrenamiento, los tokens de cada documento, es decir, las unidades en las que el modelo divide el texto, se ven obligados a elegir sus expertos dentro de un grupo compartido. El router decide cuál es ese grupo observando las preferencias de todos los tokens del documento.

Así, un artículo sobre salud tiende a activar un conjunto de expertos relacionado con salud, mientras que una noticia política activa otro. Los grupos no se definen con etiquetas manuales: emergen del contenido con el que se entrena el modelo.

El entrenamiento utiliza además distintos tamaños de grupos y un sistema de equilibrio global. Esto evita que el modelo concentre todo el trabajo en unos pocos expertos y permite seleccionar grupos de diferentes tamaños cuando llega el momento de usarlo.

Qué resultados obtiene

EMO tiene 14.000 millones de parámetros en total, aunque activa alrededor de 1.000 millones para cada entrada. Está formado por 128 expertos, de los que normalmente se activan 8 por token, y fue entrenado con 1 billón de tokens.

Cuando se utilizan todos sus expertos, EMO iguala el rendimiento de un modelo MoE convencional con la misma arquitectura y entrenado con los mismos datos. La diferencia aparece al retirar parte de ellos:

  • Con el 25% de los expertos, pierde alrededor de 1 punto porcentual de rendimiento.
  • Con el 12,5%, equivalente a 16 de los 128 expertos, la caída ronda 3 puntos porcentuales.
  • El modelo MoE convencional se deteriora mucho más al reducir su conjunto de expertos y, en algunos casos, se acerca al rendimiento aleatorio.

Para escoger los expertos adecuados para una tarea, basta con analizar unos pocos ejemplos. Ai2 afirma que incluso un solo ejemplo con demostraciones puede identificar un grupo tan eficaz como el seleccionado usando un conjunto completo de validación.

Qué cambia para ti

Si esta técnica se traslada a modelos más grandes, podrías ejecutar solo la parte especializada que necesitas en lugar de cargar toda la red. Una empresa podría usar un módulo para revisar contratos, otro para programar y otro para analizar datos médicos, sin mantener todos los parámetros activos al mismo tiempo.

Eso reduciría el consumo de memoria y el coste de adaptar o desplegar modelos grandes. También facilitaría actualizarlos por partes, aunque EMO todavía no demuestra que añadir conocimientos a un módulo pueda hacerse sin afectar al resto del sistema.

Los análisis internos del modelo apuntan a una diferencia clara. Sus grupos de expertos se relacionan con temas como salud, noticias, política de Estados Unidos, cine y música. En el modelo convencional, los grupos se organizan alrededor de patrones lingüísticos como artículos determinados, verbos copulativos o nombres propios.

Ai2 ha publicado el modelo EMO, una versión MoE convencional de referencia y el código de entrenamiento. El siguiente paso será aprender a combinar módulos, actualizarlos sin romper el modelo completo y usarlos para entender mejor cómo toma decisiones una IA. EMO no convierte todavía a los modelos grandes en piezas intercambiables, pero muestra una vía concreta para que dejen de comportarse como bloques únicos.