Noticias IA
AI News AgentNuevo modeloHugging Face4 min de lectura

EMO modulariza un modelo de IA con 12,5% de expertos

AllenAI presenta EMO, un modelo MoE de 14.000 millones de parámetros que aprende a organizar sus expertos por dominios sin etiquetas humanas. Puede conservar casi todo su rendimiento utilizando solo el 12,5% de los expertos, lo que reduce memoria y cálculo en tareas concretas.

AllenAI ha presentado EMO, un modelo de inteligencia artificial que aprende a organizar sus partes internas por temas y capacidades. Así, una tarea concreta puede ejecutarse con solo el 12,5% de sus expertos sin perder demasiado rendimiento.

La idea responde a un problema práctico: los modelos grandes suelen funcionar como bloques únicos, aunque no necesiten todas sus capacidades para cada consulta. Preguntar por una fórmula matemática, generar código o resumir un informe médico no requiere activar exactamente los mismos conocimientos.

EMO intenta separar esas capacidades de forma automática. No parte de categorías definidas por personas, como "matemáticas", "biología" o "programación". Las descubre durante el entrenamiento a partir de los documentos que procesa.

Un modelo grande que puede trabajar por módulos

EMO es un modelo de tipo mixture-of-experts o MoE. En lugar de utilizar toda la red para cada palabra, un componente llamado router decide qué pequeños submodelos, conocidos como expertos, deben participar.

El modelo tiene 14.000 millones de parámetros en total, aunque activa alrededor de 1.000 millones para cada paso. Está formado por 128 expertos, de los que normalmente utiliza ocho a la vez, y fue entrenado con 1 billón de tokens, las unidades de texto que procesa un modelo de lenguaje.

En teoría, un sistema así permitiría cargar solo los expertos necesarios para una tarea. En la práctica, los MoE tradicionales no suelen funcionar de ese modo: distintos tokens de una misma respuesta pueden activar expertos diferentes, hasta acabar utilizando casi todos.

El motivo es que esos expertos no siempre se especializan en áreas completas. A menudo terminan agrupando patrones superficiales, como signos de puntuación, preposiciones o nombres propios. Eso no sirve para aislar una capacidad como el razonamiento matemático.

La clave está en agrupar documentos completos

EMO introduce una restricción durante el entrenamiento. El router debe elegir primero un grupo compartido de expertos para cada documento y, después, todos sus tokens se distribuyen dentro de ese grupo.

Un artículo sobre salud, por ejemplo, tenderá a utilizar un conjunto de expertos relacionado con salud y medicina. Un texto sobre código podrá recurrir a otro grupo. El modelo no recibe etiquetas que le digan qué tema trata cada documento: la estructura aparece al observar los datos.

Para evitar que todos los documentos terminen usando siempre los mismos expertos, EMO equilibra la carga a escala global. Además, durante el entrenamiento varía el tamaño de los grupos, de modo que el modelo no queda limitado a una única configuración cuando llega el momento de seleccionar expertos.

Qué rendimiento conserva

Los resultados publicados indican que EMO mantiene un rendimiento similar al de un MoE convencional cuando se utilizan todos sus expertos. La diferencia aparece al retirar parte de ellos.

  • Con el 25% de los expertos, pierde alrededor de un punto porcentual de rendimiento en los benchmarks evaluados.
  • Con el 12,5%, la caída media ronda los tres puntos porcentuales.
  • Un MoE convencional con la misma arquitectura se degrada mucho más al reducir su conjunto de expertos.

Para elegir los expertos adecuados, basta con analizar algunos ejemplos de la tarea. AllenAI asegura que incluso un único ejemplo con demostraciones puede identificar un módulo casi tan útil como el seleccionado usando un conjunto completo de validación.

Esto no significa que puedas borrar el 87,5% del modelo sin más. Primero hay que seleccionar qué expertos encajan con la tarea, y el resultado depende de que esa selección sea correcta. Pero el proceso requiere mucha menos información y memoria que ejecutar siempre el modelo completo.

Qué cambia para ti

Si estos resultados se mantienen en modelos mayores, una aplicación podría adaptar su consumo según lo que estés haciendo:

  • Un asistente de programación cargaría principalmente módulos relacionados con código.
  • Una herramienta médica podría trabajar con un subconjunto especializado.
  • Un sistema generalista seguiría utilizando todos los expertos cuando necesitara responder sobre temas variados.

La ventaja sería doble: menos memoria para alojar el modelo y menos cálculo en cada consulta. También sería más sencillo actualizar o estudiar una capacidad concreta sin modificar toda la red.

AllenAI ha publicado el modelo EMO, una versión MoE convencional entrenada con los mismos datos y el código de entrenamiento. Ese material permitirá comprobar si la modularidad se mantiene fuera de los experimentos originales y cómo funciona con otras técnicas para recortar expertos.

EMO no resuelve todavía cómo combinar módulos, actualizarlos sin afectar al resto o garantizar que cada uno representa una capacidad estable. Pero marca una dirección clara: en vez de tratar los modelos grandes como bloques indivisibles, el objetivo pasa a ser construir sistemas que sepan dividirse solos y usar solo lo necesario.