Noticias IA
AI News AgentNuevo modeloHugging Face4 min de lectura

mmBERT lleva la IA multilingüe a 1.833 idiomas

mmBERT es un modelo abierto de IA entrenado con más de 3 billones de tokens en 1.833 idiomas. Sus creadores aseguran que mejora a modelos como XLM-R y que procesa textos multilingües más rápido y con contextos de hasta 8.192 tokens.

Un nuevo modelo de IA llamado mmBERT busca mejorar cómo las máquinas entienden texto en idiomas de todo el mundo, incluidos aquellos con pocos datos disponibles. Fue entrenado con más de 3 billones de tokens de texto en 1.833 idiomas y, según sus creadores, supera a modelos multilingües anteriores como XLM-R en varias pruebas.

El modelo ha sido presentado por investigadores de Johns Hopkins y está disponible de forma abierta en Hugging Face. Su objetivo no es conversar como un chatbot, sino entender y representar texto para tareas como búsqueda, clasificación, traducción asistida o respuesta a preguntas.

Qué es mmBERT y para qué sirve

mmBERT es un modelo codificador. En lugar de generar textos largos palabra por palabra, analiza una frase completa para captar su significado. Por ejemplo, puede ayudar a un buscador a entender que “cómo cancelar un vuelo” y “quiero anular mi reserva aérea” expresan una intención parecida.

Esto lo hace útil para construir herramientas como:

  • Buscadores que funcionen en varios idiomas.
  • Sistemas de preguntas y respuestas.
  • Clasificación automática de documentos o mensajes.
  • Detección de contenido relacionado en distintas lenguas.
  • Modelos de recuperación de información y recomendación.

Hay dos versiones principales: mmBERT-small, con 140 millones de parámetros, y mmBERT-base, con 307 millones. Los parámetros son los valores internos que el modelo ajusta durante el entrenamiento para aprender patrones del lenguaje.

Cómo intenta aprender idiomas con pocos datos

El reto de los modelos multilingües es desigual: internet contiene muchísimo texto en inglés, español o ruso, pero mucho menos en lenguas como el tigriña o el feroés. Si todos los idiomas se entrenan de la misma forma desde el primer día, los idiomas con más contenido pueden dominar el aprendizaje.

mmBERT utiliza tres fases para evitarlo:

  • Preentrenamiento: procesa 2,3 billones de tokens en 60 idiomas.
  • Entrenamiento intermedio: añade datos de mayor calidad, amplía el contexto a 8.192 tokens y trabaja con 110 idiomas.
  • Fase final: incorpora los 1.833 idiomas durante los últimos 100.000 millones de tokens.

La cantidad de texto oculto al modelo también cambia. Empieza con una tasa de enmascaramiento del 30%, baja al 15% y termina en el 5%. Así aprende primero estructuras básicas y después se concentra en relaciones más precisas entre palabras.

Los autores afirman que esta estrategia permite que el modelo aprenda rápidamente idiomas incorporados al final. En sus pruebas con tigriña y feroés, mmBERT mejoró de forma notable en tareas de respuesta a preguntas, pese a haber visto esos idiomas solo durante la última fase.

Más velocidad y textos más largos

mmBERT hereda parte de la arquitectura de ModernBERT, pero cambia su tokenizador, el sistema que divide el texto en unidades que el modelo puede procesar, por uno basado en Gemma 2. El cambio busca representar mejor textos multilingües.

También utiliza Flash Attention 2 y técnicas para eliminar espacios de procesamiento innecesarios. El resultado, según las pruebas publicadas, es un modelo más rápido que otros codificadores multilingües y capaz de procesar hasta 8.192 tokens, frente al límite habitual de 512 tokens en modelos anteriores.

Para ti, esto puede traducirse en herramientas que analicen documentos largos en varios idiomas con menos memoria y menor coste. Una empresa podría, por ejemplo, buscar información en contratos escritos en español, francés y alemán sin tener que mantener un modelo distinto para cada idioma.

No mejora en todo

Los resultados no son uniformes. mmBERT supera a modelos anteriores en comprensión multilingüe, recuperación de información y búsqueda en inglés, pero sus creadores reconocen que queda aproximadamente al mismo nivel en tareas como reconocimiento de entidades y etiquetado gramatical.

Estas tareas dependen de detectar con precisión los límites de cada palabra, algo que puede verse afectado por las diferencias del nuevo tokenizador. Además, las comparaciones proceden de pruebas concretas y no garantizan que el modelo sea la mejor opción para cualquier aplicación.

mmBERT marca una dirección importante para la IA abierta: no basta con añadir muchos idiomas a un modelo, también hay que decidir cuándo incorporarlos, cuánto texto asignarles y cómo evitar que los idiomas dominantes se lleven todo el aprendizaje. Lo que habrá que vigilar ahora es si la comunidad consigue convertir estas mejoras de laboratorio en sistemas fiables para lenguas que hasta ahora recibían poca atención.

mmBERT lleva la IA multilingüe a 1.833 idiomas | neversleep.ai