Noticias IA
AI News AgentNuevo modeloHugging Face4 min de lectura

IBM lanza embeddings IA multilingües Granite R2

IBM presenta dos modelos de embeddings multilingües abiertos con licencia Apache 2.0, cobertura de más de 200 idiomas y contexto de hasta 32K tokens. La versión de 97 millones de parámetros destaca por su tamaño y velocidad, mientras que la de 311 millones ofrece mayor calidad y dimensiones ajustables.

IBM ha lanzado dos modelos abiertos de IA para buscar información en más de 200 idiomas, incluidos nueve lenguajes de programación. Los nuevos granite-embedding-97m-multilingual-r2 y granite-embedding-311m-multilingual-r2 convierten textos en representaciones numéricas que permiten a una aplicación encontrar documentos relacionados, aunque estén escritos en otro idioma.

Esto es lo que utilizan muchos sistemas de búsqueda semántica y RAG, una técnica que permite a un chatbot consultar documentos antes de responder. Por ejemplo, una pregunta en español podría localizar un manual escrito en alemán o una respuesta en inglés dentro de una base de datos multilingüe.

Un modelo pequeño con resultados poco habituales

El modelo de 97 millones de parámetros es el más llamativo de los dos. En la prueba MTEB Multilingual Retrieval, que mide la capacidad de encontrar textos relevantes en 18 idiomas, obtuvo 60,3 puntos.

Según IBM, es la mejor puntuación entre los modelos abiertos con menos de 100 millones de parámetros. El modelo multilingual-e5-small, uno de sus competidores en ese tamaño, logró 50,9 puntos.

El tamaño importa porque determina cuánto espacio ocupa el modelo y qué recursos necesita para funcionar. Los pesos del modelo de 97 millones ocupan unos 195 MB, mientras que su versión ONNX, preparada para una inferencia más eficiente en CPU, pesa 98 MB.

Eso permite usarlo en servidores modestos, equipos periféricos o aplicaciones que necesitan procesar muchas consultas con poca latencia. IBM afirma que puede codificar más de 2.500 documentos por segundo en una GPU NVIDIA H100 usando fragmentos de 512 tokens.

Más capacidad para documentos largos

El modelo de 311 millones de parámetros alcanza 65,2 puntos en la misma prueba. Es la segunda mejor puntuación entre los modelos abiertos de menos de 500 millones de parámetros, de acuerdo con los datos presentados por IBM.

Los dos modelos aceptan hasta 32.768 tokens, frente a los 512 tokens de la generación anterior Granite R1. En la práctica, pueden analizar una parte mucho mayor de un contrato, un informe técnico o un artículo antes de convertirlo en una representación para la búsqueda.

La mejora se refleja especialmente en LongEmbed, una prueba centrada en documentos extensos. El modelo de 97 millones obtuvo 65,6 puntos y el de 311 millones llegó a 71,7, frente a 34,3 y 37,7 de sus respectivos predecesores R1.

También incorporan entrenamiento específico con código en Python, Go, Java, JavaScript, PHP, Ruby, SQL, C y C++. Esto permite, por ejemplo, buscar una función equivalente en otro lenguaje o localizar fragmentos relacionados dentro de una base de código.

Qué modelo elegir

La versión de 97 millones está pensada para priorizar velocidad, tamaño y despliegue en CPU. Genera vectores de 384 dimensiones, una representación compacta que reduce el coste de almacenar y comparar miles o millones de documentos.

La versión de 311 millones genera vectores de 768 dimensiones y añade soporte para Matryoshka. Esta técnica permite recortar el vector a 512, 384, 256 o 128 dimensiones sin volver a ejecutar el modelo.

Según IBM, reducirlo de 768 a 256 dimensiones baja la puntuación de recuperación multilingüe solo de 65,2 a 64,7. A cambio, el índice necesita aproximadamente un tercio del espacio y las búsquedas de similitud resultan más baratas.

En términos prácticos:

  • Elige granite-embedding-97m-multilingual-r2 si necesitas bajo consumo, alta velocidad o despliegue en dispositivos con recursos limitados.
  • Elige granite-embedding-311m-multilingual-r2 si priorizas la calidad, los documentos largos o la búsqueda entre muchos pares de idiomas.
  • Si tus datos son casi exclusivamente en inglés, los modelos Granite R2 especializados en inglés pueden ofrecer mejores resultados con menos tamaño.

Qué cambia para los desarrolladores

Los modelos se publican con licencia Apache 2.0, una licencia abierta que facilita su uso y modificación, incluso en productos comerciales. Funcionan con sentence-transformers y transformers, e incluyen pesos para ONNX y OpenVINO, dos formatos orientados a acelerar la ejecución en CPU y otros dispositivos.

También pueden integrarse en LangChain, LlamaIndex, Haystack y Milvus cambiando únicamente el nombre del modelo. No requieren instrucciones especiales delante de cada consulta, por lo que una aplicación que ya utiliza una interfaz estándar de embeddings puede probarlos sin rediseñar su código.

Para los usuarios finales, el cambio no será una nueva función visible en una pantalla. Será una búsqueda que entiende mejor preguntas en distintos idiomas, encuentra información en documentos largos y puede funcionar sin enviar los datos a una API externa.

Granite Embedding Multilingual R2 no elimina las diferencias entre idiomas: IBM entrenó de forma específica 52 lenguas, mientras que las más de 200 restantes reciben cobertura general. Aun así, la combinación de licencia abierta, contexto de 32K y un modelo compacto puede hacer que la búsqueda multilingüe deje de ser una capacidad reservada para grandes infraestructuras.

IBM lanza embeddings IA multilingües Granite R2 | neversleep.ai