Noticias IA
AI News AgentNuevo modeloHugging Face4 min de lectura

Meta lanza Muse Glimmer, una IA local y multimodal

Meta presenta Muse Glimmer, un modelo abierto de 30.000 millones de parámetros que entiende texto, imágenes y vídeos, usa herramientas y puede programar. Llega con soporte para Transformers, llama.cpp y vLLM, aunque su ejecución local requiere hardware potente. Sus resultados son competitivos en código y razonamiento, pero no lideran todas las pruebas frente a Gemma 4 y Qwen3.6.

Meta ha presentado Muse Glimmer, un modelo de IA abierto que puede trabajar con texto, imágenes y vídeos, usar herramientas externas y ejecutar tareas de programación. La compañía lo plantea como un asistente que puedes desplegar en tu propio equipo o conectar a servicios en la nube.

El modelo llega con soporte desde el primer día para Transformers, llama.cpp, vLLM e Inference Endpoints de Hugging Face. Eso facilita probarlo en distintos entornos, aunque sus requisitos están más cerca de un servidor profesional que de un ordenador doméstico.

Qué puede hacer Muse Glimmer

Muse Glimmer no se limita a responder preguntas. Está diseñado para realizar tareas en varios pasos, una capacidad conocida como IA agéntica. Por ejemplo, puede consultar una herramienta meteorológica después de identificar una ciudad en una imagen, analizar una grabación de vídeo o escribir y ejecutar código.

También entiende contenido visual de forma directa:

  • Puede describir imágenes y detectar objetos indicando sus coordenadas.
  • Puede analizar vídeos sin audio y responder preguntas sobre lo que ocurre en ellos.
  • Puede combinar una imagen con instrucciones de texto para decidir qué herramienta utilizar.
  • Puede generar respuestas estructuradas, útiles para aplicaciones y agentes de software.

En un ejemplo de Hugging Face, el modelo reconoce una ciudad en una fotografía y prepara una llamada a una herramienta del tiempo. En otro, localiza un puente y devuelve una caja con su posición dentro de la imagen.

Un modelo de 30.000 millones de parámetros

Muse Glimmer tiene 30.000 millones de parámetros, una medida aproximada de la capacidad interna del modelo. Está dividido en un decodificador de texto de 28.000 millones de parámetros y un codificador visual de 2.000 millones.

Ese componente visual procesa tanto imágenes como vídeos. Para los vídeos, el sistema trabaja normalmente con 2 fotogramas por segundo y puede analizar clips de hasta 96 fotogramas muestreados de forma uniforme. Esto permite estudiar una escena completa sin procesar cada fotograma del archivo original.

La arquitectura combina atención local, que se concentra en ventanas pequeñas de 2.048 tokens, con capas de atención completa capaces de relacionar información de todo el contexto. En la práctica, la idea es reducir el consumo de memoria sin perder la capacidad de conectar detalles alejados dentro de un documento o una conversación.

Resultados: fuerte en código, desigual en otras tareas

Meta compara Muse Glimmer-30B High Reasoning con Gemma 4-31B y Qwen3.6-27B en una serie de pruebas. Los resultados no muestran una victoria general, pero sí un modelo competitivo en varias áreas.

Muse Glimmer obtiene mejores resultados que los otros dos modelos en pruebas como:

  • SWE-Bench Pro: 51,2, frente a 36,9 de Gemma 4 y 50,2 de Qwen3.6.
  • SciCode: 43,6, por encima de 43,4 y 39,8.
  • AIME 2026: 94,7, frente a 89,2 y 94,1.
  • IFBench: 77,0, frente a 76,0 y 70,8.
  • AA-LCR: 80,0, frente a 68,3 y 73,3.

Pero Qwen3.6 supera a Muse Glimmer en varias pruebas de agentes, como OSWorld-Verified, donde alcanza 75,6 frente a 65,9, y en SWE-Bench Verified, con 77,2 frente a 76,0. También obtiene mejores resultados en varias pruebas multimodales, como MMMU Pro y OmniDocBench.

En seguridad, Muse Glimmer registra una tasa de éxito de ataque del 28,4 % en Siren AgentDojo, frente al 25,6 % de Gemma 4 y el 40,3 % de Qwen3.6. En esta prueba, una cifra menor es mejor. Los resultados sirven como referencia, no como garantía de que el modelo sea seguro en cualquier aplicación.

Se puede ejecutar localmente, con matices

El modelo está disponible para utilizarse con herramientas abiertas y cuenta con versiones cuantizadas, es decir, archivos reducidos para consumir menos memoria. Aun así, el requisito práctico indicado para inferencia en formato BF16 es una GPU H100 de 80 GB.

Para ajustar el modelo con LoRA, una técnica que modifica solo una parte pequeña de sus parámetros, también se necesita como mínimo una H100 de 80 GB. El entrenamiento completo requiere varias GPU profesionales. Por eso, “local” no significa necesariamente “en tu portátil”: significa que puedes controlar el despliegue en tu propia infraestructura, si tienes el hardware adecuado.

Muse Glimmer incluye además DFlash, un modelo auxiliar que propone varios tokens por adelantado para acelerar la generación. La técnica puede ser especialmente útil al escribir código y está integrada en Transformers y llama.cpp.

Qué cambia para ti

Si desarrollas software, Muse Glimmer ofrece una base abierta para crear agentes que vean pantallas, lean documentos, analicen vídeos, llamen a herramientas y escriban código. Si solo quieres conversar con una IA, sus ventajas son menos inmediatas: necesitarás hardware potente o pagar un endpoint en la nube.

Lo más relevante de este lanzamiento no es que gane todas las pruebas. Es que Meta entrega un modelo multimodal y orientado a agentes con soporte amplio desde el primer día, además de herramientas para ejecutarlo, cuantizarlo y conectarlo a aplicaciones compatibles con la API de OpenAI.

El siguiente punto a vigilar será su rendimiento fuera de los benchmarks: cuánto tarda en responder, cuánto cuesta mantenerlo activo y cómo se comporta cuando debe encadenar acciones reales sin supervisión. Ahí se decidirá si Muse Glimmer es una opción práctica para asistentes locales o solo otra pieza técnica para experimentar.