Google lanza EmbeddingGemma 2, IA multimodal local
Google presenta EmbeddingGemma 2, un modelo abierto de 740 millones de parámetros que busca y relaciona texto, código, imágenes, vídeo y audio directamente en dispositivos locales. Promete búsquedas multimodales sin nube, menor consumo de memoria y una ventana de contexto de 8.000 tokens.

Google ha lanzado EmbeddingGemma 2, un modelo de IA abierto que permite buscar y relacionar texto, código, imágenes, vídeo y audio directamente en dispositivos como móviles y ordenadores.
El modelo convierte cada tipo de contenido en una representación numérica, conocida como embedding. Cuando dos contenidos tienen un significado parecido, sus representaciones quedan cerca entre sí. Así, puedes buscar un vídeo concreto escribiendo una frase, localizar una grabación de voz a partir de una consulta de texto o encontrar código relacionado dentro de un proyecto.
Un modelo pensado para funcionar sin nube
EmbeddingGemma 2 tiene 740 millones de parámetros y se publica con licencia Apache 2.0, que permite utilizarlo y adaptarlo también en proyectos comerciales. Está basado en la arquitectura Gemma 4 y ha sido diseñado para ejecutarse en hardware local.
Eso tiene tres efectos prácticos:
- Tus datos pueden quedarse en el dispositivo, algo relevante para grabaciones, documentos privados o código interno.
- Las búsquedas no dependen necesariamente de una conexión a internet.
- La respuesta puede ser más rápida porque no hay que enviar cada archivo a un servidor.
Google afirma que la primera versión de EmbeddingGemma superó los 20 millones de descargas. La nueva versión amplía su alcance al combinar varios formatos en un mismo espacio de búsqueda.
Menos memoria y más formatos
El modelo es modular. Para tareas basadas solo en texto puede utilizar una configuración de 270 millones de parámetros, mientras que los componentes opcionales de visión y audio añaden 170 y 300 millones, respectivamente.
También utiliza una técnica llamada Matryoshka Representation Learning, que permite reducir el tamaño de los vectores de salida sin tener que volver a procesar los contenidos. En lugar de guardar 768 dimensiones, los desarrolladores pueden elegir 512, 256 o 128. Según Google, esto puede reducir hasta seis veces el almacenamiento y la memoria de una base de datos vectorial local.
En un Google Pixel 11 Pro, con cuantización, el modelo necesita aproximadamente 191 MB de RAM activa en su versión de texto y unos 567 MB en la versión multimodal completa.
Más contexto para audio, imágenes y vídeo
La ventana de contexto alcanza los 8.000 tokens, cuatro veces más que en EmbeddingGemma. En condiciones compatibles, puede procesar hasta:
- 5,5 minutos de audio.
- 29 imágenes.
- 58 fotogramas de vídeo.
- Combinaciones de esos formatos.
El salto también se nota en código. En la prueba MTEB Code, Google asegura que la puntuación sube de 68,76 a 78,68, una mejora de 9,92 puntos frente a la generación anterior. Esto puede servir para indexar repositorios, hacer búsquedas por significado y dar contexto a agentes de programación.
Qué puedes construir con él
Un caso de uso es una aplicación que encuentre una escena dentro de horas de vídeo a partir de una nota de voz. Otro es un buscador local que relacione manuales, capturas de pantalla, grabaciones y fragmentos de código sin subirlos a la nube.
Combinado con un modelo generativo como Gemma 4, también puede formar sistemas RAG locales. Estos sistemas recuperan primero la información relevante de tus archivos y después la entregan a un modelo para que redacte una respuesta.
Los pesos están disponibles en Hugging Face y Kaggle. Google también indica compatibilidad con herramientas como MediaPipe, LiteRT, transformers.js, WebGPU, llama.cpp, Ollama y LM Studio.
Lo importante no es solo que el modelo entienda más formatos, sino que pueda hacerlo en equipos relativamente modestos. El siguiente paso será comprobar en aplicaciones reales si esa combinación de privacidad, búsqueda multimodal y bajo consumo mantiene la calidad que Google declara en sus pruebas.