Google lanza Gemma 4, IA multimodal y local
Google presenta Gemma 4, una familia de modelos abiertos con licencia Apache 2 que entiende texto, imágenes, vídeo y, en sus versiones pequeñas, audio. Sus cuatro tamaños están preparados para ejecutarse desde servidores hasta ordenadores, navegadores y dispositivos locales. El modelo combina contexto largo, funciones multimodales y soporte para herramientas de código abierto, aunque las pruebas también muestran que puede equivocarse, especialmente al interpretar audio.
Google presentó Gemma 4, una nueva familia de modelos de inteligencia artificial abiertos que puede trabajar con texto, imágenes, vídeo y, en sus versiones pequeñas, también con audio. Los modelos llegan con licencia Apache 2 y están diseñados para ejecutarse desde servidores hasta ordenadores personales, navegadores y dispositivos con recursos limitados.
La familia incluye cuatro tamaños, con versiones base y ajustadas para seguir instrucciones:
Gemma 4 E2B: 2.3 mil millones de parámetros efectivos y contexto de 128.000 tokens.Gemma 4 E4B: 4.5 mil millones de parámetros efectivos y contexto de 128.000 tokens.Gemma 4 31B: 31 mil millones de parámetros y contexto de 256.000 tokens.Gemma 4 26B A4B: modelo de expertos que activa 4 mil millones de parámetros de un total de 26 mil millones, con contexto de 256.000 tokens.
Un token es una unidad de texto que el modelo procesa, como una palabra o parte de ella. Un contexto de 128.000 o 256.000 tokens permite analizar documentos largos, conversaciones extensas o grandes cantidades de código sin tener que dividirlos tanto.
Un modelo pequeño con capacidades amplias
Gemma 4 puede describir imágenes, extraer texto de documentos, detectar objetos y ubicar elementos concretos dentro de una pantalla. En las pruebas publicadas, el modelo identifica un botón como "ver receta" y devuelve sus coordenadas en formato JSON, algo útil para agentes capaces de interactuar con aplicaciones.
También puede generar código a partir de una captura de pantalla. Por ejemplo, recibe la imagen de una página web y produce el HTML necesario para reconstruirla.
Los modelos pequeños E2B y E4B aceptan texto, imágenes, vídeo y audio. Los modelos grandes procesan imágenes y vídeo, aunque en las pruebas con vídeo no incorporan la pista de audio. La familia también ofrece transcripción y comprensión de discursos.
Hay una limitación importante: el entrenamiento de audio se centró en el habla, no en la música ni en los sonidos ambientales. En una prueba con un concierto, E2B inventó parte de la interpretación del audio, mientras que E4B describió correctamente el discurso musical y la escena visual. No conviene tratar sus respuestas como una transcripción fiable de cualquier sonido.
Rendimiento con muchos menos parámetros
Según las estimaciones compartidas por Hugging Face, el modelo denso de 31B alcanza una puntuación de 1452 en LMArena, una clasificación basada en comparaciones entre respuestas de modelos. El modelo Gemma 4 26B A4B obtiene 1441 activando solo 4 mil millones de parámetros en cada respuesta.
La comparación es relevante porque esas puntuaciones se sitúan, según la publicación, cerca de modelos como GLM-5 o Kimi K2.5, pero con aproximadamente 30 veces menos parámetros. Son cifras estimadas y corresponden a pruebas de texto, no a una medición universal de todas sus capacidades.
La arquitectura combina atención local, que se concentra en fragmentos cercanos, con atención global para relacionar información distante. También reutiliza parte de la memoria interna durante la generación. El objetivo es reducir el consumo de memoria y cálculo, especialmente cuando el modelo trabaja con contextos largos o funciona en un dispositivo local.
Disponible en más herramientas desde el primer día
Gemma 4 llega integrada en varias tecnologías de código abierto, entre ellas:
- Transformers y TRL de Hugging Face.
llama.cpp, con soporte para aplicaciones como LM Studio, Jan y agentes de programación.- MLX para equipos Apple Silicon.
transformers.jspara ejecutarlo en el navegador mediante WebGPU.mistral.rspara usarlo desde Rust.- ONNX para distintos tipos de hardware.
Eso permite usar un modelo como Gemma 4 E2B en un equipo personal o navegador, mientras que las versiones grandes pueden desplegarse en servidores con más memoria. La licencia Apache 2 también facilita integrarlo, modificarlo y ajustarlo para proyectos propios, aunque cada uso debe cumplir las condiciones de esa licencia y las políticas aplicables.
Para ti, el cambio principal es que una IA capaz de leer imágenes, entender voz y manejar herramientas puede funcionar sin enviar necesariamente todos los datos a un servicio externo. Eso abre posibilidades para asistentes privados, automatización local, análisis de documentos y agentes que operan en ordenadores o dispositivos conectados.
Gemma 4 no elimina los errores de los modelos multimodales. Puede confundir lugares, interpretar mal un audio o inventar detalles. Lo que habrá que vigilar ahora es si su disponibilidad en tantos dispositivos convierte estas capacidades en aplicaciones reales y fiables, no solo en demostraciones técnicas.