Google presenta Gemma 4 12B, IA multimodal local
Google lanza Gemma 4 12B, un modelo multimodal que procesa texto, imágenes y audio y puede ejecutarse localmente en equipos con 16 GB de memoria. Su arquitectura evita codificadores separados y busca ofrecer razonamiento avanzado con menos consumo.

Google ha presentado Gemma 4 12B, un modelo de inteligencia artificial multimodal diseñado para funcionar directamente en portátiles. Puede procesar texto, imágenes y audio, y busca acercar tareas avanzadas de razonamiento y automatización a equipos con recursos limitados.
El modelo se sitúa entre el Gemma 4 E4B, más pequeño y eficiente, y el modelo de 26.000 millones de parámetros basado en una arquitectura de expertos. Según Google, Gemma 4 12B se acerca al rendimiento de este último en pruebas estándar, pero utiliza menos de la mitad de memoria.
Una IA multimodal sin codificadores separados
La principal novedad está en su arquitectura. Los modelos multimodales suelen usar componentes separados para convertir imágenes y audio en información que el modelo de lenguaje pueda entender. Esos componentes, conocidos como codificadores, añaden consumo de memoria y tiempo de procesamiento.
Gemma 4 12B prescinde de ellos casi por completo. La información visual y sonora entra de forma más directa en el núcleo del modelo:
- Para las imágenes, utiliza un módulo ligero con una multiplicación de matrices, información de posición y normalizaciones.
- Para el audio, proyecta la señal original en el mismo espacio que los tokens de texto, las unidades que el modelo utiliza para procesar una frase.
El resultado es un modelo capaz de combinar instrucciones escritas con imágenes y sonido sin depender de una cadena de sistemas independientes. También es el primer modelo de tamaño medio de la familia Gemma con entrada de audio nativa.
Diseñado para funcionar en tu portátil
Google afirma que Gemma 4 12B puede ejecutarse localmente con 16 GB de memoria unificada o de memoria gráfica, según el equipo. En la práctica, esto permitiría usarlo sin enviar cada consulta a un servidor remoto.
Eso abre la puerta a herramientas que analicen documentos e imágenes, escuchen instrucciones, ejecuten varios pasos por su cuenta o automaticen tareas dentro del ordenador. Por ejemplo, un asistente local podría recibir una captura de pantalla, interpretar lo que ocurre y ayudarte a resolverlo sin que el contenido salga del dispositivo.
El modelo incorpora además Multi-Token Prediction, una técnica que permite anticipar varios tokens a la vez para reducir la latencia. Dicho de forma sencilla: puede responder con menos espera en aplicaciones interactivas.
Disponible para desarrolladores
Gemma 4 12B se publica bajo la licencia Apache 2.0, que permite utilizarlo y adaptarlo con pocas restricciones. Google ofrece versiones preentrenadas y ajustadas para seguir instrucciones a través de Hugging Face y Kaggle.
También se puede probar desde herramientas como:
- LM Studio y Ollama.
- Google AI Edge Gallery y Google AI Edge Eloquent.
- La interfaz de línea de comandos LiteRT-LM.
- Hugging Face Transformers, llama.cpp, MLX, SGLang y vLLM.
Los desarrolladores pueden ajustar el modelo con Unsloth y desplegarlo en Google Cloud, incluyendo Cloud Run, GKE y Model Garden dentro de Gemini Enterprise Agent Platform. Google también ha publicado una biblioteca de habilidades para que otros agentes puedan construir aplicaciones con los modelos Gemma.
La familia Gemma ya supera los 150 millones de descargas, según Google. La llegada de Gemma 4 12B apunta a una tendencia concreta: modelos capaces de ver, escuchar y ejecutar tareas que empiezan a caber en un ordenador personal. Lo importante ahora será comprobar cuánto de ese rendimiento se conserva en usos reales y qué aplicaciones consiguen funcionar de forma rápida y fiable sin depender de la nube.