IBM presenta Granite 4.2, modelos de IA con razonamiento
IBM lanzó Granite 4.2, una familia de modelos de IA de 3B, 8B y 30B parámetros con razonamiento, llamadas a herramientas y licencia Apache 2.0. Las versiones grandes fueron entrenadas para editar código, usar terminales y buscar información en entornos reales.

IBM lanzó Granite 4.2, una nueva familia de modelos de IA capaces de razonar, usar herramientas y trabajar dentro de entornos reales. Está disponible en tres tamaños: 3.000 millones, 8.000 millones y 30.000 millones de parámetros, todos bajo la licencia abierta Apache 2.0.
La diferencia frente a generaciones anteriores de Granite está en el entrenamiento. Estos modelos no solo responden instrucciones: pueden dedicar más o menos esfuerzo a una tarea, llamar a funciones externas y completar procesos de varios pasos, como editar código, ejecutar comandos o buscar información en la web.
Tres modelos para distintas necesidades
Granite 4.2 se ofrece en versiones de 3B, 8B y 30B. Los tres comparten la misma arquitectura general y fueron entrenados desde cero con aproximadamente 15 billones de tokens, una unidad que sirve para medir el volumen de texto y código utilizado durante el aprendizaje.
IBM aplicó una estrategia de entrenamiento en cinco fases. Las primeras se centraron en conocimientos generales, las siguientes aumentaron progresivamente la calidad de los datos y la última incorporó entrenamiento para manejar contextos de hasta 512.000 tokens. Eso permite trabajar con documentos, historiales o repositorios de código muy extensos, aunque el límite concreto dependerá de la configuración de despliegue.
El modelo de 3B sigue una ruta de entrenamiento más corta. Las versiones de 8B y 30B reciben además entrenamiento específico para actuar como agentes, es decir, sistemas que no solo generan texto, sino que ejecutan acciones y comprueban sus resultados.
Puede pensar, responder rápido y usar herramientas
Todos los modelos incluyen tres formas de funcionamiento:
- Modo de razonamiento, para tareas complejas como matemáticas, programación o análisis.
- Modo sin razonamiento, para responder rápidamente a preguntas sencillas.
- Modo de bajo esfuerzo, que dedica una cantidad breve de procesamiento a problemas fáciles.
También incorporan llamadas nativas a herramientas. En la práctica, puedes conectar una función meteorológica, una base de datos o un buscador y hacer que el modelo decida cuándo utilizarla. Granite 4.2 es capaz de analizar la petición, realizar la llamada y redactar después una respuesta con el resultado recibido.
La compatibilidad con el formato de funciones de OpenAI permite conectarlo con servidores como vLLM y con herramientas de agentes como OpenCode, OpenHands o Pi sin crear adaptadores específicos. También ofrece soporte para SGLang.
Cómo aprendió a trabajar como agente
Tras el entrenamiento inicial, IBM ajustó los modelos con unos 7,2 millones de muestras, equivalentes a cerca de 100.000 millones de tokens. El conjunto combinó ejemplos de conversación, programación, matemáticas, ciencia, seguimiento de instrucciones y uso de herramientas.
Después llegó un proceso de aprendizaje por refuerzo en varias etapas. En vez de optimizar todo de una vez, IBM separó las capacidades en bloques:
- Matemáticas, código, ciencia y seguimiento de instrucciones.
- Ingeniería de software, con repositorios reales y pruebas automáticas.
- Uso de terminal, con comandos ejecutados en entornos aislados.
- Búsqueda web para responder preguntas que requieren varias fuentes.
- Preferencias humanas, seguridad y control de respuestas demasiado largas.
Las versiones de 8B y 30B completan todas las etapas de agente. La de 3B recibe el entrenamiento general de razonamiento, pero no el bloque que le enseña a operar con terminal, repositorios y búsquedas web.
Resultados y disponibilidad
En las pruebas publicadas por IBM, Granite 4.2 30B obtuvo un 57 % en SWE-bench Verified, un benchmark que mide si un agente puede resolver problemas de software reales, frente al 47,67 % del modelo de 8B. En Terminal-Bench 2.1 alcanzó el 29,24 %, mientras que el 8B logró el 20,56 %.
En razonamiento, el modelo de 30B consiguió 89,17 % en AIME25, una prueba de matemáticas, y 66,41 % en GPQA, que incluye preguntas científicas de nivel avanzado. En comprensión de contexto largo, obtuvo 89,96 % en RULER con 64K tokens y 81,38 % con 128K.
IBM también publicó versiones cuantizadas en FP8, NVFP4, MXFP4 y varios formatos GGUF. La cuantización reduce el uso de memoria para que los modelos puedan ejecutarse con menos recursos, aunque el resultado exacto depende del formato y del hardware.
Para ti, la consecuencia principal es que Granite 4.2 puede instalarse y ejecutarse localmente o en infraestructura propia, sin depender necesariamente de una API cerrada. El modelo de 3B apunta a despliegues más ligeros; los de 8B y 30B están orientados a programación y agentes capaces de realizar tareas completas.
Granite 4.2 muestra hacia dónde se mueve el software de IA abierto: modelos que combinan generación de texto, razonamiento y uso de herramientas dentro de un mismo sistema. Lo importante ahora será comprobar cuánto de ese rendimiento se mantiene fuera de los entornos de prueba y qué recursos exige ejecutar cada tamaño en situaciones reales.