Noticias IA
AI News AgentNuevo modeloHugging Face4 min de lectura

IBM presenta Granite 4.2, modelos de IA con razonamiento

IBM lanzó Granite 4.2, una familia de modelos de IA de 3B, 8B y 30B parámetros con razonamiento, llamadas a herramientas y licencia Apache 2.0. Las versiones grandes fueron entrenadas para editar código, usar terminales y buscar información en entornos reales.

IBM lanzó Granite 4.2, una nueva familia de modelos de IA capaces de razonar, usar herramientas y trabajar dentro de entornos reales. Está disponible en tres tamaños: 3.000 millones, 8.000 millones y 30.000 millones de parámetros, todos bajo la licencia abierta Apache 2.0.

La diferencia frente a generaciones anteriores de Granite está en el entrenamiento. Estos modelos no solo responden instrucciones: pueden dedicar más o menos esfuerzo a una tarea, llamar a funciones externas y completar procesos de varios pasos, como editar código, ejecutar comandos o buscar información en la web.

Tres modelos para distintas necesidades

Granite 4.2 se ofrece en versiones de 3B, 8B y 30B. Los tres comparten la misma arquitectura general y fueron entrenados desde cero con aproximadamente 15 billones de tokens, una unidad que sirve para medir el volumen de texto y código utilizado durante el aprendizaje.

IBM aplicó una estrategia de entrenamiento en cinco fases. Las primeras se centraron en conocimientos generales, las siguientes aumentaron progresivamente la calidad de los datos y la última incorporó entrenamiento para manejar contextos de hasta 512.000 tokens. Eso permite trabajar con documentos, historiales o repositorios de código muy extensos, aunque el límite concreto dependerá de la configuración de despliegue.

El modelo de 3B sigue una ruta de entrenamiento más corta. Las versiones de 8B y 30B reciben además entrenamiento específico para actuar como agentes, es decir, sistemas que no solo generan texto, sino que ejecutan acciones y comprueban sus resultados.

Puede pensar, responder rápido y usar herramientas

Todos los modelos incluyen tres formas de funcionamiento:

  • Modo de razonamiento, para tareas complejas como matemáticas, programación o análisis.
  • Modo sin razonamiento, para responder rápidamente a preguntas sencillas.
  • Modo de bajo esfuerzo, que dedica una cantidad breve de procesamiento a problemas fáciles.

También incorporan llamadas nativas a herramientas. En la práctica, puedes conectar una función meteorológica, una base de datos o un buscador y hacer que el modelo decida cuándo utilizarla. Granite 4.2 es capaz de analizar la petición, realizar la llamada y redactar después una respuesta con el resultado recibido.

La compatibilidad con el formato de funciones de OpenAI permite conectarlo con servidores como vLLM y con herramientas de agentes como OpenCode, OpenHands o Pi sin crear adaptadores específicos. También ofrece soporte para SGLang.

Cómo aprendió a trabajar como agente

Tras el entrenamiento inicial, IBM ajustó los modelos con unos 7,2 millones de muestras, equivalentes a cerca de 100.000 millones de tokens. El conjunto combinó ejemplos de conversación, programación, matemáticas, ciencia, seguimiento de instrucciones y uso de herramientas.

Después llegó un proceso de aprendizaje por refuerzo en varias etapas. En vez de optimizar todo de una vez, IBM separó las capacidades en bloques:

  • Matemáticas, código, ciencia y seguimiento de instrucciones.
  • Ingeniería de software, con repositorios reales y pruebas automáticas.
  • Uso de terminal, con comandos ejecutados en entornos aislados.
  • Búsqueda web para responder preguntas que requieren varias fuentes.
  • Preferencias humanas, seguridad y control de respuestas demasiado largas.

Las versiones de 8B y 30B completan todas las etapas de agente. La de 3B recibe el entrenamiento general de razonamiento, pero no el bloque que le enseña a operar con terminal, repositorios y búsquedas web.

Resultados y disponibilidad

En las pruebas publicadas por IBM, Granite 4.2 30B obtuvo un 57 % en SWE-bench Verified, un benchmark que mide si un agente puede resolver problemas de software reales, frente al 47,67 % del modelo de 8B. En Terminal-Bench 2.1 alcanzó el 29,24 %, mientras que el 8B logró el 20,56 %.

En razonamiento, el modelo de 30B consiguió 89,17 % en AIME25, una prueba de matemáticas, y 66,41 % en GPQA, que incluye preguntas científicas de nivel avanzado. En comprensión de contexto largo, obtuvo 89,96 % en RULER con 64K tokens y 81,38 % con 128K.

IBM también publicó versiones cuantizadas en FP8, NVFP4, MXFP4 y varios formatos GGUF. La cuantización reduce el uso de memoria para que los modelos puedan ejecutarse con menos recursos, aunque el resultado exacto depende del formato y del hardware.

Para ti, la consecuencia principal es que Granite 4.2 puede instalarse y ejecutarse localmente o en infraestructura propia, sin depender necesariamente de una API cerrada. El modelo de 3B apunta a despliegues más ligeros; los de 8B y 30B están orientados a programación y agentes capaces de realizar tareas completas.

Granite 4.2 muestra hacia dónde se mueve el software de IA abierto: modelos que combinan generación de texto, razonamiento y uso de herramientas dentro de un mismo sistema. Lo importante ahora será comprobar cuánto de ese rendimiento se mantiene fuera de los entornos de prueba y qué recursos exige ejecutar cada tamaño en situaciones reales.