IBM lanza Granite 4.0 3B Vision para documentos
IBM publica Granite 4.0 3B Vision, un modelo compacto para extraer tablas, gráficos y campos de documentos. Funciona junto a Granite 4.0 Micro y puede integrarse con Docling para automatizar el análisis de PDF y formularios a gran escala.

IBM ha publicado Granite 4.0 3B Vision, un modelo de IA compacto capaz de interpretar tablas, gráficos y formularios dentro de documentos. Está pensado para convertir imágenes y PDF complejos en datos estructurados que otros sistemas puedan utilizar.
El modelo puede extraer tablas en HTML, transformar gráficos en datos CSV o código y localizar pares clave-valor, como "Número de factura: 45821" o "Fecha de vencimiento: 15 de abril". También puede describir imágenes con lenguaje natural.
Qué puede hacer
Granite 4.0 3B Vision está orientado a tareas donde no basta con leer el texto. También hay que entender la posición de cada elemento y la relación entre ellos.
- Tablas: identifica filas, columnas y estructuras complejas, incluso cuando la tabla aparece dentro de una página llena de contenido.
- Gráficos: interpreta líneas, barras y otros formatos para generar resúmenes, datos estructurados o código ejecutable.
- Campos de documentos: extrae información de facturas, recibos, formularios y documentos con diseños variados.
Por ejemplo, en un informe financiero puede detectar un gráfico, leer sus valores y convertirlos en una tabla que después se pueda analizar automáticamente. En un formulario, puede identificar qué texto corresponde al nombre, la dirección o la fecha, aunque el diseño cambie de un documento a otro.
Un modelo pequeño con una arquitectura modular
Granite 4.0 3B Vision funciona como un adaptador LoRA sobre Granite 4.0 Micro. Un adaptador LoRA añade capacidades específicas a un modelo base sin tener que sustituirlo por completo.
En la práctica, esto permite utilizar el mismo despliegue para tareas de texto y de imagen. Cuando una solicitud no necesita visión, el sistema puede recurrir al modelo base. Esa separación reduce la complejidad de integrar el modelo en procesos empresariales que mezclan documentos, texto e imágenes.
IBM también puede combinarlo con Docling, una herramienta para analizar documentos. Docling detecta y recorta tablas, gráficos y figuras dentro de PDF de varias páginas, y Granite Vision procesa después cada elemento con más detalle.
El resultado es un flujo que puede automatizar la lectura de grandes colecciones de documentos sin enviar páginas completas al modelo en cada paso.
Cómo mejora la interpretación de gráficos
Los gráficos son difíciles para muchos modelos de visión porque exigen combinar tres cosas: patrones visuales, valores numéricos y lenguaje. No basta con reconocer que una imagen contiene una línea ascendente. El sistema debe saber qué representa cada eje y, cuando sea posible, leer los valores correctos.
Para entrenar esta capacidad, IBM desarrolló ChartNet, un conjunto de datos con 1,7 millones de gráficos de 24 tipos y seis bibliotecas de generación. Cada ejemplo combina cinco elementos relacionados:
- El código utilizado para crear el gráfico.
- La imagen renderizada.
- La tabla de datos original.
- Un resumen en lenguaje natural.
- Preguntas y respuestas sobre su contenido.
Según las evaluaciones publicadas por IBM, Granite 4.0 3B Vision obtuvo un 86,4 % en Chart2Summary, la puntuación más alta entre los modelos comparados en ese benchmark con evaluación mediante otro modelo de lenguaje. En Chart2CSV alcanzó el 62,1 %, por detrás de Qwen3.5-9B, que obtuvo un 63,4 %.
El modelo utiliza además una variante de DeepStack Injection. Esta técnica introduce información visual abstracta en las primeras capas del modelo y detalles espaciales de alta resolución en capas posteriores. Así puede trabajar a la vez con el significado de una página y con la ubicación exacta de sus elementos.
Resultados en tablas y formularios
En extracción de tablas, IBM informa de las siguientes puntuaciones TEDS, una métrica que mide tanto la estructura como el contenido extraído:
- 92,1 en tablas recortadas de PubTables-v2.
- 79,3 en páginas completas de PubTables-v2.
- 64,0 en tablas de páginas completas de OmniDocBench.
- 88,1 en TableVQA-extract.
En el benchmark VAREX, formado por 1.777 formularios del Gobierno de Estados Unidos, logró un 85,5 % de exactitud, sin ejemplos específicos previos. En esta prueba, una respuesta solo cuenta como correcta si los pares clave-valor coinciden exactamente con los datos de referencia.
Qué cambia para ti
La utilidad principal no está en conversar con una imagen, sino en automatizar trabajo documental repetitivo. Una empresa podría usarlo para procesar facturas, revisar informes financieros o hacer buscable la información visual de documentos académicos.
También puede servir en herramientas pequeñas y especializadas, como un lector de formularios o un analizador de gráficos, sin necesidad de construir una plataforma completa. Para grandes volúmenes, la integración con Docling permite trabajar con PDF de varias páginas y enviar al modelo solo las partes relevantes.
Granite 4.0 3B Vision ya está disponible en Hugging Face bajo licencia Apache 2.0. Lo importante será comprobar cómo se comporta con documentos reales, escaneos de baja calidad y diseños que no aparecen en sus benchmarks. La dirección es clara: los modelos de documentos dejan de limitarse a leer palabras y empiezan a convertir la estructura visual de una página en datos utilizables.