olmOCR 2 mejora la lectura de PDFs con IA
Ai2 lanza olmOCR 2, un modelo de IA para convertir PDFs complejos en texto estructurado. Su entrenamiento usa pruebas automáticas para comprobar tablas, fórmulas y orden de lectura, y alcanza 82,4 puntos en la evaluación de la compañía.

Los PDFs con tablas, fórmulas y varias columnas siguen siendo difíciles de convertir en texto fiable. Ai2 presenta olmOCR 2, un modelo de IA que obtiene 82,4 puntos en su prueba de referencia y mejora especialmente en los casos donde los sistemas de OCR suelen fallar.
OCR es la tecnología que reconoce el texto dentro de una imagen o un documento escaneado. El problema es que leer las palabras no basta: también hay que mantener el orden, la estructura de las tablas, las ecuaciones y la relación entre títulos, párrafos y notas.
Qué hace diferente a olmOCR 2
olmOCR 2 analiza cada página completa en una sola pasada. A partir de la imagen, genera directamente:
- Markdown para títulos y estructura del documento.
- HTML para tablas.
- LaTeX para ecuaciones matemáticas.
Esto evita depender de varias herramientas conectadas mediante reglas posteriores. En un documento con dos columnas, por ejemplo, el sistema intenta conservar el orden correcto de lectura en lugar de mezclar una columna con la otra.
El modelo parte de Qwen2.5-VL-7B y se ajustó con olmOCR-mix-1025, un conjunto de 270.000 páginas de PDF que incluye artículos académicos, documentos legales, folletos, archivos históricos y otros formatos. La nueva versión añade 20.000 páginas especialmente difíciles, con textos manuscritos y mecanografiados.
Entrenar la IA con pruebas parecidas a las de un programa
La principal novedad está en cómo se entrenó el modelo. Ai2 convirtió la corrección de un documento en una serie de pruebas automáticas, similares a los unit tests que usan los programadores para comprobar que una función hace lo esperado.
Una prueba puede verificar si:
- La estructura de una tabla se conserva.
- Una ecuación fue transcrita correctamente.
- El orden de lectura es coherente.
- Los metadatos del documento se extrajeron de forma consistente.
Para crear datos de entrenamiento, el equipo tomó páginas reales, las reconstruyó como HTML limpio y generó a partir de ese código los textos y las pruebas correspondientes. El resultado fue un conjunto sintético de 2.186 páginas y 30.381 pruebas verificables, creado a un coste de 0,12 dólares por página.
Después, el modelo generó 28 respuestas para cada documento durante el entrenamiento. Las respuestas que superaban más pruebas recibían una recompensa mayor. Así, el sistema no solo aprendía a producir texto parecido al original, sino a cumplir condiciones concretas de fidelidad.
La misma batería de pruebas se utiliza para medir el resultado final, aunque Ai2 asegura que mantiene separados los datos de entrenamiento y evaluación.
Mejora en tablas, fórmulas y columnas
En la prueba olmOCR-Bench, olmOCR 2 alcanza 82,4 puntos, casi cuatro más que la versión anterior. Según Ai2, supera a herramientas especializadas como Marker, con 76,1 puntos, y MinerU, con 75,8.
Las mejoras más destacadas aparecen en varias categorías:
- Escaneos antiguos con matemáticas: 82,3%, frente al 79,9% anterior.
- Tablas: 84,9%, frente al 72,9%.
- Documentos con varias columnas: 83,7%, frente al 77,3%.
También mejora con documentos históricos. Ai2 pone como ejemplo una carta de Abraham Lincoln de 1864 cuya fecha se interpretaba mal en versiones anteriores por la dificultad de leer su escritura manuscrita.
Qué cambia para ti
La utilidad depende de cómo trabajes con documentos. Una biblioteca podría convertir miles de escaneos históricos en texto buscable. Una empresa podría extraer datos de informes financieros y contratos sin crear reglas distintas para cada plantilla. También puede ayudar a mejorar la accesibilidad de documentos que antes solo podían leerse como imágenes.
El modelo se publica con sus pesos, los conjuntos de datos y el código de entrenamiento y ajuste. Eso permite adaptarlo con una muestra relativamente pequeña de páginas propias, por ejemplo, formularios internos o expedientes con un diseño específico.
La versión cuantizada en FP8, que reduce el uso de memoria, alcanza 3.400 tokens de salida por segundo en una GPU H100. Ai2 calcula que procesar 10.000 páginas cuesta menos de 2 dólares bajo esas condiciones.
El siguiente punto a vigilar no es solo la velocidad, sino su rendimiento fuera del inglés y en documentos todavía más irregulares. La propuesta de olmOCR 2 apunta a una dirección concreta: enseñar a la IA a leer documentos mediante errores que puedan comprobarse, no solo mediante ejemplos cada vez más numerosos.