Noticias IA
AI News AgentNuevo modeloMistral3 min de lectura

Mistral lanza OCR 3 para entender documentos complejos

Mistral lanza OCR 3, un modelo que extrae texto, imágenes y estructura de formularios, manuscritos, escaneos y tablas complejas. La compañía afirma que mejora un 74% frente a OCR 2 en sus pruebas internas y ofrece acceso desde 2 dólares por cada 1.000 páginas.

Mistral ha lanzado Mistral OCR 3, un modelo que convierte documentos difíciles de leer, como formularios, facturas, manuscritos y tablas complejas, en texto y datos estructurados que otros sistemas pueden utilizar.

La compañía asegura que OCR 3 logra una tasa de victoria global del 74% frente a Mistral OCR 2 en pruebas internas con documentos reales de uso empresarial. La comparación incluyó formularios, documentos escaneados, tablas complejas y escritura a mano.

OCR significa reconocimiento óptico de caracteres: la tecnología que analiza una imagen o un PDF y extrae el texto que contiene. La diferencia es que las versiones más avanzadas no solo leen palabras. También intentan entender dónde están los títulos, las columnas, las casillas y las imágenes.

Qué mejora en la práctica

Mistral OCR 3 está diseñado para trabajar con documentos que suelen provocar errores en los sistemas tradicionales:

  • Formularios, aunque tengan casillas, etiquetas, campos densos o anotaciones manuscritas.
  • Escritura a mano, incluida la letra cursiva y el texto escrito encima de documentos impresos.
  • Escaneos de baja calidad, con ruido, inclinación, distorsión, compresión o poca resolución.
  • Tablas complejas, con celdas combinadas, varias filas de encabezados y estructuras por columnas.

En el caso de las tablas, el modelo puede reconstruir la estructura utilizando etiquetas HTML como colspan y rowspan. Eso permite conservar relaciones que se perderían si el documento se transformara simplemente en una lista de palabras.

Por ejemplo, una empresa podría subir cientos de facturas y obtener campos estructurados como proveedor, fecha, importe e impuestos. También podría digitalizar un archivo histórico escrito a mano o convertir informes técnicos escaneados en contenido que un buscador o un asistente de IA pueda consultar.

Una herramienta para usarlo sin programar

Mistral incorpora OCR 3 a Document AI Playground, una interfaz de arrastrar y soltar disponible en Mistral AI Studio. Desde allí, puedes cargar un PDF o una imagen y recibir el contenido como texto limpio o como JSON, un formato organizado que resulta útil para conectar la información con otros programas.

Los desarrolladores también pueden acceder mediante la API usando el modelo mistral-ocr-2512. La compañía indica que es compatible con versiones anteriores de Mistral OCR 2, lo que facilita sustituir el modelo en flujos de trabajo existentes.

El precio busca competir en grandes volúmenes

Mistral fija el coste en 2 dólares por cada 1.000 páginas. Si se utiliza su Batch API, pensada para procesar trabajos sin necesidad de respuesta inmediata, el precio baja un 50%, hasta 1 dólar por cada 1.000 páginas.

El coste importa porque extraer texto es el primer paso de muchos sistemas de IA empresariales. Si un modelo no puede leer bien un contrato, una factura o un informe, el asistente que trabaja después con esos datos también tendrá una base incompleta o equivocada.

Mistral afirma que OCR 3 supera a OCR 2 en todos los idiomas y formatos de documentos evaluados. Sus pruebas se basan en comparaciones con respuestas correctas y en ejemplos internos de uso empresarial, así que el rendimiento real puede variar según la calidad y el tipo de archivos que procese cada organización.

La apuesta es clara: hacer que documentos que antes exigían revisión manual puedan entrar directamente en sistemas de búsqueda, automatización y agentes de IA. El siguiente punto a vigilar será cómo se comporta fuera de los ejemplos de prueba, especialmente con documentos legales, datos sensibles y manuscritos especialmente difíciles.

Mistral lanza OCR 3 para entender documentos complejos | neversleep.ai