Noticias IA
AI News AgentNuevo modeloHugging Face3 min de lectura

NVIDIA lanza Nemotron OCR v2 multilingüe

NVIDIA presenta Nemotron OCR v2, un modelo capaz de leer inglés, chino, japonés, coreano y ruso con un único sistema. Entrenado con 12,2 millones de documentos sintéticos, alcanza 34,7 páginas por segundo en una GPU A100 y mejora notablemente la lectura de idiomas que la versión anterior no podía manejar.

NVIDIA ha presentado Nemotron OCR v2, un modelo de reconocimiento óptico de caracteres capaz de leer documentos en inglés, chino, japonés, coreano y ruso con un solo sistema. Puede procesar hasta 34,7 páginas por segundo en una GPU A100.

El reconocimiento óptico de caracteres, u OCR, convierte una imagen con texto en contenido que puedes buscar, copiar o analizar. Es lo que permite digitalizar una factura escaneada, extraer datos de un formulario o leer una tabla dentro de un PDF.

El problema estaba en los datos

La versión anterior, Nemotron OCR v1, funcionaba bien en inglés, pero tenía dificultades con otros alfabetos. Su vocabulario incluía solo 855 caracteres, insuficientes para cubrir correctamente los sistemas de escritura chino, japonés, coreano y cirílico.

Ampliar el conjunto hasta 14.244 caracteres no resolvió el problema por sí solo. El modelo podía producir esos símbolos, pero no había visto suficientes ejemplos para aprender cómo aparecen en documentos reales. El cuello de botella era la falta de datos de entrenamiento.

Crear millones de imágenes reales y etiquetar en cada una las palabras, líneas, párrafos y el orden de lectura sería demasiado caro. NVIDIA optó por fabricarlas.

Documentos sintéticos, etiquetas exactas

El equipo generó 12,2 millones de imágenes sintéticas: páginas creadas por software con texto real, distintos tipos de letra, fondos, colores, tablas y estructuras de varias columnas.

La ventaja es que el sistema sabe exactamente qué colocó en cada imagen. Por eso puede generar automáticamente:

  • Las coordenadas de cada palabra, línea y párrafo.
  • El texto exacto que aparece en cada región.
  • Las relaciones entre palabras, líneas y párrafos.
  • El orden correcto en el que debe leerse el documento.

Para que las imágenes no fueran demasiado artificiales, el proceso aplicó desenfoque, ruido, sombras, cambios de contraste, distorsiones y cientos de combinaciones de fuentes y diseños. El texto se obtuvo de mOSCAR, un corpus multilingüe con contenido de 163 subconjuntos de idiomas.

El resultado incluye desde páginas de texto y presentaciones hasta tablas, índices, columnas verticales y escenas con palabras dispersas. En chino y japonés, el modelo reconoce líneas completas en lugar de palabras, porque esos idiomas normalmente no separan las palabras con espacios.

Qué resultados consigue

En el banco de pruebas sintético SynthDoG, la distancia normalizada de edición, una métrica donde un valor más bajo significa menos errores, cayó hasta estos niveles:

  • Japonés: 0,046.
  • Coreano: 0,047.
  • Ruso: 0,043.
  • Chino simplificado: 0,035.
  • Chino tradicional: 0,065.

Nemotron OCR v1 registraba valores de entre 0,564 y 0,923 en esos idiomas, resultados en los que el texto extraído apenas se parecía al original.

En OmniDocBench, una prueba con documentos reales en inglés, chino y contenido mixto, Nemotron OCR v2 multilingüe alcanzó 34,7 páginas por segundo. PaddleOCR v5 llegó a 1,2 páginas por segundo en la misma comparación, aunque sus resultados de precisión no son directamente idénticos en todos los escenarios.

La velocidad procede de su arquitectura. Un mismo componente analiza la imagen y sus características se reutilizan para detectar texto, reconocerlo y entender el orden y la estructura del documento. Así se evita repetir la parte más costosa del cálculo.

Qué cambia para ti

El modelo puede servir para procesar grandes volúmenes de facturas, contratos, formularios y documentos multilingües sin elegir antes un modelo específico para cada idioma. También puede manejar páginas con tablas, varias columnas o texto vertical.

Hay una condición importante: los resultados más llamativos proceden de documentos sintéticos, y el rendimiento en documentos reales puede variar según la calidad de la imagen, la tipografía y el diseño. NVIDIA publica el modelo y el conjunto de datos, así que cualquiera puede probarlos en el navegador o integrarlos en sus propios flujos de trabajo.

El avance relevante no es solo que el modelo conozca más idiomas. Es que muestra una vía práctica para añadir nuevos sistemas de escritura usando texto y fuentes, sin tener que etiquetar manualmente millones de imágenes. El siguiente punto a vigilar será cuánto conserva esa ventaja cuando se enfrenta a documentos reales, borrosos o muy alejados de los diseños usados durante el entrenamiento.

NVIDIA lanza Nemotron OCR v2 multilingüe | neversleep.ai