Construyendo un pipeline OCR de extremo a extremo con Unlimited-OCR de Baidu para imágenes y PDFs
Puntos clave
- •MarkTechPost publicó un tutorial para ejecutar el modelo de lenguaje visual Unlimited-OCR de 3B parámetros de Baidu en imágenes de documentos y PDFs de múltiples páginas dentro de Google Colab.
- •Unlimited-OCR realiza comprensión de documentos de extremo a extremo, reduciendo la dependencia de las etapas separadas de detección de texto, reconocimiento y análisis de diseño que requieren los motores OCR tradicionales.
- •El tutorial compara el modo Gundam, que utiliza recortes de imagen en mosaico para diseños densos, contra el modo Base, que utiliza una sola vista de 1024 píxeles para un procesamiento más rápido de páginas limpias.
- •El pipeline se extiende al análisis de PDFs de múltiples páginas mediante la rasterización de páginas con PyMuPDF y su paso a una función de inferuencia de largo horizonte con controles de repetición ampliados para una decodificación estable.
- •Los resultados pueden exportarse en múltiples formatos estructurados, incluidos Markdown, JSON y MMD, lo que admite flujos de trabajo de documentación, uso programático y renderizado de diagramas.

Un tutorial publicado por MarkTechPost describe cómo construir un flujo de trabajo completo para ejecutar el modelo Unlimited-OCR de Baidu en imágenes de documentos y PDFs de múltiples páginas. El pipeline está diseñado para Google Colab y abarca la configuración del entorno, la instalación de dependencias, la carga del modelo, la generación de documentos de muestra, el OCR de una sola página y el análisis de PDFs de múltiples páginas. Unlimited-OCR forma parte de una tendencia más amplia hacia modelos de lenguaje visual que manejan la comprensión de documentos en un solo sistema de extremo a extremo, reduciendo la necesidad de los pipelines de múltiples etapas —detección de texto, reconocimiento y análisis de diseño— utilizados por los motores OCR tradicionales.
El flujo de trabajo comienza configurando un entorno de ejecución habilitado para GPU e instalando las bibliotecas necesarias para la inferencia de Unlimited-OCR. Verifica que haya una GPU con capacidad CUDA disponible y luego selecciona automáticamente bfloat16 o float16 según el soporte del hardware. El tutorial carga el tokenizador y el modelo de lenguaje visual de 3B parámetros desde Hugging Face, cambia el modelo al modo de evaluación y lo transfiere a la GPU para la inferencia. Alojar el modelo en Hugging Face permite a los desarrolladores cargar pesos preentrenados directamente, eliminando la necesidad de entrenar o ajustar un modelo de reconocimiento de documentos desde cero.
Para crear entradas de prueba reproducibles, el tutorial configura los directorios de entrada y salida requeridos y genera tres páginas de documentos de muestra realistas con PIL. Estas páginas incluyen encabezados, párrafos, tablas y notas al pie, lo que permite al pipeline probar el reconocimiento en contenido estructurado y con diseño complejo en lugar de únicamente bloques de texto simples. La primera página generada se previsualiza con Matplotlib antes de pasarse al flujo de trabajo OCR.
Para el OCR de imágenes individuales, el tutorial utiliza primero el modo Gundam, que combina una vista global del documento con recortes de imagen en mosaico. En esta configuración, se habilita crop_mode y se utiliza un tamaño de mosaico más pequeño para preservar el texto fino y mejorar el reconocimiento en diseños densos. El flujo de trabajo también aplica configuraciones de generación de salida larga y controles de repetición para que el modelo produzca resultados estables y estructurados al procesar documentos complejos.
El mismo documento se procesa luego con el modo Base, que utiliza una sola vista de imagen de 1024 píxeles. El recorte de imágenes se deshabilita en este modo para reducir la complejidad de la inferencia y mejorar la velocidad de procesamiento en páginas limpias y claramente impresas. El tutorial mantiene la misma configuración de longitud de salida y control de repetición para que el modo Base pueda compararse directamente con el modo Gundam bajo parámetros de generación consistentes.
El pipeline se extiende luego desde el OCR de imágenes al análisis de PDFs de múltiples páginas. El tutorial crea un PDF de tres páginas a partir de las imágenes de documentos generadas y utiliza PyMuPDF para rasterizar cada página en un PNG de alta resolución. La secuencia de imágenes de página resultante se pasa a infer_multi(), lo que permite al modelo analizar el documento completo en una sola operación de inferencia de largo horizonte. La ventana de repetición de n-gramas se amplía para mantener una decodificación estable a lo largo de múltiples páginas.
Después de ejecutar tanto la inferencia de una sola página como la de múltiples páginas, el tutorial inspecciona los directorios de salida producidos por el flujo de trabajo. Enumera cada archivo generado y muestra vistas previas de los artefactos compatibles en formato de texto, Markdown, MMD y JSON. También incluye una referencia concisa para seleccionar los modos de inferencia, recomendando diferentes configuraciones para imágenes densas, páginas limpias y PDFs de múltiples páginas. La capacidad de exportar resultados en múltiples formatos estructurados —Markdown para documentación, JSON para uso programático posterior y MMD para renderizado de diagramas— hace que el pipeline sea adaptable a diferentes necesidades de procesamiento de documentos.
El flujo de trabajo completado demuestra cómo Unlimited-OCR puede utilizarse en Google Colab para documentos de una sola página con alto nivel de detalle y PDFs de múltiples páginas más extensos. Compara los modos de inferencia Gundam y Base, convierte PDFs en imágenes de página listas para el modelo, realiza análisis de documentos de largo horizonte y revisa el texto, Markdown y artefactos auxiliares generados desde las carpetas de salida. La configuración también se adapta a diferentes capacidades de GPU mientras conserva los parámetros de generación necesarios para una decodificación estable de documentos extensos.
MarkTechPost señaló que el flujo de trabajo proporciona una base reutilizable para aplicar Unlimited-OCR a informes, formularios escaneados, documentos técnicos, tablas y otro contenido con diseños complejos sin depender de una pila separada de OCR tradicional y análisis de diseño. El código completo del tutorial está disponible en GitHub.