NoticiasMacroDatalab lanza Marker 2 con 76.0% en olmOCR-bench y 5.4× el rendimiento del pipeline de MinerU

Datalab lanza Marker 2 con 76.0% en olmOCR-bench y 5.4× el rendimiento del pipeline de MinerU

Autor: MarkTechPost·

Puntos clave

  • Marker 2 introduce tres rutas de conversión: modo balanceado para uso en GPU de mayor calidad, modo rápido para ejecuciones de menor costo y un modo sin OCR exclusivo de CPU.
  • Datalab indica que el modo balanceado de Marker 2 obtuvo una puntuación general del 76.0% en olmOCR-bench y alcanzó 2.9 páginas por segundo en una sola GPU B200.
  • Las cifras de benchmark citadas para Marker, MinerU, Docling y LiteParse provienen de las propias ejecuciones de Datalab utilizando la plataforma olmOCR-bench de terceros de Ai2.
  • La versión incorpora cambios importantes, incluyendo un requisito mínimo de Python 3.10, una transición de Poetry a uv con hatchling y la eliminación de los convertidores de extracción estructurada.
  • El código de Marker tiene licencia Apache 2.0, mientras que sus pesos de modelo requieren una licencia de pago para uso comercial por encima de los umbrales especificados de financiación o ingresos de startups.
Datalab lanza Marker 2 con 76.0% en olmOCR-bench y 5.4× el rendimiento del pipeline de MinerU

Datalab ha publicado Marker 2, una reescritura completa de su canal de conversión de documentos de código abierto para transformar archivos PDF, imágenes, PPTX, DOCX, XLSX, HTML y EPUB en markdown, JSON, HTML o fragmentos. La conversión precisa y rápida de documentos se ha convertido en un cuello de botella crítico para los flujos de IA empresarial, en particular para los sistemas de generación aumentada por recuperación (RAG) y los flujos de ingesta de datos de LLM que dependen de texto estructurado y limpio extraído de documentos del mundo real.

La versión reconstruye Marker en torno a tres componentes que Datalab lanzó en los meses anteriores: Surya OCR 2, un modelo de diseño rápido de 20M de parámetros, y un componente pdftext reconstruido que, según la empresa, es 3 veces más rápido que su versión anterior.

El principal resultado de benchmark citado por Datalab proviene de olmOCR-bench, un benchmark de terceros de Allen AI. En las ejecuciones de Datalab, el modo balanceado de Marker 2 obtiene una puntuación general del 76.0% y del 83.5% en PDF nacidos en formato digital. Mantiene un rendimiento de 2.9 páginas por segundo en una sola GPU B200. Datalab indica que esto es más de 5 veces el rendimiento del backend del pipeline de MinerU, que obtiene una puntuación del 72.7% a 0.54 páginas por segundo. Docling obtiene una puntuación del 50.3% a 2.1 páginas por segundo en la misma plataforma de pruebas.

Marker 2 is out now – up to 5x faster and more accurate than mineru, docling, and liteparse with similar configs. Converts pdfs, images, docx to markdown. CPU + GPU compatible, up to 27 pages/s. pic.twitter.com/75nMipDaZ7 — Vik Paruchuri (@VikParuchuri) July 21, 2026

Marker 2 is out now – up to 5x faster and more accurate than mineru, docling, and liteparse with similar configs. Converts pdfs, images, docx to markdown. CPU + GPU compatible, up to 27 pages/s. pic.twitter.com/75nMipDaZ7

Novedades de Marker 2

Marker 2 ahora ofrece tres rutas de conversión en lugar de una sola.

El modo balanceado utiliza el VLM Surya para el diseño, y la página completa se vuelve a procesar con OCR cuando el texto incrustado es de mala calidad. Datalab lo describe como la opción de mayor calidad y la más adecuada para uso con GPU. Obtiene una puntuación del 76.0% en olmOCR-bench.

El modo rápido utiliza un detector de diseño ligero rf-detr/onnx junto con pdftext, con un uso mínimo y selectivo del VLM. Obtiene una puntuación del 66.6% y está diseñado para ser más económico de ejecutar.

El modo --disable_ocr realiza una extracción pura de la capa de texto sin llamadas al VLM. Se ejecuta completamente en CPU, obtiene una puntuación del 43.6% y alcanza 23.7 páginas por segundo.

La selección del modo ahora es consciente del dispositivo por defecto: balanceado en GPU y rápido en CPU o MPS, aunque todavía permite a los usuarios anular la configuración con --mode. El soporte completo de CPU es otro cambio estructural. La ruta rápida --disable_ocr no requiere GPU ni servidor de inferencia, y el modelo de diseño de 20M de parámetros aún lee columnas, tablas y encabezados en CPU.

Datalab indica que el tercer cambio importante es arquitectónico y es el responsable de los resultados de rendimiento. Múltiples procesos ligeros de CPU comparten un único servidor de inferencia Surya. El proceso principal gestiona la concurrencia del VLM entre esos procesos, por lo que el rendimiento escala con la capacidad del servidor en lugar de con la VRAM por proceso. Datalab reporta que el modo balanceado mantiene aproximadamente 2.9 páginas por segundo en comparación con una tasa de flujo único de aproximadamente 0.3 páginas por segundo en el mismo hardware.

La versión también introduce cambios importantes. Ahora se requiere Python 3.10 o superior. El empaquetado ha pasado de Poetry a uv, con hatchling como backend de compilación, aunque pip install marker-pdf permanece sin cambios. El convertidor de extracción estructurada y los extractores han sido eliminados; Datalab dirige a los usuarios a la API hospedada o a un flujo de trabajo --use_llm en su lugar.

Contexto del benchmark

El benchmark de evaluación es olmOCR-bench de Ai2. Incluye 1,403 PDF y aproximadamente 8,400 pruebas unitarias de aprobación/reprobación que cubren renderización de fórmulas matemáticas, estructura de tablas, orden de lectura, encabezados y pies de página, y documentos antiguos escaneados. La puntuación general es el promedio macro entre ocho categorías, calculada con el verificador oficial de olmOCR-bench. El rendimiento se mide como páginas sostenidas concurrentes por segundo en un host B200, no como latencia de flujo único.

Datalab señala que olmOCR-bench es un benchmark de terceros de Ai2, pero las puntuaciones y cifras de rendimiento citadas para Marker, MinerU, Docling y LiteParse provienen de las propias ejecuciones de Datalab. La empresa indica que los resultados son reproducibles a través de la plataforma de pruebas abierta en el repositorio de Marker, que incluye ejecutores para los competidores MinerU, Docling y LiteParse junto con el propio de Marker.

Las cifras también reflejan la mezcla de documentos de un solo benchmark en una única configuración de hardware. Los resultados pueden diferir en otros conjuntos de documentos, y los equipos que evalúan los sistemas necesitarían ejecutar la plataforma de pruebas contra su propio corpus para determinar las clasificaciones de sus documentos.

Marker 2 y MinerU

El backend del pipeline de MinerU es la comparación arquitectónica más cercana porque ambos sistemas leen la capa de texto del PDF y aplican OCR de manera selectiva. Marker en modo balanceado lidera en puntuación general, 76.0 frente a 72.7. En documentos nacidos en formato digital, ambos están prácticamente empatados, con Marker en 83.5 y MinerU en 83.3.

La mayor diferencia está en el rendimiento. El modo balanceado de Marker mantiene 2.9 páginas por segundo frente a las 0.54 páginas por segundo de MinerU, una diferencia de 5.4× con una puntuación general también superior. El modo rápido de Marker mantiene 7.4 páginas por segundo, aproximadamente 13.7× la tasa del pipeline de MinerU, pero obtiene una puntuación 6.1 puntos por debajo de MinerU.

MinerU también ofrece un backend VLM, que según Datalab obtiene una puntuación más alta que su backend de pipeline. Ese backend utiliza un enfoque de VLM de página completa y no se incluyó en la tabla de comparación citada en el artículo. Datalab indica que los equipos que evalúan MinerU deberían evaluar esa ruta por separado.

Marker 2 y Docling

Docling presenta el mayor margen entre los pipelines de GPU en la comparación de Datalab. El modo balanceado de Marker lidera 76.0 a 50.3 en la puntuación general y 83.5 a 64.0 en documentos nacidos en formato digital. Marker también se ejecuta más rápido en la configuración reportada, a 2.9 páginas por segundo frente a las 2.1 páginas por segundo de Docling.

Datalab señala que Docling se ejecutó en su pipeline predeterminado, que utiliza la capa de texto para páginas nacidas en formato digital y OCR para regiones de imágenes.

El contrapeso de Docling es la gobernanza y la amplitud de formatos más que la precisión del benchmark en esta comparación. Su base de código tiene licencia MIT, se originó en IBM Research y está hospedado como un proyecto en la LF AI & Data Foundation. Su soporte de entrada también se extiende más allá de los documentos a formatos de audio y correo electrónico.

Marker 2 y LiteParse

LiteParse, del equipo de LlamaIndex, es un analizador de documentos en Rust y no compite en el mismo eje que Marker. En CPU, LiteParse obtiene una puntuación general de 22.4 y de 20.4 con OCR desactivado, en comparación con la puntuación de 43.6 de Marker exclusivamente en CPU.

LiteParse con OCR desactivado reporta 1721 páginas por segundo, aproximadamente 73× el modo CPU de Marker. Ese es el intercambio central en la comparación. El modo rápido --disable_ocr de Marker ejecuta un modelo de diseño de 20M de parámetros en CPU y aún recupera la estructura, lo cual, según Datalab, es el motivo por el que más que duplica la puntuación de un volcado de texto plano. LiteParse no tiene modelo de diseño y tiene un rendimiento deficiente en documentos no lineales, según el artículo fuente.

Marker 2 y los sistemas VLM de página completa

Datalab enfatiza que Marker está diseñado como un pipeline en lugar de un VLM, describiendo ambos como categorías de herramientas distintas. En la evaluación de la empresa, su Chandra 2 hospedado obtiene 85.8, mientras que Gemini Flash 3.5 vía API obtiene 76.4. El repositorio Chandra de Datalab también ubica a olmOCR 2 de Ai2 en 82.4 y a dots.ocr 1.5 en 83.9 en una tabla separada.

Para documentos escaneados, páginas con mucho contenido matemático y máxima precisión, Datalab indica que el nivel VLM sigue por delante de todos los pipelines listados. El modo balanceado de Marker está a solo 0.4 puntos por detrás de Gemini Flash 3.5 en la puntuación general de los resultados citados y por delante de Gemini Flash 3.5 en documentos nacidos en formato digital, 83.5 frente a 79.1, sin requerir una llamada a la API por página. El intercambio entre pipeline y VLM es una pregunta de diseño recurrente en el panorama de herramientas de IA para documentos, donde los pipelines generalmente ofrecen un costo por página más bajo y despliegue local, mientras que los enfoques basados en VLM lideran en los tipos de documentos más difíciles.

Resultados por categoría

El modo seleccionado cambia el perfil de errores además de la puntuación general. En las categorías de olmOCR-bench citadas por Datalab, las matemáticas son la limitación más pronunciada para los modos no balanceados. El modo rápido lee las ecuaciones de la capa de texto del PDF en lugar de procesarlas con VLM-OCR, por lo que las matemáticas de arXiv caen de 83.9 a 23.4. El modo --disable_ocr obtiene 0.0 en esa categoría por diseño.

Fuera de las dos categorías de matemáticas, los documentos antiguos escaneados son la categoría más débil en todos los modos, con el mejor resultado alcanzando un máximo de 43.2.

Licencias

Los cuatro sistemas difieren significativamente en licencias para equipos comerciales.

El código de Marker tiene licencia Apache 2.0. Sus pesos de modelo utilizan una licencia modificada AI Pubs OpenRAIL-M que es gratuita para investigación, uso personal y startups con menos de 5 millones de dólares en financiación o ingresos. Más allá de ese umbral, el uso comercial de los pesos requiere una licencia de pago.

MinerU ahora está bajo la MinerU Open Source License, basada en Apache 2.0 con condiciones adicionales. Se requiere una licencia comercial separada por encima de los 100 millones de usuarios activos mensuales o 20 millones de dólares en ingresos mensuales, y los servicios en línea basados en él deben divulgar ese hecho.

Docling tiene licencia MIT, con licencias de modelo rastreadas por separado en sus paquetes originales.

LiteParse es de código abierto de run-llama, con LlamaParse posicionado como la ruta de nube de pago para documentos difíciles.

El panorama de licencias entre estos proyectos refleja un patrón más amplio de la industria en el que las herramientas de IA de código abierto combinan cada vez más licencias de código permisivas con términos más restrictivos o comerciales sobre los pesos de los modelos, reflejando la tensión entre la distribución abierta y la monetización de modelos entrenados.

Las fuentes primarias citadas incluyen el repositorio de olmOCR-bench en https://github.com/allenai/olmocr/tree/main/olmocr/bench, las notas de la versión de Marker 2 en https://github.com/datalab-to/marker/releases/tag/v2.0.0, la publicación del blog de Datalab en y el tuit de anuncio en https://x.com/VikParuchuri/status/2079545884681830784.