Datalab发布Marker 2,在olmOCR-bench上得分76.0%,吞吐量为MinerU的5.4倍
要点速览
- •Marker 2引入三种转换路径:适合高质量GPU使用的平衡模式、适合低成本的快速模式,以及仅CPU的无OCR模式。
- •Datalab表示Marker 2平衡模式在olmOCR-bench上总分76.0%,在单块B200 GPU上达到每秒2.9页。
- •所引用的Marker、MinerU、Docling和LiteParse的基准数据均来自Datalab使用Ai2第三方olmOCR-bench框架的自行测试。
- •该版本带来破坏性变更,包括Python 3.10最低要求、从Poetry迁移到uv并使用hatchling,以及移除结构化提取转换器。
- •Marker的代码采用Apache 2.0许可证,其模型权重在超过指定初创公司资金或收入阈值时需要商业付费许可。

Datalab发布了Marker 2,这是对其开源文档转换管线的全面重写,可将PDF、图像、PPTX、DOCX、XLSX、HTML和EPUB文件转换为markdown、JSON、HTML或文本块。准确快速的文档转换已成为企业AI管线中的关键瓶颈——尤其是依赖于从真实文档中提取干净结构化文本的检索增强生成(RAG)系统和LLM数据摄取工作流。
该版本围绕Datalab近几个月发布的三个组件重新构建了Marker:Surya OCR 2、一个快速的2000万参数布局模型,以及一个重新构建的pdftext组件(该公司称其比之前版本快3倍)。
Datalab引用的主要基准测试结果来自Allen AI的第三方基准测试olmOCR-bench。在Datalab的测试中,Marker 2的平衡模式总分为76.0%,在原生数字PDF上为83.5%。它在单块B200 GPU上保持每秒2.9页的处理速度。Datalab表示,这超过MinerU管线后端吞吐量的5倍,后者得分为72.7%,每秒0.54页。Docling在同一测试框架下得分为50.3%,每秒2.1页。
Marker 2现已发布——在类似配置下比mineru、docling和liteparse快达5倍且更准确。将pdf、图像、docx转换为markdown。兼容CPU和GPU,最高达27页/秒。pic.twitter.com/75nMipDaZ7 — Vik Paruchuri (@VikParuchuri) 2026年7月21日
Marker 2现已发布——在类似配置下比mineru、docling和liteparse快达5倍且更准确。将pdf、图像、docx转换为markdown。兼容CPU和GPU,最高达27页/秒。pic.twitter.com/75nMipDaZ7
Marker 2的变化
Marker 2现在提供三种转换路径,而非单一路径。
平衡模式使用Surya VLM处理布局,当嵌入文本质量差时对整页进行重新OCR。Datalab将其描述为最高质量的选项,最适合GPU使用。它在olmOCR-bench上得分76.0%。
快速模式使用轻量级rf-detr/onnx布局检测器加pdftext,仅在必要时有针对性地使用VLM。它得分66.6%,设计上运行成本更低。
--disable_ocr模式执行纯文本层提取,不调用VLM。它完全在CPU上运行,得分43.6%,达到每秒23.7页。
模式选择现在默认感知设备:GPU上使用平衡模式,CPU或MPS上使用快速模式,同时仍允许用户通过--mode覆盖设置。完整的CPU支持是另一项结构性变化。快速--disable_ocr路径不需要GPU或推理服务器,2000万参数布局模型仍可在CPU上读取列、表格和标题。
Datalab表示,第三项主要变化是架构层面的,也是吞吐量数据的来源。多个轻量级CPU工作进程共享一个Surya推理服务器。父进程在这些工作进程之间分配VLM并发预算,因此吞吐量随服务器容量扩展,而非受限于单进程VRAM。Datalab报告称,平衡模式在同一硬件上保持约每秒2.9页的吞吐量,而单流速率约为每秒0.3页。
该版本还引入了破坏性变更。现在要求Python 3.10或更高版本。打包工具从Poetry迁移到uv,构建后端为hatchling,但pip install marker-pdf保持不变。结构化提取转换器和提取器已被移除;Datalab建议用户使用托管API或--use_llm工作流替代。
基准测试背景
评分基准是来自Ai2的olmOCR-bench。它包含1,403个PDF和大约8,400个通过/失败单元测试,涵盖数学公式渲染、表格结构、阅读顺序、页眉页脚和旧扫描件。总分是8个类别的宏平均值,使用官方olmOCR-bench检查器计算。吞吐量以单台B200主机上的持续并发每秒页数衡量,而非单流延迟。
Datalab指出,olmOCR-bench是来自Ai2的第三方基准测试,但所引用的Marker、MinerU、Docling和LiteParse的得分和吞吐量数据均来自Datalab自己的运行。该公司表示,这些结果可通过Marker仓库中的开放测试框架复现,该框架包含MinerU、Docling和LiteParse的竞争者运行器以及Marker自身的运行器。
这些数据也反映了单一基准测试的文档组合在单一硬件配置上的表现。在其他文档集上结果可能不同,评估这些系统的团队需要在自己的语料库上运行测试框架,以确定这些系统在其实际处理的文档上的排名。
Marker 2与MinerU
MinerU的管线后端是最接近的架构对比对象,因为两个系统都读取PDF文本层并选择性应用OCR。在总分方面,Marker平衡模式领先,76.0对72.7。在原生数字文档上,两者几乎持平,Marker为83.5,MinerU为83.3。
更大的差异在于吞吐量。Marker平衡模式保持每秒2.9页,而MinerU为每秒0.54页,在更高得分的同时实现了5.4倍的差距。Marker快速模式保持每秒7.4页,约为MinerU管线速率的13.7倍,但得分比MinerU低6.1分。
MinerU还提供VLM后端,Datalab表示该后端得分高于MinerU的管线后端。该后端使用全页VLM方法,未包含在文章引用的对比表中。Datalab表示,评估MinerU的团队应单独对该路径进行基准测试。
Marker 2与Docling
在Datalab的对比中,Docling在GPU管线中差距最大。Marker平衡模式在总分上领先76.0对50.3,在原生数字文档上83.5对64.0。在所报告的配置中,Marker运行速度也更快,每秒2.9页而Docling为每秒2.1页。
Datalab表示,Docling在其默认管线上运行,该管线对原生数字页面使用文本层,对图像区域使用OCR。
Docling的优势在于治理和格式广度,而非此次对比中的基准准确率。其代码库采用MIT许可证,起源于IBM Research,并作为LF AI & Data Foundation的项目托管。其输入支持也超越了文档,扩展到音频和电子邮件格式。
Marker 2与LiteParse
LiteParse来自LlamaIndex团队,是一个Rust文档解析器,与Marker不在同一维度上竞争。在CPU上,LiteParse总分22.4,关闭OCR时为20.4,而Marker仅CPU模式为43.6。
关闭OCR时,LiteParse报告每秒1,721页,约为Marker CPU模式的73倍。这是对比中的核心权衡。Marker的快速--disable_ocr模式在CPU上运行2000万参数布局模型并仍能恢复结构,Datalab表示这也是为什么其得分超过纯文本转储的两倍以上。LiteParse没有布局模型,在非线性文档上表现不佳。
Marker 2与全页VLM系统
Datalab强调,Marker被设计为管线而非VLM,将两者描述为不同的工具类别。在该公司的评估中,其托管的Chandra 2得分85.8,而通过API使用的Gemini Flash 3.5得分76.4。Datalab的Chandra仓库还在单独的表格中将Ai2的olmOCR 2列为82.4,dots.ocr 1.5列为83.9。
对于扫描件、数学密集型页面和追求最高准确率的场景,Datalab表示VLM层仍领先于所有列出的管线。在引用的结果中,Marker平衡模式在总分上仅落后Gemini Flash 3.5 0.4分,在原生数字文档上甚至以83.5对79.1领先Gemini Flash 3.5——且不需要逐页API调用。管线与VLM之间的权衡是文档AI工具领域中反复出现的设计问题,管线通常提供更低的每页成本和本地部署能力,而基于VLM的方法在最难的文档类型上领先。
类别级结果
所选模式不仅改变总得分,还改变失败特征。在Datalab引用的olmOCR-bench类别中,数学是非平衡模式最突出的限制。快速模式从PDF文本层读取公式而非通过VLM进行OCR,因此arXiv数学从83.9降至23.4。--disable_ocr模式在该类别中设计上得分为0.0。
在两个数学类别之外,旧扫描件是每种模式中最弱的分支,最佳结果上限为43.2。
许可证
对于商业团队而言,这四个系统在许可证方面差异显著。
Marker的代码采用Apache 2.0许可证。其模型权重使用修改版的AI Pubs OpenRAIL-M许可证——对研究、个人使用以及资金/收入低于500万美元的初创公司免费。超过该阈值,商业使用权重需要付费许可证。
MinerU现在采用MinerU开源许可证,基于Apache 2.0并附加条件。超过1亿月活跃用户或2,000万美元月收入时需要单独的商业许可证,基于其构建的在线服务必须披露该事实。
Docling采用MIT许可证,模型许可证在其原始包中单独跟踪。
LiteParse是来自run-llama的开源项目,LlamaParse定位为处理困难文档的付费云路径。
这些项目的许可证格局反映了一个更广泛的行业趋势:开源AI工具越来越多地将宽松的代码许可证与对模型权重更具限制性或商业性的条款相结合,反映了开放分发与训练模型变现之间的矛盾。
引用的主要来源包括olmOCR-bench仓库 https://github.com/allenai/olmocr/tree/main/olmocr/bench、Marker 2发布说明 https://github.com/datalab-to/marker/releases/tag/v2.0.0、Datalab博客文章 https://x.com/VikParuchuri/status/2079545884681830784。