新聞宏觀經濟Datalab 發布 Marker 2,在 olmOCR-bench 上取得 76.0%,處理量為 MinerU 管線的 5.4 倍

Datalab 發布 Marker 2,在 olmOCR-bench 上取得 76.0%,處理量為 MinerU 管線的 5.4 倍

作者: MarkTechPost·

重點速覽

  • Marker 2 引入了三條轉換路徑:適用於高品質 GPU 運算的平衡模式、適用於低成本運行的快速模式,以及純 CPU 的無 OCR 模式。
  • Datalab 表示 Marker 2 平衡模式在 olmOCR-bench 上整體得分為 76.0%,在單一 B200 GPU 上達到每秒 2.9 頁。
  • 文中引用的 Marker、MinerU、Docling 和 LiteParse 的基準測試數據,均來自 Datalab 使用 Ai2 第三方 olmOCR-bench 測試框架自行執行的結果。
  • 此次更新引入了重大變更,包括最低要求 Python 3.10、從 Poetry 遷移至 uv 並使用 hatchling 作為建構後端,以及移除結構化提取轉換器。
  • Marker 的程式碼採用 Apache 2.0 授權,而其模型權重在超過指定的新創融資或營收門檻後,商用需取得付費授權。
Datalab 發布 Marker 2,在 olmOCR-bench 上取得 76.0%,處理量為 MinerU 管線的 5.4 倍

Datalab 發布了 Marker 2,這是對其開源文件轉換管線的全面重寫,可將 PDF、圖像、PPTX、DOCX、XLSX、HTML 和 EPUB 檔案轉換為 markdown、JSON、HTML 或區塊。準確且快速的文件轉換已成為企業 AI 管線的關鍵瓶頸——尤其是依賴從真實文件中提取乾淨結構化文字的檢索增強生成(RAG)系統和 LLM 資料擷取工作流程。

此次更新以 Datalab 近月發布的三個元件為基礎重建 Marker:Surya OCR 2、快速的 20M 參數布局模型,以及該公司表示比前一版本快 3 倍的重建版 pdftext 元件。

Datalab 引用的主要基準測試結果來自 olmOCR-bench,這是 Allen AI 提供的第三方基準測試。在 Datalab 的測試中,Marker 2 的平衡模式整體得分為 76.0%,在原生數位 PDF 上為 83.5%。它在單一 B200 GPU 上維持每秒 2.9 頁的處理速度。Datalab 表示這超過 MinerU 管線後端處理量的 5 倍,後者得分為 72.7%,處理速度為每秒 0.54 頁。Docling 在同一測試框架中得分為 50.3%,處理速度為每秒 2.1 頁。

Marker 2 is out now – up to 5x faster and more accurate than mineru, docling, and liteparse with similar configs. Converts pdfs, images, docx to markdown. CPU + GPU compatible, up to 27 pages/s. pic.twitter.com/75nMipDaZ7 — Vik Paruchuri (@VikParuchuri) July 21, 2026

Marker 2 is out now – up to 5x faster and more accurate than mineru, docling, and liteparse with similar configs. Converts pdfs, images, docx to markdown. CPU + GPU compatible, up to 27 pages/s. pic.twitter.com/75nMipDaZ7

Marker 2 的主要變更

Marker 2 現在提供三條轉換路徑,而非單一路徑。

平衡模式使用 Surya VLM 處理布局,並在嵌入式文字品質不佳時對整頁重新進行 OCR。Datalab 將其描述為最高品質的選項,最適合 GPU 使用。它在 olmOCR-bench 上得分為 76.0%。

快速模式使用輕量級 rf-detr/onnx 布局偵測器搭配 pdftext,並最小化且精準地使用 VLM。它得分為 66.6%,設計目的是降低運行成本。

--disable_ocr 模式執行純文字層提取,不進行任何 VLM 呼叫。它完全在 CPU 上運行,得分為 43.6%,達到每秒 23.7 頁。

模式選擇現在預設具備裝置感知能力:GPU 上使用平衡模式,CPU 或 MPS 上使用快速模式,同時仍允許使用者透過 --mode 覆寫設定。完整的 CPU 支援是另一項結構性變更。快速 --disable_ocr 路徑不需要 GPU 或推理伺服器,且 20M 參數布局模型仍可在 CPU 上讀取欄位、表格和標題。

Datalab 表示第三項重大變更屬於架構層面,也是產生高效處理量數據的關鍵。多個輕量級 CPU 工作程序共享單一 Surya 推理伺服器。父程序在這些工作程序之間分配 VLM 並發預算,因此處理量隨伺服器容量擴展,而非受限於單一程序的 VRAM。Datalab 報告指出,平衡模式在同一硬體上維持約每秒 2.9 頁的處理量,而單一串流速率約為每秒 0.3 頁。

此次更新也引入了重大變更。現在最低要求 Python 3.10。套件管理已從 Poetry 遷移至 uv,並使用 hatchling 作為建構後端,不過 pip install marker-pdf 的指令保持不變。結構化提取轉換器和提取器已被移除;Datalab 引導使用者改用託管 API 或 --use_llm 工作流程。

基準測試背景

評分基準測試為 Ai2 的 olmOCR-bench。它包含 1,403 份 PDF,約有 8,400 個通過/失敗單元測試,涵蓋數學公式渲染、表格結構、閱讀順序、頁首和頁尾,以及舊式掃描文件。整體分數為八個類別的巨集平均值,使用官方 olmOCR-bench 檢查工具計算。處理量以單一 B200 主機上的持續並發每秒頁數衡量,而非單一串流延遲。

Datalab 指出 olmOCR-bench 是 Ai2 提供的第三方基準測試,但文中引用的 Marker、MinerU、Docling 和 LiteParse 的分數和處理量數據均來自 Datalab 自行的測試。該公司表示,這些結果可透過 Marker 儲存庫中的開源測試框架重現,該框架附帶 MinerU、Docling 和 LiteParse 的競爭對手執行器以及 Marker 自己的執行器。

這些數據也反映了單一基準測試的文件組合在單一硬體設定上的表現。在其他文件集上的結果可能有所不同,評估這些系統的團隊需要針對自己的語料庫運行測試框架,才能確定各工具在其實際處理的文件上的排名。

Marker 2 與 MinerU

MinerU 的管線後端是最接近的架構比較對象,因為兩者都讀取 PDF 文字層並選擇性地執行 OCR。在整體分數上,Marker 平衡模式以 76.0 比 72.7 領先。在原生數位文件上,兩者幾乎持平,Marker 為 83.5,MinerU 為 83.3。

更大的差異在於處理量。Marker 平衡模式維持每秒 2.9 頁,而 MinerU 為每秒 0.54 頁,差距達 5.4 倍,同時整體分數也更高。Marker 快速模式維持每秒 7.4 頁,約為 MinerU 管線速率的 13.7 倍,但分數比 MinerU 低 6.1 分。

MinerU 還提供 VLM 後端,Datalab 表示其得分高於 MinerU 的管線後端。該後端採用全頁 VLM 方法,未包含在文中引用的比較表中。Datalab 表示,評估 MinerU 的團隊應另行針對該路徑進行基準測試。

Marker 2 與 Docling

在 Datalab 的比較中,Docling 在 GPU 管線之間的差距最大。Marker 平衡模式在整體分數上以 76.0 比 50.3 領先,在原生數位文件上以 83.5 比 64.0 領先。在所報告的設定中,Marker 的運行速度也更快,為每秒 2.9 頁,而 Docling 為每秒 2.1 頁。

Datalab 表示 Docling 是在其預設管線上運行的,該管線對原生數位頁面使用文字層,對圖像區域使用 OCR。

在此比較中,Docling 的優勢在於治理和格式廣度,而非基準測試準確度。其程式碼庫採用 MIT 授權,源自 IBM Research,並作為 LF AI & Data Foundation 的專案託管。其輸入支援也超越文件範疇,延伸至音訊和電子郵件格式。

Marker 2 與 LiteParse

LiteParse 來自 LlamaIndex 團隊,是一個 Rust 文件解析器,與 Marker 不在同一軸線上競爭。在 CPU 上,LiteParse 整體得分為 22.4,停用 OCR 時為 20.4,而 Marker 純 CPU 得分為 43.6。

LiteParse 在停用 OCR 時報告每秒 1721 頁,約為 Marker CPU 模式的 73 倍。這正是比較中的核心取捨。Marker 的快速 --disable_ocr 模式在 CPU 上運行 20M 參數布局模型,仍能還原結構,Datalab 表示這也是其得分超過純文字傾印兩倍以上的原因。根據來源文章,LiteParse 沒有布局模型,在非線性文件上表現不佳。

Marker 2 與全頁 VLM 系統

Datalab 強調 Marker 的設計定位是管線而非 VLM,並將兩者描述為不同的工具類別。在該公司的評估中,其託管的 Chandra 2 得分為 85.8,而透過 API 使用的 Gemini Flash 3.5 得分為 76.4。Datalab 的 Chandra 儲存庫在另一張表中將 Ai2 的 olmOCR 2 列為 82.4,dots.ocr 1.5 列為 83.9。

對於掃描文件、數學密集頁面和追求最高準確度,Datalab 表示 VLM 層級仍然領先所有列出的管線。在引用的結果中,Marker 平衡模式整體僅落後 Gemini Flash 3.5 0.4 分,在原生數位文件上甚至以 83.5 比 79.1 超越 Gemini Flash 3.5,且無需逐頁 API 呼叫。管線與 VLM 之間的取捨是文件 AI 工具領域中反覆出現的設計議題,管線通常提供較低的每頁成本和本地部署能力,而基於 VLM 的方法在最困難的文件類型上領先。

類別層級結果

選擇的模式不僅改變分數,也改變失敗特徵。在 Datalab 引用的 olmOCR-bench 類別中,數學是非平衡模式最尖銳的限制。快速模式從 PDF 文字層讀取方程式,而非使用 VLM 進行 OCR,因此 arXiv 數學從 83.9 降至 23.4。--disable_ocr 模式在該類別中按設計得分為 0.0。

在兩個數學類別之外,舊式掃描文件是每個模式中最弱的分項,最佳結果最高僅達 43.2。

授權

四個系統在商業團隊適用的授權方面差異顯著。

Marker 的程式碼採用 Apache 2.0 授權。其模型權重使用修改版的 AI Pubs OpenRAIL-M 授權——對研究、個人使用以及融資或營收低於 500 萬美元的新創公司免費。超過此門檻,權重的商業使用需要付費授權。

MinerU 現在採用 MinerU 開源授權,以 Apache 2.0 為基礎並附加額外條件。超過 1 億月活躍用戶或 2,000 萬美元月營收時需要單獨的商業授權,且基於它構建的線上服務必須揭露此事實。

Docling 採用 MIT 授權,模型授權在各原始套件中單獨追蹤。

LiteParse 是 run-llama 的開源專案,LlamaParse 則定位為處理困難文件的付費雲端方案。

這些專案的授權概況反映了更廣泛的產業趨勢:開源 AI 工具日益將寬鬆的程式碼授權與更嚴格或商業化的模型權重條款搭配使用,反映了開放發布與訓練模型變現之間的張力。

引用的主要來源包括:olmOCR-bench 儲存庫 https://github.com/allenai/olmocr/tree/main/olmocr/bench、Marker 2 發布說明 https://github.com/datalab-to/marker/releases/tag/v2.0.0、Datalab 部落格文章 https://x.com/VikParuchuri/status/2079545884681830784