ニュースマクロDatalab Marker v2 vs MinerU, Docling, LiteParse:ベンチマーク詳細比較

Datalab Marker v2 vs MinerU, Docling, LiteParse:ベンチマーク詳細比較

著者: MarkTechPost·

重要ポイント

  • Marker v2は3つの変換モードを追加:GPUベースの高品質向けbalanced、低コスト処理向けfast、CPU専用のno-OCRモード。
  • Datalabは、Ai2のolmOCR-benchでMarker v2のbalancedモードが全体で76.0%、ボーンデジタルPDFで83.5%を獲得したと報告。
  • Marker balancedモードは単一のB200 GPUで毎秒2.9ページを処理し、MinerUのパイプラインバックエンドの毎秒0.54ページと比較。
  • 本リリースはPython 3.10以降を必要とし、構造化抽出コンバーターとエクストラクターを削除。
  • Datalabはベンチマーク結果がオープンハーネスで再現可能と述べているが、チームは独自のドキュメントセットと制約に対してテストすべき。
Datalab Marker v2 vs MinerU, Docling, LiteParse:ベンチマーク詳細比較

Datalabは、オープンソースのドキュメント変換パイプラインを完全に書き換えたMarker v2をリリースしました。Markerは、PDF、画像、PPTX、DOCX、XLSX、HTML、EPUBファイルをMarkdown、JSON、HTML、またはチャンクに変換します。これらは、検索拡張生成(RAG)システム、LLMトレーニングデータの準備、解析精度が下流のモデルパフォーマンスを左右するエンタープライズナレッジパイプラインの直接入力として使用される出力形式です。Datalabチームは、過去数ヶ月にわたってリリースされた3つのコンポーネントを中心にツールを再構築しました:Surya OCR 2、20Mパラメータの高速レイアウトモデル、および従来より3倍高速な再構築されたpdftextエンジンです。

主要なベンチマーク結果は、Allen AI(Ai2)が作成したサードパーティベンチマークであるolmOCR-benchから得られています。Marker v2のbalancedモードは、全体で76.0%、ボーンデジタルPDFで83.5%を達成し、単一のB200 GPUで毎秒2.9ページを維持します。このスループットは、毎秒0.54ページで72.7%を記録するMinerUのパイプラインバックエンドの5倍以上の速度を表しています。Doclingは同じハーネスで毎秒2.1ページ、50.3%を記録しています。

Marker v2の新機能

Marker v2は3つの変換モードを導入しています:

  • Balanced — Surya VLMがレイアウトを処理し、埋め込みテキストの品質が低い場合はページ全体の再OCRがトリガーされます。最も高品質なモードで、GPU向けに最適化されています。olmOCR-benchで76.0%を達成。
  • Fast — 軽量なrf-detr/onnxレイアウト検出器とpdftextを組み合わせ、最小限かつ的を絞ったVLM呼び出しを使用します。大幅に低コストで66.6%を記録。
  • –disable_ocr — VLM呼び出しを一切行わない純粋なテキストレイヤー抽出。完全にCPU上で実行されます。43.6%を記録、23.7 pg/s。

モード選択はデフォルトでデバイス認識になりました:GPUではbalanced、CPU/MPSではfast、–modeで手動オーバーライド可能。完全なCPUサポートは2番目の構造的変更です。fast –disable_ocrはGPUも推論サーバーも必要とせず、それでも20MパラメータのレイアウトモデルはCPU上で列、表、ヘッダーを解析します。

3番目のアーキテクチャ変更がスループットの数値を生み出しています。複数の軽量CPUワーカーが単一のSurya推論サーバーを共有し、親プロセスがそれら全体でVLMの同時実行を管理します。結果として、スループットはプロセスごとのVRAMではなく、サーバー容量に応じてスケールします。Datalabは、balancedモードが同じハードウェアで単一ストリームの約0.3 pg/sに対して約2.9 pg/sを維持すると報告しています。

アップグレード前に注意すべき重大な変更がいくつかあります。Python 3.10以降が必要になりました。パッケージ管理がPoetryからuvに移行し(hatchlingがビルドバックエンド)、pip install marker-pdfは変更されていません。構造化抽出コンバーターとエクストラクターは削除されました。DatalabはユーザーにホステッドAPIまたは–use_llmワークフローを代替として案内しています。

ベンチマーク手法

スコアリングベンチマークはAi2のolmOCR-benchで、数式レンダリング、表構造、読み取り順序、ヘッダーとフッター、古いスキャンをカバーする約8,400の合格/不合格ユニットテストを含む1,403のPDFで構成されています。全体スコアは8カテゴリーのマクロ平均で、公式のolmOCR-benchチェッカーを使用して計算されます。スループットの数値は、単一ストリームのレイテンシではなく、単一のB200ホストでの持続的並行処理ページ/秒を表します。

出典について:olmOCR-benchはAi2のサードパーティベンチマークですが、以下のすべてのスコアとスループットの数値はDatalab自身のテスト実行によるものです。すべての結果はMarkerリポジトリのオープンハーネスを通じて再現可能であり、MinerU、Docling、LiteParseの競合ランナーがMarker自身のものと並んで含まれています。これらの数値は単一のハードウェア構成での1つのベンチマークのドキュメントミックスを反映しているため、他のコーパスでは結果が異なる可能性があります。評価チームは、意味のある比較のために、独自のドキュメントセットに対してハーネスを実行すべきです。

Marker v2 vs MinerU

MinerUのパイプラインバックエンドはアーキテクチャ上最も近い対抗馬であり、両ツールともPDFテキストレイヤーを読み取り、選択的にOCRを適用します。全体スコアでは、Marker balancedが76.0対72.7でリードしています。ボーンデジタルドキュメントでは、両者は実質的に同点の83.5対83.3です。

有意な差はスループットにあります。Marker balancedはMinerUの0.54 pg/sに対して2.9 pg/sを維持し、より高い精度スコアで5.4倍の差をつけています。Marker fastは7.4 pg/sを維持し、MinerUのパイプラインレートの約13.7倍ですが、その代わりにMinerUより6.1ポイント低いスコアになります。

MinerUはVLMバックエンドも提供しており、Datalabはパイプラインバックエンドより高いスコアを記録すると述べています。そのバックエンドはフルページVLMアプローチを使用しており、この比較表には含まれていません。MinerUを評価するチームはそのオプションを別途ベンチマークすべきです。

Marker v2 vs Docling

DoclingはGPUパイプラインの中で最も大きなパフォーマンス差を示しています。Marker balancedは全体で76.0対50.3、ボーンデジタルドキュメントで83.5対64.0でリードし、同時に2.9 pg/s対2.1 pg/sでより高速に実行されます。Datalabは、Doclingがデフォルトのパイプラインで評価されたことに言及しています。これは、ボーンデジタルページにテキストレイヤーを使用し、画像領域にOCRを使用するものです。

Doclingの強みは、生の精度ではなく、ガバナンスとフォーマットの広さにあります。コードベースはMITライセンスで、IBM Researchで誕生し、LF AI & Data Foundationのプロジェクトとしてホストされています。サポートされている入力形式はドキュメントにとどまらず、音声やメールにも拡張されています。

Marker v2 vs LiteParse

LlamaIndexチームが開発したLiteParseは、根本的に異なる軸で動作するRustベースのドキュメントパーサーです。CPUでは全体スコア22.4、OCR無効で20.4を記録し、MarkerのCPU専用43.6と比較されます。ただし、OCRオフのLiteParseは1721 pg/sを報告しており、MarkerのCPUモードの約73倍のスループットで、明確な速度優先の構造トレードオフを表しています。

Markerのfastモードと–disable_ocrはCPU上で20Mパラメータのレイアウトモデルを実行し、ドキュメント構造を復元するため、プレーンテキストダンプのスコアの2倍以上を達成しています。LiteParseにはレイアウトモデルがなく、非線形なドキュメントレイアウトでは苦戦します。

Marker v2 vs フルページVLM階層

Datalabチームは、MarkerがVLMではなくパイプラインとして設計されていることを強調し、これらは異なるツールカテゴリーであると述べています。この区別には実用的な意味があります:フルページVLMは各ドキュメント画像を大規模モデルでエンドツーエンドで処理し、より高い精度を達成しますが、スケールが増大するにつれて蓄積するページごとの計算コストまたはAPIコストが発生します。Markerのようなパイプラインはタスクをより安価な専門段階に分解し、ピーク精度と引き換えにスループットとコスト制御を獲得します。この評価では、DatalabのホステッドChandra 2が85.8、Gemini Flash 3.5(API経由)が76.4を記録しています。DatalabのChandraリポジトリは、別の表でAi2のolmOCR 2を82.4、dots.ocr 1.5を83.9として位置づけています。スキャン、数式が多いページ、および最大精度の達成において、VLM階層はリストされたすべてのパイプラインに対して依然として優位性を持っています。

注目すべきは、Markerのbalancedモードが全体でGemini Flash 3.5よりわずか0.4ポイント遅れるまで差を縮め、ボーンデジタルドキュメントでは83.5対79.1のマージンで上回っていることです。しかもページごとのAPI呼び出しを必要とせずに。

カテゴリー別の挙動

選択したモードは全体スコアだけでなく、失敗プロファイルにも影響します。数式レンダリングが最も顕著な差異要因です:fastモードはVLM-OCRではなくPDFテキストレイヤーから数式を読み取るため、arXivの数式スコアは83.9から23.4に低下し、–disable_ocrは設計上このカテゴリーで0.0を記録します。2つの数式カテゴリー以外では、古いスキャンがすべてのモードで最も弱い区分で、ピークは43.2です。

ライセンス

ライセンス条件は4つのシステム間で大きく異なり、商用チームに直接的な影響を持ちます。特にドキュメント解析は多くの場合、出所とライセンスコンプライアンスが監査可能な要件である規制ワークフローに供給されるためです:

  • Marker:コードはApache 2.0です。モデルウェイトは改変されたAI Pubs OpenRAIL-Mライセンスを使用します。研究、個人使用、資金調達または収益が500万ドル未満のスタートアップは無料です。それを超える場合、ウェイトの商用利用には有料ライセンスが必要です。
  • MinerU:現在MinerUオープンソースライセンスの下にあり、Apache 2.0に追加条件が加えられています。月間アクティブユーザー1億人または月次収益2000万ドルを超える場合は別途商用ライセンスが必要で、それに基づいて構築されたオンラインサービスはその旨を開示する必要があります。
  • Docling:MITライセンスで、モデルライセンスは元のパッケージで個別に追跡されます。
  • LiteParse:run-llamaによるオープンソースで、LlamaParseは処理が困難なドキュメント向けの有料クラウドオプションとして位置づけられています。

ユースケースの考慮事項

ベンチマークスコアだけでは適切なツールは決まりません。コーパスの種類、利用可能なハードウェア、ライセンティア、必要な出力形式がすべて決定要因となります。ボーンデジタルPDFを大規模に処理するチームは、トップパイプライン間で精度の差がほとんどないことに気づくかもしれません。一方、スキャンされたドキュメント、数式が多い学術論文、または混合フォーマットのコーパスを扱うチームは、より大きなばらつきを経験するでしょう。チームは独自のドキュメントセットと運用上の制約に対して各パーサーを評価すべきです。

すべてのベンチマークおよびスループットの数値には、Markerリポジトリ内の再現可能なbenchmarks/ハーネスが付属しています。

主な参考資料

出典:MarkTechPost