NotizieMacroDatalab Marker v2 vs MinerU, Docling e LiteParse: Analisi dei Benchmark

Datalab Marker v2 vs MinerU, Docling e LiteParse: Analisi dei Benchmark

Autore: MarkTechPost·

Punti chiave

  • Marker v2 aggiunge tre modalità di conversione: balanced per la qualità su GPU, fast per un'elaborazione a basso costo e una modalità no-OCR solo CPU.
  • Datalab riporta che la modalità balanced di Marker v2 ha ottenuto il 76,0% complessivo e l'83,5% sui PDF born-digital su olmOCR-bench di Ai2.
  • La modalità balanced di Marker ha elaborato 2,9 pagine al secondo su una singola GPU B200, rispetto alle 0,54 pagine al secondo del pipeline backend di MinerU.
  • Il rilascio richiede Python 3.10 o versioni successive e rimuove il converter di structured-extraction e gli extractors.
  • Datalab afferma che i risultati dei benchmark sono riproducibili tramite un harness open, ma i team dovrebbero testare sui propri set di documenti e vincoli.
Datalab Marker v2 vs MinerU, Docling e LiteParse: Analisi dei Benchmark

Datalab ha rilasciato Marker v2, una riscrittura completa della sua pipeline open-source di conversione documenti. Marker trasforma file PDF, immagini, PPTX, DOCX, XLSX, HTML ed EPUB in markdown, JSON, HTML o chunk — formati di output che servono come input diretto per sistemi di retrieval-augmented generation (RAG), preparazione di dati per l'addestramento di LLM e pipeline di conoscenza aziendale in cui la fedeltà di analisi determina le prestazioni dei modelli a valle. Il team di Datalab ha ricostruito lo strumento attorno a tre componenti rilasciate nei mesi precedenti: Surya OCR 2, un modello di layout rapido da 20M di parametri, e un motore pdftext ricostruito che è 3× più veloce della versione precedente.

I risultati principali dei benchmark provengono da olmOCR-bench, un benchmark di terze parti creato da Allen AI (Ai2). La modalità balanced di Marker v2 raggiunge il 76,0% complessivo e l'83,5% sui PDF born-digital, mantenendo 2,9 pagine al secondo su una singola GPU B200. Questo throughput rappresenta oltre 5× la velocità del pipeline backend di MinerU, che ottiene il 72,7% a 0,54 pagine al secondo. Docling ottiene il 50,3% a 2,1 pagine al secondo sullo stesso harness.

Novità in Marker v2

Marker v2 introduce tre modalità di conversione:

  • Balanced — Il VLM Surya gestisce il layout e viene attivato un re-OCR dell'intera pagina ogni volta che la qualità del testo incorporato è scarsa. Questa è la modalità di massima qualità, ottimizzata per GPU. Raggiunge il 76,0% su olmOCR-bench.
  • Fast — Un rilevatore di layout leggero rf-detr/onnx combinato con pdftext, con un uso minimo e mirato del VLM. Ottiene il 66,6% a un costo significativamente inferiore.
  • –disable_ocr — Purissima estrazione del text-layer senza alcuna chiamata VLM. Esecuzione interamente su CPU. Ottiene il 43,6% a 23,7 pg/s.

La selezione della modalità è ora consapevole del dispositivo per impostazione predefinita: balanced su GPU, fast su CPU/MPS, con override manuale tramite –mode. Il pieno supporto della CPU costituisce il secondo cambiamento strutturale — la modalità fast con –disable_ocr non richiede GPU né server di inferenza, eppure il modello di layout da 20M di parametri analizza ancora colonne, tabelle e intestazioni su CPU.

Il terzo cambiamento architetturale determina le cifre di throughput. Più worker CPU leggeri condividono un singolo server di inferenza Surya, con il processo padre che gestisce la concorrenza VLM tra loro. Di conseguenza, il throughput scala con la capacità del server anziché essere limitato dalla VRAM per processo. Datalab riporta che la modalità balanced mantiene circa 2,9 pg/s rispetto a un rate di ~0,3 pg/s in single-stream sullo stesso hardware.

Diverse breaking changes sono degne di nota prima dell'aggiornamento. È ora richiesto Python 3.10+. Il packaging è passato da Poetry a uv con hatchling come build backend, sebbene pip install marker-pdf rimanga invariato. Il converter di structured-extraction e gli extractors sono stati rimossi; Datalab indirizza gli utenti all'API hosted o a un workflow –use_llm come alternative.

Metodologia del Benchmark

Il benchmark di valutazione è olmOCR-bench di Ai2, composto da 1.403 PDF con circa 8.400 unit test pass/fail che coprono il rendering matematico, la struttura delle tabelle, l'ordine di lettura, intestazioni e piè di pagina, e vecchie scansioni. Il punteggio complessivo è la macro-media tra le 8 categorie, calcolato utilizzando il checker ufficiale di olmOCR-bench. Le cifre di throughput rappresentano pagine sostenute concorrenti al secondo su un singolo host B200, non la latenza single-stream.

In merito alla provenienza: sebbene olmOCR-bench sia un benchmark di terze parti di Ai2, tutti i punteggi e i numeri di throughput provengono dalle esecuzioni di test di Datalab. Tutti i risultati sono riproducibili tramite l'harness open nel repository di Marker, che include i runner per i competitor MinerU, Docling e LiteParse oltre a quello di Marker. Questi numeri riflettono il mix di documenti di un singolo benchmark su una singola configurazione hardware, quindi i risultati su altri corpus potrebbero differire. I team che valutano dovrebbero eseguire l'harness sui propri set di documenti per confronti significativi.

Marker v2 vs MinerU

Il pipeline backend di MinerU è la controparte architetturale più vicina, poiché entrambi gli strumenti leggono il text layer dei PDF e applicano l'OCR selettivamente. Sul punteggio complessivo, Marker balanced conduce 76,0 a 72,7. Sui documenti born-digital, i due sono praticamente alla pari con 83,5 contro 83,3.

La separazione significativa è nel throughput. Marker balanced mantiene 2,9 pg/s rispetto agli 0,54 pg/s di MinerU — un divario di 5,4× a un punteggio di accuratezza superiore. Marker fast mantiene 7,4 pg/s, circa 13,7× il rate della pipeline di MinerU, sebbene ottenga 6,1 punti in meno rispetto a MinerU in cambio.

MinerU offre anche un VLM backend, che Datalab nota ottenere punteggi più alti rispetto al suo pipeline backend. Quel backend utilizza un approccio VLM a piena pagina e non è incluso in questa tabella di confronto. I team che valutano MinerU dovrebbero testare quell'opzione separatamente.

Marker v2 vs Docling

Docling mostra il margine di prestazioni più ampio tra le pipeline su GPU. Marker balanced conduce 76,0 a 50,3 complessivo e 83,5 a 64,0 sui documenti born-digital, oltre a essere più veloce a 2,9 pg/s contro 2,1 pg/s. Datalab nota che Docling è stato valutato utilizzando la sua pipeline predefinita, che sfrutta il text layer per le pagine born-digital e l'OCR per le regioni di immagine.

I punti di forza di Docling risiedono nella governance e nell'ampiezza dei formati piuttosto che nell'accuratezza pura. Il codebase è con licenza MIT, ha avuto origine presso IBM Research ed è ospitato come progetto nella LF AI & Data Foundation. I suoi formati di input supportati si estendono oltre i documenti includendo audio ed email.

Marker v2 vs LiteParse

LiteParse, sviluppato dal team LlamaIndex, è un parser di documenti basato su Rust che opera su un asse fondamentalmente diverso. Su CPU ottiene 22,4 complessivo e 20,4 con OCR disabilitato, rispetto al 43,6 di Marker in modalità solo CPU. Tuttavia, LiteParse con OCR disattivato riporta 1.721 pg/s — circa 73× il throughput della modalità CPU di Marker, rappresentando un chiaro compromesso velocità-struttura.

La modalità fast di Marker con –disable_ocr esegue un modello di layout da 20M di parametri su CPU e recupera ancora la struttura del documento, il che spiega perché raddoppi ampiamente il punteggio di una semplice estrazione di testo. LiteParse manca di un modello di layout e ha difficoltà con i layout di documenti non lineari.

Marker v2 vs il Tier VLM a Piena Pagina

Il team di Datalab sottolinea che Marker è progettato come pipeline piuttosto che come VLM, notando che si tratta di categorie distinte di strumenti. La distinzione ha un peso pratico: i VLM a piena pagina elaborano ogni immagine di documento end-to-end attraverso un modello di grandi dimensioni, ottenendo un'accuratezza superiore ma incorrendo in costi di calcolo o API per pagina che si accumulano su larga scala. Le pipeline come Marker decompongono il compito in fasi specializzate più economiche, scambiando l'accuratezza massima per throughput e controllo dei costi. In questa valutazione, il Chandra 2 hosted di Datalab ottiene 85,8, mentre Gemini Flash 3.5 via API ottiene 76,4. Il repository Chandra di Datalab posiziona anche olmOCR 2 di Ai2 a 82,4 e dots.ocr 1.5 a 83,9 in una tabella separata. Per le scansioni, le pagine dense di matematica e per ottenere la massima accuratezza, il tier VLM rimane superiore a tutte le pipeline elencate.

In particolare, la modalità balanced di Marker riduce il divario a soli 0,4 punti rispetto a Gemini Flash 3.5 complessivo e lo supera sui documenti born-digital con un margine di 83,5 a 79,1 — senza richiedere una chiamata API per pagina.

Comportamento per Categoria

La modalità scelta influisce sul profilo degli errori, non solo sul punteggio complessivo. Il rendering matematico è il differenziale più pronunciato: la modalità fast legge le equazioni dal text layer del PDF anziché tramite VLM-OCR, causando un calo dei punteggi matematici di arXiv da 83,9 a 23,4, e –disable_ocr ottiene 0,0 in questa categoria per scelta progettuale. Al di fuori delle due categorie matematiche, le vecchie scansioni rappresentano lo split più debole in ogni modalità, con un picco di 43,2.

Licenze

I termini di licenza divergono significativamente tra i quattro sistemi, con implicazioni dirette per i team commerciali — in particolare perché l'analisi dei documenti spesso alimenta workflow regolamentati in cui la provenienza e la conformità delle licenze sono requisiti verificabili:

  • Marker: Il codice è Apache 2.0. I pesi del modello utilizzano una licenza AI Pubs OpenRAIL-M modificata — gratuita per ricerca, uso personale e startup con meno di 5M $ di finanziamenti o ricavi. Al di sopra di tale soglia, l'uso commerciale dei pesi richiede una licenza a pagamento.
  • MinerU: Ora regolato dalla MinerU Open Source License, basata su Apache 2.0 con condizioni aggiuntive. Una licenza commerciale separata è richiesta sopra i 100M MAU o 20M $ di ricavi mensili, e i servizi online basati su di essa devono dichiararlo.
  • Docling: Con licenza MIT, con le licenze dei modelli tracciate separatamente nei rispettivi pacchetti originali.
  • LiteParse: Open source, di run-llama, con LlamaParse posizionato come opzione cloud a pagamento per l'elaborazione di documenti difficili.

Considerazioni sui Casi d'Uso

I soli punteggi dei benchmark non determinano lo strumento giusto. Il tipo di corpus, l'hardware disponibile, il tier di licenza e il formato di output richiesto sono tutti fattori che incidono sulla decisione. I team che elaborano PDF born-digital su larga scala potrebbero trovare differenze di accuratezza minime tra le pipeline principali, mentre coloro che gestiscono documenti scansionati, articoli accademici con matematica densa o corpus a formato misto vedranno una varianza maggiore. I team dovrebbero valutare ogni parser sui propri set di documenti e vincoli operativi.

Tutti i numeri di benchmark e throughput sono accompagnati da un harness riproducibile benchmarks/ nel repository di Marker.

Riferimenti Chiave

Fonte: MarkTechPost