NotizieMacroDatalab rilascia Marker 2: dichiarati 76,0% su olmOCR-bench e throughput 5,4x rispetto alla pipeline MinerU

Datalab rilascia Marker 2: dichiarati 76,0% su olmOCR-bench e throughput 5,4x rispetto alla pipeline MinerU

Autore: MarkTechPost·

Punti chiave

  • Marker 2 introduce tre percorsi di conversione: modalità balanced per un uso GPU di qualità più alta, modalità fast per esecuzioni a costo inferiore e una modalità senza OCR solo CPU.
  • Datalab afferma che la modalità balanced di Marker 2 ha ottenuto un punteggio complessivo del 76,0% su olmOCR-bench e ha raggiunto 2,9 pagine al secondo su una singola GPU B200.
  • I dati di benchmark citati per Marker, MinerU, Docling e LiteParse provengono dalle esecuzioni interne di Datalab usando l'harness olmOCR-bench di terze parti di Ai2.
  • La release introduce modifiche non retrocompatibili, tra cui il requisito minimo di Python 3.10, il passaggio da Poetry a uv con hatchling e la rimozione dei converter per l'estrazione strutturata.
  • Il codice di Marker è Apache 2.0, mentre i suoi pesi dei modelli richiedono una licenza a pagamento per l'uso commerciale oltre determinate soglie di finanziamento o ricavi delle startup.
Datalab rilascia Marker 2: dichiarati 76,0% su olmOCR-bench e throughput 5,4x rispetto alla pipeline MinerU

Datalab ha rilasciato Marker 2, una riscrittura completa della sua pipeline open source di conversione documentale per trasformare file PDF, immagini, PPTX, DOCX, XLSX, HTML ed EPUB in markdown, JSON, HTML o chunk. Una conversione documentale accurata e veloce è diventata un collo di bottiglia critico per le pipeline di AI aziendali, in particolare per i sistemi di retrieval-augmented generation (RAG) e i flussi di ingestione dati per LLM che dipendono da testo strutturato pulito estratto da documenti reali.

La release ricostruisce Marker attorno a tre componenti che Datalab ha distribuito negli ultimi mesi: Surya OCR 2, un modello di layout rapido da 20M di parametri e un componente pdftext ricostruito che, secondo l'azienda, è 3x più veloce della versione precedente.

Il principale risultato di benchmark citato da Datalab proviene da olmOCR-bench, un benchmark di terze parti di Allen AI. Nelle esecuzioni di Datalab, la modalità balanced di Marker 2 ottiene un punteggio complessivo del 76,0% e dell'83,5% sui PDF born-digital. Sostiene 2,9 pagine al secondo su una singola GPU B200. Datalab afferma che si tratta di oltre 5x il throughput del backend pipeline di MinerU, che ottiene il 72,7% a 0,54 pagine al secondo. Docling ottiene il 50,3% a 2,1 pagine al secondo sullo stesso harness.

Marker 2 is out now – up to 5x faster and more accurate than mineru, docling, and liteparse with similar configs. Converts pdfs, images, docx to markdown. CPU + GPU compatible, up to 27 pages/s. pic.twitter.com/75nMipDaZ7 — Vik Paruchuri (@VikParuchuri) July 21, 2026

Marker 2 is out now – up to 5x faster and more accurate than mineru, docling, and liteparse with similar configs. Converts pdfs, images, docx to markdown. CPU + GPU compatible, up to 27 pages/s. pic.twitter.com/75nMipDaZ7

Cosa è cambiato in Marker 2

Marker 2 ora offre tre percorsi di conversione invece di un unico percorso.

La modalità balanced usa Surya VLM per il layout, e l'intera pagina viene sottoposta di nuovo a OCR quando il testo incorporato è di scarsa qualità. Datalab la descrive come l'opzione di qualità più alta e la più adatta all'uso su GPU. Ottiene il 76,0% su olmOCR-bench.

La modalità fast usa un rilevatore di layout leggero rf-detr/onnx più pdftext, con un uso minimo e mirato del VLM. Ottiene il 66,6% ed è progettata per essere meno costosa da eseguire.

La modalità --disable_ocr esegue un'estrazione pura dal livello testuale senza chiamate VLM. Funziona interamente su CPU, ottiene il 43,6% e raggiunge 23,7 pagine al secondo.

La selezione della modalità ora è consapevole del dispositivo per impostazione predefinita: balanced su GPU e fast su CPU o MPS, pur consentendo agli utenti di sovrascrivere l'impostazione con --mode. Il supporto completo alla CPU è un'altra modifica strutturale. Il percorso fast --disable_ocr non richiede una GPU né un server di inferenza, e il modello di layout da 20M di parametri legge comunque colonne, tabelle e intestazioni su CPU.

Datalab afferma che la terza modifica principale è architetturale ed è responsabile dei risultati di throughput. Più worker CPU leggeri condividono un singolo server di inferenza Surya. Il processo padre assegna il budget di concorrenza VLM tra questi worker, quindi il throughput scala con la capacità del server anziché con la VRAM per processo. Datalab riporta che la modalità balanced sostiene circa 2,9 pagine al secondo rispetto a un tasso single-stream di circa 0,3 pagine al secondo sullo stesso hardware.

La release introduce anche modifiche non retrocompatibili. Ora è richiesto Python 3.10 o successivo. Il packaging è passato da Poetry a uv, con hatchling come backend di build, anche se pip install marker-pdf resta invariato. Il converter e gli extractor per l'estrazione strutturata sono stati rimossi; Datalab indirizza invece gli utenti verso l'API ospitata o un workflow --use_llm.

Contesto del benchmark

Il benchmark di valutazione è olmOCR-bench di Ai2. Include 1.403 PDF e circa 8.400 unit test pass/fail che coprono rendering matematico, struttura delle tabelle, ordine di lettura, intestazioni e piè di pagina e vecchie scansioni. Il punteggio complessivo è la media macro su otto categorie, calcolata con il checker ufficiale di olmOCR-bench. Il throughput è misurato come pagine concorrenti sostenute al secondo su un host B200, non come latenza single-stream.

Datalab osserva che olmOCR-bench è un benchmark di terze parti di Ai2, ma i punteggi e i dati di throughput citati per Marker, MinerU, Docling e LiteParse provengono dalle esecuzioni interne di Datalab. L'azienda afferma che i risultati sono riproducibili tramite l'harness aperto nel repository Marker, che include runner concorrenti per MinerU, Docling e LiteParse accanto al runner di Marker.

I dati riflettono inoltre il mix documentale di un singolo benchmark su una sola configurazione hardware. I risultati possono differire su altri set di documenti, e i team che valutano questi sistemi dovrebbero eseguire l'harness sul proprio corpus per determinare la classifica sui propri documenti.

Marker 2 e MinerU

Il backend pipeline di MinerU è il confronto architetturale più vicino perché entrambi i sistemi leggono il livello testuale del PDF e applicano OCR in modo selettivo. Marker balanced è in vantaggio nel punteggio complessivo, 76,0 contro 72,7. Sui documenti born-digital, i due sono quasi alla pari, con Marker a 83,5 e MinerU a 83,3.

La differenza maggiore è il throughput. Marker balanced sostiene 2,9 pagine al secondo rispetto alle 0,54 pagine al secondo di MinerU, un divario di 5,4x pur registrando anche un punteggio complessivo più alto. Marker fast sostiene 7,4 pagine al secondo, circa 13,7x il tasso della pipeline di MinerU, ma ottiene 6,1 punti in meno di MinerU.

MinerU offre anche un backend VLM, che secondo Datalab ottiene un punteggio superiore al backend pipeline di MinerU. Quel backend usa un approccio VLM a pagina intera e non è stato incluso nella tabella comparativa citata nell'articolo. Datalab afferma che i team che valutano MinerU dovrebbero eseguire benchmark separati su quel percorso.

Marker 2 e Docling

Docling mostra il margine più ampio tra le pipeline GPU nel confronto di Datalab. Marker balanced è in vantaggio 76,0 contro 50,3 complessivo e 83,5 contro 64,0 sui documenti born-digital. Marker è anche più veloce nella configurazione riportata, con 2,9 pagine al secondo rispetto alle 2,1 pagine al secondo di Docling.

Datalab afferma che Docling è stato eseguito sulla sua pipeline predefinita, che usa il livello testuale per le pagine born-digital e l'OCR per le regioni immagine.

Il contrappeso di Docling è la governance e l'ampiezza dei formati, più che l'accuratezza nel benchmark in questo confronto. Il suo codebase è con licenza MIT, ha avuto origine presso IBM Research ed è ospitato come progetto nella LF AI & Data Foundation. Il suo supporto di input si estende inoltre oltre i documenti, includendo formati audio ed email.

Marker 2 e LiteParse

LiteParse, del team LlamaIndex, è un parser documentale in Rust e non compete sullo stesso asse di Marker. Su CPU, LiteParse ottiene 22,4 complessivo e 20,4 con OCR disabilitato, rispetto al punteggio solo CPU di Marker pari a 43,6.

LiteParse con OCR disabilitato riporta 1721 pagine al secondo, circa 73x la modalità CPU di Marker. Questo è il principale compromesso nel confronto. La modalità fast --disable_ocr di Marker esegue un modello di layout da 20M di parametri su CPU e recupera comunque la struttura, motivo per cui, secondo Datalab, più che raddoppia il punteggio di un semplice dump testuale. LiteParse non ha un modello di layout e, secondo l'articolo di origine, ha prestazioni scarse sui documenti non lineari.

Marker 2 e i sistemi VLM a pagina intera

Datalab sottolinea che Marker è progettato come pipeline anziché come VLM, descrivendo le due categorie come strumenti distinti. Nella valutazione dell'azienda, il suo Chandra 2 ospitato ottiene 85,8, mentre Gemini Flash 3.5 via API ottiene 76,4. Il repository Chandra di Datalab colloca inoltre olmOCR 2 di Ai2 a 82,4 e dots.ocr 1.5 a 83,9 in una tabella separata.

Per scansioni, pagine ricche di matematica e massima accuratezza, Datalab afferma che il livello VLM resta avanti a tutte le pipeline elencate. Marker balanced è a 0,4 punti da Gemini Flash 3.5 complessivamente nei risultati citati ed è davanti a Gemini Flash 3.5 sui documenti born-digital, 83,5 contro 79,1, senza richiedere una chiamata API per pagina. Il trade-off pipeline-versus-VLM è una questione di progettazione ricorrente nel panorama degli strumenti di AI documentale, con le pipeline che in genere offrono costi per pagina più bassi e deployment locale, mentre gli approcci basati su VLM sono in vantaggio sui tipi di documento più difficili.

Risultati a livello di categoria

La modalità selezionata modifica il profilo degli errori oltre al punteggio principale. Nelle categorie di olmOCR-bench citate da Datalab, la matematica è la limitazione più marcata per le modalità non balanced. La modalità fast legge le equazioni dal livello testuale del PDF invece di sottoporle a VLM-OCR, quindi la matematica arXiv scende da 83,9 a 23,4. La modalità --disable_ocr ottiene 0,0 in quella categoria per progettazione.

Al di fuori delle due categorie matematiche, le vecchie scansioni sono la suddivisione più debole in ogni modalità, con il miglior risultato che si ferma a 43,2.

Licenze

I quattro sistemi differiscono in modo significativo nelle licenze per i team commerciali.

Il codice di Marker è Apache 2.0. I suoi pesi dei modelli usano una licenza AI Pubs OpenRAIL-M modificata, gratuita per ricerca, uso personale e startup con meno di 5 milioni di dollari di finanziamenti o ricavi. Oltre tale soglia, l'uso commerciale dei pesi richiede una licenza a pagamento.

MinerU è ora sotto la MinerU Open Source License, basata su Apache 2.0 con condizioni aggiuntive. È richiesta una licenza commerciale separata oltre 100 milioni di utenti attivi mensili o 20 milioni di dollari di ricavi mensili, e i servizi online costruiti su di essa devono dichiararlo.

Docling ha licenza MIT, con le licenze dei modelli tracciate separatamente nei rispettivi pacchetti originali.

LiteParse è open source da run-llama, con LlamaParse posizionato come percorso cloud a pagamento per documenti difficili.

Il panorama delle licenze in questi progetti riflette un modello più ampio del settore, in cui gli strumenti AI open source abbinano sempre più spesso licenze permissive per il codice a termini più restrittivi o commerciali sui pesi dei modelli, riflettendo la tensione tra distribuzione aperta e monetizzazione dei modelli addestrati.

Le fonti primarie citate includono il repository olmOCR-bench all'indirizzo https://github.com/allenai/olmocr/tree/main/olmocr/bench, le note di rilascio di Marker 2 all'indirizzo https://github.com/datalab-to/marker/releases/tag/v2.0.0, il post del blog di Datalab all'indirizzo e il tweet di annuncio all'indirizzo https://x.com/VikParuchuri/status/2079545884681830784.