Datalab lance Marker 2, avec 76,0 % sur olmOCR-bench et un débit 5,4x supérieur au pipeline de MinerU
Points clés
- •Marker 2 introduit trois chemins de conversion : le mode balanced pour une utilisation GPU de meilleure qualité, le mode fast pour des exécutions moins coûteuses, et un mode sans OCR uniquement CPU.
- •Datalab indique que le mode balanced de Marker 2 a obtenu 76,0 % au global sur olmOCR-bench et atteint 2,9 pages par seconde sur un seul GPU B200.
- •Les chiffres de benchmark cités pour Marker, MinerU, Docling et LiteParse proviennent des propres exécutions de Datalab avec le banc d’essai tiers olmOCR-bench d’Ai2.
- •La version apporte des changements incompatibles, notamment un minimum Python 3.10, un passage de Poetry à uv avec hatchling, et la suppression des convertisseurs d’extraction structurée.
- •Le code de Marker est sous Apache 2.0, tandis que ses poids de modèle nécessitent une licence payante pour une utilisation commerciale au-dessus de seuils définis de financement ou de revenus pour les startups.

Datalab a publié Marker 2, une réécriture complète de son pipeline open source de conversion de documents, qui transforme les fichiers PDF, image, PPTX, DOCX, XLSX, HTML et EPUB en markdown, JSON, HTML ou fragments. La conversion de documents précise et rapide est devenue un goulot d’étranglement critique pour les pipelines d’IA d’entreprise — en particulier les systèmes de génération augmentée par récupération (RAG) et les workflows d’ingestion de données pour LLM qui dépendent d’un texte structuré propre extrait de documents réels.
Cette version reconstruit Marker autour de trois composants livrés par Datalab ces derniers mois : Surya OCR 2, un modèle rapide de mise en page à 20M paramètres, et un composant pdftext reconstruit que l’entreprise dit 3x plus rapide que sa version précédente.
Le principal résultat de benchmark cité par Datalab vient d’olmOCR-bench, un benchmark tiers d’Allen AI. Dans les exécutions de Datalab, le mode balanced de Marker 2 obtient 76,0 % au global et 83,5 % sur les PDF nativement numériques. Il maintient 2,9 pages par seconde sur un seul GPU B200. Datalab indique que cela représente plus de 5x le débit du backend pipeline de MinerU, qui obtient 72,7 % à 0,54 page par seconde. Docling obtient 50,3 % à 2,1 pages par seconde sur le même banc d’essai.
Marker 2 is out now – up to 5x faster and more accurate than mineru, docling, and liteparse with similar configs. Converts pdfs, images, docx to markdown. CPU + GPU compatible, up to 27 pages/s. pic.twitter.com/75nMipDaZ7 — Vik Paruchuri (@VikParuchuri) July 21, 2026
Marker 2 is out now – up to 5x faster and more accurate than mineru, docling, and liteparse with similar configs. Converts pdfs, images, docx to markdown. CPU + GPU compatible, up to 27 pages/s. pic.twitter.com/75nMipDaZ7
Ce qui a changé dans Marker 2
Marker 2 propose désormais trois chemins de conversion au lieu d’un seul.
Le mode balanced utilise le VLM Surya pour la mise en page, et la page complète est soumise à une nouvelle OCR lorsque le texte intégré est de mauvaise qualité. Datalab le décrit comme l’option offrant la meilleure qualité et la plus adaptée à l’usage sur GPU. Il obtient 76,0 % sur olmOCR-bench.
Le mode fast utilise un détecteur léger de mise en page rf-detr/onnx associé à pdftext, avec une utilisation minimale et ciblée du VLM. Il obtient 66,6 % et est conçu pour être moins coûteux à exécuter.
Le mode --disable_ocr effectue une extraction pure de la couche texte sans appel VLM. Il fonctionne entièrement sur CPU, obtient 43,6 % et atteint 23,7 pages par seconde.
La sélection du mode tient désormais compte de l’appareil par défaut : balanced sur GPU et fast sur CPU ou MPS, tout en permettant aux utilisateurs de remplacer ce réglage avec --mode. La prise en charge complète du CPU constitue un autre changement structurel. Le chemin fast --disable_ocr ne nécessite ni GPU ni serveur d’inférence, et le modèle de mise en page à 20M paramètres lit toujours les colonnes, tableaux et en-têtes sur CPU.
Datalab indique que le troisième changement majeur est architectural et explique les résultats de débit. Plusieurs workers CPU légers partagent un seul serveur d’inférence Surya. Le processus parent répartit la concurrence VLM entre ces workers, de sorte que le débit évolue avec la capacité du serveur plutôt qu’avec la VRAM par processus. Datalab rapporte que le mode balanced maintient environ 2,9 pages par seconde, contre un débit en flux unique d’environ 0,3 page par seconde sur le même matériel.
La version introduit aussi des changements incompatibles. Python 3.10 ou une version ultérieure est désormais requis. Le packaging est passé de Poetry à uv, avec hatchling comme backend de build, même si pip install marker-pdf reste inchangé. Le convertisseur d’extraction structurée et les extracteurs ont été supprimés ; Datalab oriente plutôt les utilisateurs vers l’API hébergée ou un workflow --use_llm.
Contexte du benchmark
Le benchmark de scoring est olmOCR-bench d’Ai2. Il comprend 1 403 PDF et environ 8 400 tests unitaires réussite/échec couvrant le rendu mathématique, la structure des tableaux, l’ordre de lecture, les en-têtes et pieds de page, ainsi que les anciens scans. Le score global est la moyenne macro sur huit catégories, calculée avec le vérificateur officiel d’olmOCR-bench. Le débit est mesuré en pages simultanées soutenues par seconde sur un hôte B200, et non comme une latence en flux unique.
Datalab précise qu’olmOCR-bench est un benchmark tiers d’Ai2, mais que les scores et chiffres de débit cités pour Marker, MinerU, Docling et LiteParse proviennent de ses propres exécutions. L’entreprise indique que les résultats sont reproductibles via le banc d’essai ouvert du dépôt Marker, qui inclut des runners concurrents pour MinerU, Docling et LiteParse aux côtés du runner de Marker.
Ces chiffres reflètent également le mélange de documents d’un benchmark sur une seule configuration matérielle. Les résultats peuvent différer sur d’autres jeux de documents, et les équipes évaluant ces systèmes devraient exécuter le banc d’essai sur leur propre corpus afin de déterminer le classement pour leurs documents.
Marker 2 et MinerU
Le backend pipeline de MinerU est la comparaison architecturale la plus proche, car les deux systèmes lisent la couche texte du PDF et appliquent l’OCR de manière sélective. Marker balanced est en tête sur le score global, 76,0 contre 72,7. Sur les documents nativement numériques, les deux sont presque à égalité, avec Marker à 83,5 et MinerU à 83,3.
La différence la plus importante concerne le débit. Marker balanced maintient 2,9 pages par seconde contre 0,54 page par seconde pour MinerU, soit un écart de 5,4x tout en affichant aussi un score global plus élevé. Marker fast maintient 7,4 pages par seconde, soit environ 13,7x le débit du pipeline de MinerU, mais obtient un score inférieur de 6,1 points à celui de MinerU.
MinerU propose aussi un backend VLM, qui, selon Datalab, obtient un score supérieur à celui du backend pipeline de MinerU. Ce backend utilise une approche VLM pleine page et n’a pas été inclus dans le tableau comparatif cité dans l’article. Datalab indique que les équipes évaluant MinerU devraient benchmarker ce chemin séparément.
Marker 2 et Docling
Docling affiche l’écart le plus large parmi les pipelines GPU dans la comparaison de Datalab. Marker balanced mène 76,0 contre 50,3 au global et 83,5 contre 64,0 sur les documents nativement numériques. Marker fonctionne aussi plus rapidement dans la configuration rapportée, à 2,9 pages par seconde contre 2,1 pages par seconde pour Docling.
Datalab indique que Docling a été exécuté sur son pipeline par défaut, qui utilise la couche texte pour les pages nativement numériques et l’OCR pour les régions d’image.
Le contrepoids de Docling réside dans la gouvernance et l’étendue des formats plutôt que dans la précision du benchmark dans cette comparaison. Sa base de code est sous licence MIT, elle est issue d’IBM Research, et elle est hébergée comme projet au sein de la LF AI & Data Foundation. Sa prise en charge en entrée s’étend également au-delà des documents, vers les formats audio et e-mail.
Marker 2 et LiteParse
LiteParse, de l’équipe LlamaIndex, est un analyseur de documents en Rust et ne concurrence pas Marker sur le même axe. Sur CPU, LiteParse obtient 22,4 au global et 20,4 avec l’OCR désactivée, contre un score de 43,6 pour Marker en mode uniquement CPU.
LiteParse avec OCR désactivée rapporte 1721 pages par seconde, soit environ 73x le mode CPU de Marker. C’est le compromis central de la comparaison. Le mode fast --disable_ocr de Marker exécute un modèle de mise en page à 20M paramètres sur CPU et récupère toujours la structure, ce qui, selon Datalab, explique pourquoi il fait plus que doubler le score d’une simple extraction de texte brut. LiteParse n’a pas de modèle de mise en page et donne de faibles résultats sur les documents non linéaires, selon l’article source.
Marker 2 et les systèmes VLM pleine page
Datalab souligne que Marker est conçu comme un pipeline plutôt que comme un VLM, décrivant les deux comme des catégories d’outils distinctes. Dans l’évaluation de l’entreprise, son Chandra 2 hébergé obtient 85,8, tandis que Gemini Flash 3.5 via API obtient 76,4. Le dépôt Chandra de Datalab place également olmOCR 2 d’Ai2 à 82,4 et dots.ocr 1.5 à 83,9 dans un tableau distinct.
Pour les scans, les pages riches en mathématiques et la meilleure précision, Datalab indique que la catégorie VLM reste devant tous les pipelines listés. Marker balanced est à 0,4 point derrière Gemini Flash 3.5 au global dans les résultats cités, et devance Gemini Flash 3.5 sur les documents nativement numériques, 83,5 contre 79,1, sans nécessiter d’appel API par page. Le compromis pipeline contre VLM est une question de conception récurrente dans l’écosystème des outils d’IA documentaire, les pipelines offrant généralement un coût par page plus faible et un déploiement local, tandis que les approches fondées sur des VLM dominent sur les types de documents les plus difficiles.
Résultats par catégorie
Le mode sélectionné modifie le profil d’échec autant que le score principal. Dans les catégories d’olmOCR-bench citées par Datalab, les mathématiques constituent la limite la plus nette pour les modes non balanced. Le mode fast lit les équations depuis la couche texte du PDF au lieu de les traiter par VLM-OCR, de sorte que les mathématiques arXiv chutent de 83,9 à 23,4. Le mode --disable_ocr obtient 0,0 dans cette catégorie par conception.
En dehors des deux catégories mathématiques, les anciens scans sont la catégorie la plus faible dans tous les modes, avec un meilleur résultat plafonnant à 43,2.
Licences
Les quatre systèmes diffèrent fortement en matière de licences pour les équipes commerciales.
Le code de Marker est sous Apache 2.0. Ses poids de modèle utilisent une licence AI Pubs OpenRAIL-M modifiée, gratuite pour la recherche, l’usage personnel et les startups ayant moins de 5 millions de dollars de financement ou de revenus. Au-delà de ce seuil, l’utilisation commerciale des poids nécessite une licence payante.
MinerU relève désormais de la MinerU Open Source License, basée sur Apache 2.0 avec des conditions supplémentaires. Une licence commerciale séparée est requise au-delà de 100 millions d’utilisateurs actifs mensuels ou de 20 millions de dollars de revenus mensuels, et les services en ligne construits dessus doivent le signaler.
Docling est sous licence MIT, les licences des modèles étant suivies séparément dans leurs packages d’origine.
LiteParse est open source et provient de run-llama, avec LlamaParse positionné comme la voie cloud payante pour les documents difficiles.
Le paysage des licences de ces projets reflète une tendance plus large du secteur, dans laquelle les outils d’IA open source associent de plus en plus des licences de code permissives à des conditions plus restrictives ou commerciales sur les poids des modèles, illustrant la tension entre distribution ouverte et monétisation des modèles entraînés.
Les sources primaires citées comprennent le dépôt olmOCR-bench à l’adresse https://github.com/allenai/olmocr/tree/main/olmocr/bench, les notes de version de Marker 2 à l’adresse https://github.com/datalab-to/marker/releases/tag/v2.0.0, le billet de blog de Datalab à l’adresse et le tweet d’annonce à l’adresse https://x.com/VikParuchuri/status/2079545884681830784.