ActualitésMacroDatalab Marker v2 face à MinerU, Docling et LiteParse : analyse des benchmarks

Datalab Marker v2 face à MinerU, Docling et LiteParse : analyse des benchmarks

Auteur: MarkTechPost·

Points clés

  • Marker v2 ajoute trois modes de conversion : balanced pour la qualité sur GPU, fast pour un traitement à moindre coût, et un mode sans OCR entièrement sur CPU.
  • Datalab indique que le mode balanced de Marker v2 a obtenu 76.0% au total et 83.5% sur les PDF nativement numériques sur olmOCR-bench d’Ai2.
  • Le mode balanced de Marker a traité 2.9 pages par seconde sur un seul GPU B200, contre 0.54 page par seconde pour le backend pipeline de MinerU.
  • Cette version nécessite Python 3.10 ou une version ultérieure et supprime le convertisseur d’extraction structurée ainsi que les extracteurs.
  • Datalab affirme que les résultats de benchmark sont reproductibles via un banc d’essai ouvert, mais les équipes devraient tester avec leurs propres jeux de documents et contraintes.
Datalab Marker v2 face à MinerU, Docling et LiteParse : analyse des benchmarks

Datalab a publié Marker v2, une réécriture complète de son pipeline open source de conversion de documents. Marker transforme les fichiers PDF, image, PPTX, DOCX, XLSX, HTML et EPUB en markdown, JSON, HTML ou fragments — des formats de sortie servant d’entrée directe aux systèmes de génération augmentée par récupération (RAG), à la préparation de données d’entraînement de LLM et aux pipelines de connaissance d’entreprise, où la fidélité du parsing conditionne les performances des modèles en aval. L’équipe de Datalab a reconstruit l’outil autour de trois composants publiés ces derniers mois : Surya OCR 2, un modèle rapide de mise en page à 20M de paramètres, et un moteur pdftext reconstruit, 3× plus rapide que la version précédente.

Les principaux résultats de benchmark proviennent d’olmOCR-bench, un benchmark tiers créé par Allen AI (Ai2). Le mode balanced de Marker v2 atteint 76.0% au total et 83.5% sur les PDF nativement numériques, avec un débit soutenu de 2.9 pages par seconde sur un seul GPU B200. Ce débit représente plus de 5× la vitesse du backend pipeline de MinerU, qui obtient 72.7% à 0.54 page par seconde. Docling obtient 50.3% à 2.1 pages par seconde sur le même banc d’essai.

Nouveautés de Marker v2

Marker v2 introduit trois modes de conversion :

  • Balanced — Le VLM Surya gère la mise en page, et un nouvel OCR pleine page est déclenché lorsque la qualité du texte intégré est insuffisante. Il s’agit du mode de plus haute qualité, optimisé pour GPU. Il atteint 76.0% sur olmOCR-bench.
  • Fast — Un détecteur léger de mise en page rf-detr/onnx combiné à pdftext, avec des appels VLM minimaux et ciblés. Il obtient 66.6% à un coût nettement inférieur.
  • –disable_ocr — Extraction pure depuis la couche texte, sans aucun appel VLM. Fonctionne entièrement sur CPU. Il obtient 43.6% à 23.7 pg/s.

La sélection du mode est désormais sensible au périphérique par défaut : balanced sur GPU, fast sur CPU/MPS, avec une substitution manuelle via –mode. La prise en charge complète du CPU constitue le deuxième changement structurel — le mode fast avec –disable_ocr ne nécessite ni GPU ni serveur d’inférence, tout en permettant au modèle de mise en page à 20M de paramètres d’analyser les colonnes, tableaux et en-têtes sur CPU.

Le troisième changement architectural explique les chiffres de débit. Plusieurs workers CPU légers partagent un seul serveur d’inférence Surya, tandis que le processus parent gère la concurrence VLM entre eux. En conséquence, le débit évolue avec la capacité du serveur plutôt que d’être limité par la VRAM par processus. Datalab indique que le mode balanced maintient environ 2.9 pg/s, contre un débit mono-flux d’environ ~0.3 pg/s sur le même matériel.

Plusieurs changements incompatibles sont à noter avant une mise à niveau. Python 3.10+ est désormais requis. Le packaging est passé de Poetry à uv, avec hatchling comme backend de build, même si pip install marker-pdf reste inchangé. Le convertisseur d’extraction structurée et les extracteurs ont été supprimés ; Datalab oriente les utilisateurs vers l’API hébergée ou vers un workflow –use_llm comme alternatives.

Méthodologie du benchmark

Le benchmark de scoring est olmOCR-bench d’Ai2, composé de 1,403 PDF et d’environ 8,400 tests unitaires réussite/échec couvrant le rendu mathématique, la structure des tableaux, l’ordre de lecture, les en-têtes et pieds de page, ainsi que les anciens scans. Le score global est la macro-moyenne des 8 catégories, calculée avec le vérificateur officiel d’olmOCR-bench. Les chiffres de débit représentent des pages par seconde concurrentes soutenues sur un seul hôte B200, et non une latence mono-flux.

Concernant la provenance : bien qu’olmOCR-bench soit un benchmark tiers d’Ai2, tous les scores et chiffres de débit proviennent des propres exécutions de test de Datalab. Tous les résultats sont reproductibles via le banc d’essai ouvert du dépôt Marker, qui inclut des runners concurrents pour MinerU, Docling et LiteParse aux côtés de celui de Marker. Ces chiffres reflètent le mélange documentaire d’un benchmark sur une configuration matérielle unique ; les résultats peuvent donc différer sur d’autres corpus. Les équipes d’évaluation devraient exécuter le banc d’essai sur leurs propres jeux de documents pour obtenir des comparaisons significatives.

Marker v2 face à MinerU

Le backend pipeline de MinerU est l’équivalent architectural le plus proche, les deux outils lisant la couche texte du PDF et appliquant l’OCR de manière sélective. Sur le score global, Marker balanced mène 76.0 à 72.7. Sur les documents nativement numériques, les deux sont pratiquement à égalité, à 83.5 contre 83.3.

L’écart significatif se situe dans le débit. Marker balanced maintient 2.9 pg/s contre 0.54 pg/s pour MinerU — un écart de 5.4× avec un score de précision plus élevé. Marker fast maintient 7.4 pg/s, soit environ 13.7× le débit du pipeline de MinerU, même s’il obtient en échange 6.1 points de moins que MinerU.

MinerU propose également un backend VLM, dont Datalab indique qu’il obtient un score supérieur à celui de son backend pipeline. Ce backend adopte une approche VLM pleine page et n’est pas inclus dans ce tableau comparatif. Les équipes évaluant MinerU devraient benchmarker cette option séparément.

Marker v2 face à Docling

Docling affiche l’écart de performance le plus important parmi les pipelines GPU. Marker balanced mène 76.0 à 50.3 au total et 83.5 à 64.0 sur les documents nativement numériques, tout en étant plus rapide avec 2.9 pg/s contre 2.1 pg/s. Datalab précise que Docling a été évalué avec son pipeline par défaut, qui exploite la couche texte pour les pages nativement numériques et l’OCR pour les régions d’image.

Les points forts de Docling résident davantage dans la gouvernance et l’étendue des formats que dans la précision brute. La base de code est sous licence MIT, est issue d’IBM Research et est hébergée comme projet au sein de la LF AI & Data Foundation. Les formats d’entrée pris en charge vont au-delà des documents et incluent l’audio et l’e-mail.

Marker v2 face à LiteParse

LiteParse, développé par l’équipe LlamaIndex, est un parseur de documents basé sur Rust qui se situe sur un axe fondamentalement différent. Sur CPU, il obtient 22.4 au total et 20.4 avec l’OCR désactivé, contre 43.6 pour le mode CPU seul de Marker. Toutefois, LiteParse avec OCR désactivé annonce 1721 pg/s — environ 73× le débit du mode CPU de Marker, ce qui illustre un arbitrage clair entre vitesse et structure.

Le mode fast de Marker avec –disable_ocr exécute un modèle de mise en page à 20M de paramètres sur CPU et récupère tout de même la structure du document, ce qui explique pourquoi il fait plus que doubler le score d’un simple dump texte. LiteParse ne dispose pas de modèle de mise en page et rencontre des difficultés avec les mises en page non linéaires.

Marker v2 face au niveau VLM pleine page

L’équipe de Datalab souligne que Marker est conçu comme un pipeline plutôt que comme un VLM, en précisant qu’il s’agit de catégories d’outils distinctes. Cette distinction a un poids pratique : les VLM pleine page traitent chaque image de document de bout en bout via un grand modèle, ce qui permet une précision plus élevée mais entraîne des coûts de calcul ou d’API par page qui s’accumulent à grande échelle. Les pipelines comme Marker décomposent la tâche en étapes spécialisées moins coûteuses, en échangeant la précision maximale contre du débit et un meilleur contrôle des coûts. Dans cette évaluation, Chandra 2 hébergé par Datalab obtient 85.8, tandis que Gemini Flash 3.5 via API obtient 76.4. Le dépôt Chandra de Datalab positionne également olmOCR 2 d’Ai2 à 82.4 et dots.ocr 1.5 à 83.9 dans un tableau séparé. Pour les scans, les pages riches en mathématiques et la recherche de précision maximale, le niveau VLM reste supérieur à tous les pipelines listés.

Il est notable que le mode balanced de Marker réduit l’écart à seulement 0.4 point derrière Gemini Flash 3.5 au total et le dépasse sur les documents nativement numériques, avec 83.5 contre 79.1 — sans nécessiter d’appel API par page.

Comportement par catégorie

Le mode choisi modifie le profil d’échec, pas seulement le score global. Le rendu mathématique est le facteur de différenciation le plus marqué : le mode fast lit les équations depuis la couche texte du PDF au lieu de les traiter par VLM-OCR, ce qui fait chuter les scores de mathématiques arXiv de 83.9 à 23.4, tandis que –disable_ocr obtient 0.0 dans cette catégorie par conception. En dehors des deux catégories mathématiques, les anciens scans constituent le segment le plus faible dans tous les modes, avec un maximum de 43.2.

Licences

Les conditions de licence divergent fortement entre les quatre systèmes, ce qui a des implications directes pour les équipes commerciales — en particulier lorsque le parsing de documents alimente des workflows réglementés où la provenance et la conformité des licences sont auditables :

  • Marker : Le code est sous Apache 2.0. Les poids de modèle utilisent une licence AI Pubs OpenRAIL-M modifiée — gratuite pour la recherche, l’usage personnel et les startups ayant moins de $5M de financement ou de revenus. Au-delà de ce seuil, l’utilisation commerciale des poids nécessite une licence payante.
  • MinerU : Désormais régi par la MinerU Open Source License, basée sur Apache 2.0 avec des conditions supplémentaires. Une licence commerciale séparée est requise au-delà de 100M MAU ou de $20M de revenus mensuels, et les services en ligne construits dessus doivent le divulguer.
  • Docling : Sous licence MIT, avec les licences des modèles suivies séparément dans leurs packages d’origine.
  • LiteParse : Open source, issu de run-llama, avec LlamaParse positionné comme l’option cloud payante pour traiter les documents difficiles.

Considérations d’usage

Les scores de benchmark ne suffisent pas à déterminer le bon outil. Le type de corpus, le matériel disponible, le niveau de licence et le format de sortie requis entrent tous dans la décision. Les équipes qui traitent des PDF nativement numériques à grande échelle peuvent constater des écarts de précision minimes entre les meilleurs pipelines, tandis que celles qui manipulent des documents scannés, des articles académiques riches en mathématiques ou des corpus multiformats observeront des variations plus importantes. Les équipes devraient évaluer chaque parseur sur leurs propres jeux de documents et contraintes opérationnelles.

Tous les chiffres de benchmark et de débit sont accompagnés d’un banc d’essai reproductible benchmarks/ dans le dépôt Marker.

Références clés

Source : MarkTechPost