Datalab выпустила Marker 2, сообщив о 76.0% в olmOCR-bench и 5.4x пропускной способности pipeline MinerU
Ключевые выводы
- •Marker 2 вводит три пути конвертации: balanced mode для более качественного использования GPU, fast mode для менее затратных запусков и CPU-only режим без OCR.
- •Datalab заявляет, что balanced mode Marker 2 набрал 76.0% в целом в olmOCR-bench и достиг 2.9 страницы в секунду на одном GPU B200.
- •Показатели бенчмарка, приведенные для Marker, MinerU, Docling и LiteParse, получены из собственных прогонов Datalab с использованием стороннего harness Ai2 olmOCR-bench.
- •Релиз добавляет breaking changes, включая минимальное требование Python 3.10, переход с Poetry на uv с hatchling и удаление structured-extraction converters.
- •Код Marker распространяется по Apache 2.0, тогда как его model weights требуют платной лицензии для коммерческого использования выше указанных порогов финансирования или выручки стартапа.

Datalab выпустила Marker 2 — полностью переписанный open source pipeline для конвертации документов, который преобразует файлы PDF, изображения, PPTX, DOCX, XLSX, HTML и EPUB в markdown, JSON, HTML или chunks. Точная и быстрая конвертация документов стала критическим узким местом для корпоративных AI pipeline — особенно для систем retrieval-augmented generation (RAG) и процессов загрузки данных в LLM, которые зависят от чистого структурированного текста, извлеченного из реальных документов.
В релизе Marker перестроен вокруг трех компонентов, которые Datalab выпустила за последние месяцы: Surya OCR 2, быстрой 20M-параметрической модели layout и переработанного компонента pdftext, который, по данным компании, в 3x быстрее предыдущей версии.
Основной результат бенчмарка, на который ссылается Datalab, получен в olmOCR-bench, стороннем бенчмарке от Allen AI. В прогонах Datalab balanced mode Marker 2 набирает 76.0% в целом и 83.5% на born-digital PDF. Он поддерживает 2.9 страницы в секунду на одном GPU B200. Datalab заявляет, что это более чем в 5x выше пропускной способности pipeline backend MinerU, который набирает 72.7% при 0.54 страницы в секунду. Docling набирает 50.3% при 2.1 страницы в секунду на том же harness.
Marker 2 is out now – up to 5x faster and more accurate than mineru, docling, and liteparse with similar configs. Converts pdfs, images, docx to markdown. CPU + GPU compatible, up to 27 pages/s. pic.twitter.com/75nMipDaZ7 — Vik Paruchuri (@VikParuchuri) July 21, 2026
Marker 2 is out now – up to 5x faster and more accurate than mineru, docling, and liteparse with similar configs. Converts pdfs, images, docx to markdown. CPU + GPU compatible, up to 27 pages/s. pic.twitter.com/75nMipDaZ7
Что изменилось в Marker 2
Marker 2 теперь предоставляет три пути конвертации вместо одного.
Balanced mode использует Surya VLM для layout, а вся страница повторно проходит OCR, когда встроенный текст имеет низкое качество. Datalab описывает его как вариант с наивысшим качеством и лучшим соответствием для использования GPU. Он набирает 76.0% в olmOCR-bench.
Fast mode использует легковесный детектор layout rf-detr/onnx плюс pdftext, с минимальным и точечным применением VLM. Он набирает 66.6% и рассчитан на более дешевый запуск.
Режим --disable_ocr выполняет чистое извлечение из текстового слоя без вызовов VLM. Он полностью работает на CPU, набирает 43.6% и достигает 23.7 страницы в секунду.
Выбор режима теперь по умолчанию учитывает устройство: balanced на GPU и fast на CPU или MPS, при этом пользователи по-прежнему могут переопределить настройку через --mode. Полная поддержка CPU — еще одно структурное изменение. Путь fast --disable_ocr не требует GPU или inference server, а 20M-параметрическая модель layout по-прежнему считывает колонки, таблицы и заголовки на CPU.
Datalab заявляет, что третье крупное изменение является архитектурным и отвечает за результаты по пропускной способности. Несколько легковесных CPU workers совместно используют один inference server Surya. Родительский процесс распределяет concurrency VLM между этими workers, поэтому пропускная способность масштабируется с емкостью сервера, а не с VRAM на процесс. Datalab сообщает, что balanced mode поддерживает около 2.9 страницы в секунду по сравнению с single-stream rate около 0.3 страницы в секунду на том же оборудовании.
Релиз также вводит breaking changes. Теперь требуется Python 3.10 или новее. Packaging перенесен с Poetry на uv, с hatchling в качестве build backend, хотя pip install marker-pdf остается без изменений. Structured-extraction converter и extractors были удалены; вместо этого Datalab направляет пользователей к hosted API или workflow --use_llm.
Контекст бенчмарка
Бенчмарк для оценки — olmOCR-bench от Ai2. Он включает 1,403 PDF и примерно 8,400 unit tests pass/fail, охватывающих rendering математики, структуру таблиц, порядок чтения, headers and footers и старые сканы. Общий score — это macro-average по восьми категориям, рассчитанный официальным checker olmOCR-bench. Пропускная способность измеряется как устойчивое concurrent pages per second на одном host B200, а не как single-stream latency.
Datalab отмечает, что olmOCR-bench — это сторонний бенчмарк от Ai2, но scores и показатели пропускной способности, приведенные для Marker, MinerU, Docling и LiteParse, получены из собственных прогонов Datalab. Компания заявляет, что результаты воспроизводимы через открытый harness в репозитории Marker, который включает competitor runners для MinerU, Docling и LiteParse наряду с собственным runner Marker.
Эти показатели также отражают набор документов одного бенчмарка на одной аппаратной конфигурации. Результаты могут отличаться на других наборах документов, и командам, оценивающим системы, потребуется запустить harness на собственном corpus, чтобы определить ранжирование для своих документов.
Marker 2 и MinerU
Pipeline backend MinerU является ближайшим архитектурным сравнением, поскольку обе системы читают текстовый слой PDF и выборочно применяют OCR. Marker balanced лидирует по общему score: 76.0 против 72.7. На born-digital документах две системы почти равны: Marker — 83.5, MinerU — 83.3.
Более существенное различие — пропускная способность. Marker balanced поддерживает 2.9 страницы в секунду по сравнению с 0.54 страницы в секунду у MinerU, что дает разрыв 5.4x при более высоком общем score. Marker fast поддерживает 7.4 страницы в секунду, примерно 13.7x от pipeline rate MinerU, но набирает на 6.1 пункта меньше MinerU.
MinerU также предлагает VLM backend, который, по словам Datalab, набирает более высокий score, чем pipeline backend MinerU. Этот backend использует подход full-page VLM и не был включен в сравнительную таблицу, приведенную в статье. Datalab заявляет, что командам, оценивающим MinerU, следует отдельно benchmark этот путь.
Marker 2 и Docling
Docling показывает самый большой разрыв среди GPU pipelines в сравнении Datalab. Marker balanced лидирует 76.0 против 50.3 в целом и 83.5 против 64.0 на born-digital документах. Marker также работает быстрее в заявленной конфигурации: 2.9 страницы в секунду против 2.1 страницы в секунду у Docling.
Datalab сообщает, что Docling запускался на default pipeline, который использует текстовый слой для born-digital страниц и OCR для областей изображений.
Компенсирующими факторами Docling в этом сравнении являются governance и широта форматов, а не точность в бенчмарке. Его codebase лицензирована по MIT, проект возник в IBM Research и размещается как проект в LF AI & Data Foundation. Его поддержка входных данных также выходит за пределы документов и включает аудио- и email-форматы.
Marker 2 и LiteParse
LiteParse от команды LlamaIndex — это Rust document parser, и он не конкурирует с Marker по той же оси. На CPU LiteParse набирает 22.4 в целом и 20.4 при отключенном OCR по сравнению с CPU-only score Marker 43.6.
LiteParse с отключенным OCR сообщает о 1721 странице в секунду, примерно 73x от CPU mode Marker. Это центральный tradeoff в сравнении. Режим fast --disable_ocr в Marker запускает 20M-параметрическую модель layout на CPU и все же восстанавливает структуру, что, по словам Datalab, объясняет, почему он более чем вдвое превосходит score обычного text dump. LiteParse не имеет модели layout и, согласно исходной статье, плохо справляется с non-linear документами.
Marker 2 и full-page VLM systems
Datalab подчеркивает, что Marker разработан как pipeline, а не как VLM, описывая их как разные категории инструментов. В оценке компании hosted Chandra 2 набирает 85.8, тогда как Gemini Flash 3.5 через API набирает 76.4. Репозиторий Chandra от Datalab также помещает Ai2's olmOCR 2 на 82.4 и dots.ocr 1.5 на 83.9 в отдельной таблице.
Для сканов, страниц с большим количеством математики и максимальной точности Datalab утверждает, что VLM tier остается впереди всех перечисленных pipelines. Marker balanced отстает от Gemini Flash 3.5 всего на 0.4 пункта в целом в приведенных результатах и опережает Gemini Flash 3.5 на born-digital документах — 83.5 против 79.1 — без необходимости API call на каждую страницу. Tradeoff pipeline-versus-VLM остается повторяющимся вопросом дизайна в сфере document AI tooling: pipelines обычно предлагают более низкую стоимость на страницу и локальное развертывание, тогда как подходы на основе VLM лидируют на самых сложных типах документов.
Результаты по категориям
Выбранный режим меняет не только headline score, но и профиль ошибок. В категориях olmOCR-bench, приведенных Datalab, математика является самым заметным ограничением для режимов, отличных от balanced. Fast mode считывает уравнения из текстового слоя PDF вместо их VLM-OCRing, поэтому arXiv math падает с 83.9 до 23.4. Режим --disable_ocr по замыслу набирает 0.0 в этой категории.
За пределами двух математических категорий старые сканы являются самым слабым split в каждом режиме, при этом лучший результат достигает 43.2.
Лицензирование
Четыре системы существенно различаются по лицензированию для коммерческих команд.
Код Marker распространяется по Apache 2.0. Его model weights используют модифицированную лицензию AI Pubs OpenRAIL-M, бесплатную для исследований, личного использования и стартапов с финансированием или выручкой менее $5 million. Выше этого порога коммерческое использование weights требует платной лицензии.
MinerU теперь распространяется по MinerU Open Source License, основанной на Apache 2.0 с дополнительными условиями. Отдельная коммерческая лицензия требуется при более чем 100 million monthly active users или $20 million monthly revenue, а онлайн-сервисы, построенные на ней, должны раскрывать этот факт.
Docling лицензирован по MIT, при этом лицензии моделей отслеживаются отдельно в их исходных пакетах.
LiteParse — open source от run-llama, а LlamaParse позиционируется как платный cloud path для сложных документов.
Лицензионная картина этих проектов отражает более широкий отраслевой паттерн, при котором open-source AI tooling все чаще сочетает permissive code licenses с более ограничительными или коммерческими условиями для model weights, отражая напряжение между открытым распространением и монетизацией обученных моделей.
Указанные первичные источники включают репозиторий olmOCR-bench по адресу https://github.com/allenai/olmocr/tree/main/olmocr/bench, release notes Marker 2 по адресу https://github.com/datalab-to/marker/releases/tag/v2.0.0, blog post Datalab по адресу и announcement tweet по адресу https://x.com/VikParuchuri/status/2079545884681830784.