Datalab Marker v2 对比 MinerU、Docling 与 Liteparse:文档解析基准全解析
Datalab发布文档解析工具Marker 2,olmOCR基准综合得分76%,单卡吞吐超MinerU五倍
AI 深度解读
Datalab 发布文档解析工具 Marker 的全新第二代版本(Marker 2),并用第三方基准 olmOCR-bench 证明其在准确率和速度上双双超越 MinerU、Docling 等主流开源方案,值得关注文档处理管线的团队一读。
- Marker 2 提供三种模式:balanced(用 Surya VLM 做版面识别,配合选择性重新 OCR)、fast(轻量版面检测器+pdftext,少量调用 VLM)、--disable_ocr(纯文本层提取,不调用 VLM,可全 CPU 跑)。
- 官方基准 olmOCR-bench 显示,balanced 模式综合得分 76.0%(原生数字 PDF 达 83.5%),单张 B200 GPU 上可跑到 2.9 页/秒,吞吐量超过 MinerU(72.7%、0.54 页/秒)5 倍以上;Docling 只有 50.3%、2.1 页/秒。
- 架构上改为“多个轻量 CPU worker 共享一个 Surya 推理服务”,由主进程统一调度 VLM 并发,吞吐量随服务端算力扩展而非受限于单进程显存。
- 升级存在若干 breaking changes:要求 Python 3.10+,打包从 Poetry 换成 uv+hatchling,结构化抽取转换器已移除,官方建议改用托管 API 或 --use_llm 方案。
- 对本地部署文档预处理/RAG 管线的团队,Marker 2 在“又快又准”上树立了新的性价比标杆,但升级前需评估 breaking changes 对现有集成的影响。
本内容由 AI 生成,仅供参考,请注意甄别