Aioga
AI资讯 / 产品更新
返回 AI资讯

Datalab Marker v2 发布:三模式管道在 olmOCR-bench 上达 76.0,速度超 MinerU 5 倍以上

MarkTechPost(RSS)Aioga 编辑团队2026-07-25T04:42:47.000Z热度 55

Datalab 将 Marker 重写为三模式管道,v2 版本在 olmOCR-bench 上达到 76.0 分,单张 B200 上每秒处理 2.9 页--速度是 MinerU...

产品更新MarkTechPost(RSS)

今日 AI 情报摘要

Datalab 将 Marker 重写为三模式管道,v2 版本在 olmOCR-bench 上达到 76.0 分,单张 B200 上每秒处理 2.9 页--速度是 MinerU 管道后端的 5

倍以上,同时在准确率和速度上均优于 Docling。

中文正文 · AI 翻译

Datalab 发布了 Marker 2:https://pxllnk.co/c1pzvpb,这是其开源文档转换管道的完全重写版本。Marker 可以将 PDF、图像、PPTX、DOCX、XLSX、HTML 和 EPUB 文件转换为 Markdown、JSON、HTML 或分块格式。Datalab 团队围绕之前几个月发布的三个组件对其进行了重建:Surya OCR 2、一款 2000 万参数的快速布局模型,以及重建后的 pdftext,其速度是以前的 3 倍。

主要结果来自 olmOCR-bench:https://github.com/allenai/olmocr/tree/main/olmocr/bench,这是 Allen AI 提供的第三方基准测试。Marker 2 的:https://pxllnk.co/c1pzvpbbalanced 模式总体得分为 76.0%,在原生数字 PDF 上得分为 83.5%。在单个 B200 GPU 上可维持每秒 2.9 页的速度。这是 MinerU 的管道后端吞吐量(每秒 0.54 页,总得分 72.7%)的 5 倍以上。在同一测试环境下,Docling 的得分为 50.3%,速度为每秒 2.1 页。

Marker 2:https://pxllnk.co/c1pzvpb 提供了三种转换路径,而不是单一路径:

模式现在默认会根据设备进行选择:在 GPU 上为 balanced,在 CPU/MPS 上为 fast,可以通过 --mode 覆盖。全面的 CPU 支持是第二个结构性变化。fast --disable_ocr 不需要 GPU 或推理服务器,而 2000 万参数的布局模型仍然可以在 CPU 上读取列、表格和标题。

第三个变化是架构上的,也是产生吞吐量数据的原因。多个轻量 CPU 工作线程共享单个 Surya 推理服务器。父进程会在它们之间分配 VLM 并发资源,因此吞吐量随服务器容量而不是每个进程的显存而扩展。Datalab 报告称,balanced 模式在相同硬件上可维持约每秒 2.9 页,而单流速度约为每秒 0.3 页。

在升级前值得注意的重大变更。现在需要 Python 3.10 及以上版本。打包方式从 Poetry 转移到 uv,使用 hatchling 作为构建后端,但 pip install marker-pdf 保持不变。结构化提取转换器和提取器已被移除;Datalab 建议用户使用托管 API 或 --use_llm 工作流。

评分基准是来自 Ai2 的 olmOCR-bench:1,403 个 PDF,约 8,400 个通过/未通过的单元测试,涵盖数学渲染、表结构、读取顺序、页眉页脚以及旧扫描件。总体得分是 8 个类别的宏平均值,使用官方 olmOCR-bench 检查器计算。吞吐量是单个 B200 主机上持续的并发页/秒,而非单流延迟。

关于来源的说明。olmOCR-bench 是 Ai2 的第三方基准,但以下所有得分和吞吐量数据均来自 Datalab 自身的运行。所有数据都可以通过 Marker 仓库中的开放测试框架重复获得,仓库中提供了 MinerU、Docling 和 LiteParse 的竞争对手运行器,以及 Marker 自身的运行器。

这些数字也反映了在单一硬件设置下对一个基准的文档组合的测量结果,因此在您自己的文档上可能会有所不同。评估这些系统的团队应对其自己的语料库运行测试框架,这是了解四种系统在实际处理文档时表现的唯一方法。

Datalab Marker v2 发布:三模式管道在 olmOCR-bench 上达 76.0,速度超 MinerU 5 倍以上

MinerU 的管线后端在架构上最为相似。两者都读取 PDF 文本层并选择性地进行 OCR。在总体得分上,Marker balanced 以 76.0 对 72.7 领先。在原生数字文档上,两者基本持平:83.5 对 83.3。

区别在于吞吐量。Marker balanced 可持续 2.9 页/秒,而 MinerU 为 0.54 页/秒,高得分下差距为 5.4 倍。Marker fast 可持续 7.4 页/秒,大约是 MinerU 管线速度的 13.7 倍,但得分低于 MinerU 6.1 分以实现该速度。

MinerU 还提供了一个 VLM 后端,Datalab 表示其得分高于管线后端。该后端采用全页 VLM 方法,未在本表中列出。评估 MinerU 的 AI 团队应单独对该路径进行基准测试。

Docling 在 GPU 管线中差距最大。Marker balanced 总得分以 76.0 对 50.3 领先,原生数字文档得分 83.5 对 64.0,同时运行速度更快:2.9 页/秒对 2.1 页/秒。Datalab 指出,Docling 在其默认管线上运行,该管线在原生数字页面使用文本层,在图像区域使用 OCR。

Docling 的支点是治理和格式广度,而非准确性。其代码库采用 MIT 许可证,起源于 IBM 研究院,并作为 LF AI & Data Foundation 的一个项目进行托管。其输入列表也扩展到了音频和电子邮件格式,而不仅限于文档。

LiteParse 来自 LlamaIndex 团队,是一个 Rust 文档解析器。它不在同一维度竞争。在 CPU 上其整体得分为 22.4,关闭 OCR 时为 20.4,而 Marker 的 CPU-only 模式得分为 43.6。

但禁用 OCR 的 LiteParse 报告速度为 1721 页/秒——约为 Marker CPU 模式的 73 倍,这就是权衡。Marker 快速的 --disable_ocr 在 CPU 上运行 2000 万布局模型仍能还原结构,这就是为什么其得分超过纯文本转储的两倍。LiteParse 没有布局模型,遇到任何非线性内容就会崩溃。

Datalab 团队强调,Marker 设计为管道而非 VLM,澄清了这些是不同的工具。在此次评估中,其托管的 Chandra 2 得分为 85.8,而通过 API 的 Gemini Flash 3.5 得分为 76.4。Datalab 的 Chandra 仓库还在单独的表格中将 Ai2 的 olmOCR 2 定位为 82.4,将 dots.ocr 1.5 定位为 83.9。对于扫描件、数学密集页以及实现顶级准确率,VLM 层级仍优于所有列出的管道工具。

Marker 的平衡模式将整体性能差距缩小到仅比 Gemini Flash 3.5 落后 0.4 分,并且在原生数字文档上的表现甚至优于其,得分 83.5 对 79.1——无需每页调用 API。

你选择的模式会改变失败模式,而不仅仅是得分。每行表示一个 olmOCR-bench 类别,在三种模式下进行评分。数学是尖锐点:快速模式从 PDF 文本层读取公式,而非进行 VLM-OCR,因此 arXiv 数学得分从 83.9 降至 23.4,--disable_ocr 在此处得分设计为 0.0。除两类数学外,旧扫描件是每种模式下最弱的一类,最高仅为 43.2。

Datalab Marker v2 发布:三模式管道在 olmOCR-bench 上达 76.0,速度超 MinerU 5 倍以上

这是四个系统在商业团队中分化最明显的地方:

仅凭分数无法选择工具。语料类型、硬件、许可类别和输出格式决定选择。尝试下面的交互式选择器,通过约束和工具筛选十种部署场景,看看哪个解析器适合你的使用场景。

链接:GitHub 仓库:https://pxllnk.co/c1pzvpb | 发布说明:https://github.com/datalab-to/marker/releases/tag/v2.0.0 | 博客文章:https://www.datalab.to/blog/marker-2 | 公告推文:https://x.com/VikParuchuri/status/2079545884681830784

Datalab Marker v2 发布:三模式管道在 olmOCR-bench 上达 76.0,速度超 MinerU 5 倍以上

Asif Razzaq 是 Marktechpost Media Inc. 的首席执行官。作为一位有远见的企业家和工程师,Asif 致力于利用人工智能的潜力造福社会。他最近的创举是推出人工智能媒体平台 Marktechpost,该平台以对机器学习和深度学习新闻的深入报道而闻名,内容既技术性强又易于广泛受众理解。该平台每月浏览量超过 200 万次,显示了其在受众中的受欢迎程度。

Designing High-Performance GPU Kernels with TileLang: Tensor-Core GEMM, Fused Softmax, FlashAttention, and Autotuning

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:Datalab 将 Marker 重写为三模式管道,v2 版本在 olmOCR-bench 上达到 76.0 分,单张 B200 上每秒处理 2.9 页--速度是 MinerU 管道后端的 5 Aioga 将其归入「产品更新」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:产品与工具类动态的价值取决于它是否解决明确场景、能否进入工作流,以及交付、价格和数据安全是否可接受。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察产品是否开放使用、用户反馈、定价、集成能力和后续版本更新。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: marktechpost.com

来源: MarkTechPost(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-25T04:42:47.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Datalab 将 Marker 重写为三模式管道,v2 版本在 olmOCR-bench 上达到 76.0 分,单张 B200 上每秒处理 2.9 页--速度是 MinerU...

MarkTechPost(RSS)2026-07-25T04:42:47.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。