Aioga
AI资讯 / 技巧观点
返回 AI资讯

Datalab 发布 Marker 2:在 olmOCR-bench 上达 76.0 分,吞吐量超 MinerU 5 倍

MarkTechPost(RSS)Aioga 编辑团队2026-07-25T02:14:53.000Z热度 51

Datalab 将 Marker 重写为三模式管道,推出 Marker 2。该版本在 olmOCR-bench 上取得 76.0 分,在单块 B200 上保持每秒 2.9 页的...

技巧观点MarkTechPost(RSS)

今日 AI 情报摘要

Datalab 将 Marker 重写为三模式管道,推出 Marker 2。

该版本在 olmOCR-bench 上取得 76.0 分,在单块 B200 上保持每秒 2.9 页的吞吐量,速度超过 MinerU 后端 5 倍以上,同时在准确率和速度上均优于 Docling。

中文正文 · AI 翻译

Datalab 发布了 Marker 2:https://pxllnk.co/c1pzvpb,这是其开源文档转换管道的完全重写版本。Marker 可以将 PDF、图像、PPTX、DOCX、XLSX、HTML 和 EPUB 文件转换为 Markdown、JSON、HTML 或分块格式。Datalab 团队围绕过去几个月发布的三个组件对其进行了重建:Surya OCR 2、一种 2000 万参数的快速布局模型,以及重建后的 pdftext,其速度是以前的 3 倍。

主要结果来自 olmOCR-bench:https://github.com/allenai/olmocr/tree/main/olmocr/bench,这是 Allen AI 提供的第三方基准测试。Marker 2 的:https://pxllnk.co/c1pzvpbbalanced 模式总体得分为 76.0%,在原生数字 PDF 上得分为 83.5%。它在单个 B200 GPU 上维持每秒 2.9 页的速度。这是 MinerU 的管道后端吞吐量(每秒 0.54 页,总得分 72.7%)的 5 倍以上。在同一测试环境下,Docling 的得分为 50.3%,速度为每秒 2.1 页。

Marker 2:https://pxllnk.co/c1pzvpb 提供了三种转换路径,而不是单一路径:

模式现在默认会根据设备进行调整:在 GPU 上为 balanced,在 CPU/MPS 上为 fast,可以通过 --mode 覆盖。全面的 CPU 支持是第二个结构性变化。fast –disable_ocr 不需要 GPU 或推理服务器,而 2000 万参数的布局模型仍然可以在 CPU 上读取列、表格和标题。

第三个变化是架构上的,也是产生吞吐量数据的原因。多个轻量 CPU 工作线程共享单个 Surya 推理服务器。父进程会在它们之间分配 VLM 并发资源,因此吞吐量随服务器容量而不是每个进程的显存而扩展。Datalab 报告称,balanced 模式在相同硬件上维持约 2.9 页/秒,而单流速度约为 0.3 页/秒。

升级前值得注意的重大变更:现在需要 Python 3.10 以上版本。打包工具从 Poetry 转为 uv,构建后端为 hatchling,但 pip install marker-pdf 命令保持不变。结构化提取转换器和提取器已被移除;Datalab 建议用户使用托管 API 或 –use_llm 工作流程。

评分基准是来自 Ai2 的 olmOCR-bench:1,403 个 PDF,约 8,400 个通过/未通过的单元测试,涵盖数学渲染、表结构、读取顺序、页眉页脚和旧扫描件。总体得分是 8 个类别的宏平均值,使用官方 olmOCR-bench 检查器计算。吞吐量是单个 B200 主机上持续的并发页/秒,而非单流延迟。

关于来源的说明。olmOCR-bench 是 Ai2 的第三方基准,但以下所有得分和吞吐量数据均来自 Datalab 自身的运行。所有数据都可以通过 Marker 仓库中的开放测试框架重复获得,仓库中提供了 MinerU、Docling 和 LiteParse 的竞争对手运行器,以及 Marker 自身的运行器。

这些数字也反映了在单一硬件设置下对一个基准的文档组合的测量结果,因此在您自己的文档上可能会有所不同。评估这些系统的团队应对其自己的语料库运行测试框架,这是了解四种系统在实际处理文档时表现的唯一方法。

Datalab 发布 Marker 2:在 olmOCR-bench 上达 76.0 分,吞吐量超 MinerU 5 倍

MinerU 的管线后端在架构上最为相似。两者都读取 PDF 文本层并选择性地进行 OCR。在总体得分上,Marker balanced 以 76.0 对 72.7 领先。在原生数字文档上,两者实际上持平:83.5 对 83.3。

区别在于吞吐量。Marker balanced 可持续 2.9 页/秒,而 MinerU 为 0.54 页/秒,高得分下差距为 5.4 倍。Marker fast 可持续 7.4 页/秒,大约是 MinerU 管线速度的 13.7 倍,但得分低于 MinerU 6.1 分以实现该速度。

MinerU 还提供了一个 VLM 后端,Datalab 表示其得分高于管线后端。该后端采用全页 VLM 方法,未在本表中列出。评估 MinerU 的 AI 团队应单独对该路径进行基准测试。

Docling 在 GPU 管线中差距最大。Marker balanced 总得分以 76.0 对 50.3 领先,原生数字文档得分以 83.5 对 64.0 领先,同时运行速度更快:2.9 页/秒 对 2.1 页/秒。Datalab 指出,Docling 在其默认管线上运行,该管线对原生数字页面使用文本层,对图像区域使用 OCR。

Docling 的支点是治理和格式广度,而非准确性。其代码库采用 MIT 许可证,起源于 IBM 研究院,并作为 LF AI & Data 基金会的项目进行托管。其输入列表还扩展到了音频和电子邮件格式,而不仅限于文档。

LiteParse 来自 LlamaIndex 团队,是一个 Rust 文档解析器。它并不在同一个维度上竞争。在 CPU 上,它的总体得分为 22.4,关闭 OCR 时得分为 20.4,而 Marker 的 CPU 模式仅得 43.6。

但禁用 OCR 的 LiteParse 报告速度为 1721 页/秒——大约是 Marker CPU 模式的 73 倍,这是权衡所在。Marker 快速的 –disable_ocr 模式在 CPU 上运行一个 2000 万布局模型,仍然能恢复结构,这就是为什么它的得分比纯文本导出的得分高出一倍以上。LiteParse 没有布局模型,遇到任何非线性内容都会崩溃。

Datalab 团队强调,Marker 设计为一个管道,而不是 VLM,澄清这两者是不同的工具。在此次评估中,他们托管的 Chandra 2 得分为 85.8,而通过 API 的 Gemini Flash 3.5 得分为 76.4。Datalab 的 Chandra 仓库在独立表格中也将 Ai2 的 olmOCR 2 定位为 82.4,dots.ocr 1.5 定位为 83.9。对于扫描件、重数学页面以及追求最高准确率,VLM 层仍然优于所有列出的管道。

Marker 的平衡模式将性能差距缩小到仅比 Gemini Flash 3.5 总体低 0.4 分,它在原生数字文档上甚至表现优于 Gemini Flash 3.5,得分为 83.5 对 79.1——而无需每页调用 API。

你选择的模式会改变故障特征,而不仅是得分。每一行代表一个 olmOCR-bench 类别,在三种模式下评分。数学是尖锐部分:快速模式从 PDF 文本层读取方程式,而不是用 VLM-OCR,所以 arXiv 数学得分从 83.9 掉到 23.4,而 –disable_ocr 在此处设计得分为 0.0。在两个数学类别之外,老扫描文档在每种模式下都是最弱的分组,最高仅为 43.2。

Datalab 发布 Marker 2:在 olmOCR-bench 上达 76.0 分,吞吐量超 MinerU 5 倍

这就是四个系统在商业团队中差异最大的地方:

仅仅看得分无法选择工具。语料类型、硬件、许可范围和输出格式才决定选择。尝试下面的交互式选择器,通过约束条件和工具过滤十种部署场景,看看哪个解析器适合你的用例。

链接:GitHub 仓库:https://pxllnk.co/c1pzvpb | 发布说明:https://github.com/datalab-to/marker/releases/tag/v2.0.0 | 博客文章:https://www.datalab.to/blog/marker-2 | 公告推文:https://x.com/VikParuchuri/status/2079545884681830784

Datalab 发布 Marker 2:在 olmOCR-bench 上达 76.0 分,吞吐量超 MinerU 5 倍

Asif Razzaq 是 Marktechpost Media Inc. 的首席执行官。作为一位有远见的企业家和工程师,Asif 致力于利用人工智能的潜力造福社会。他最近的创举是推出人工智能媒体平台 Marktechpost,该平台以对机器学习和深度学习新闻的深入报道而闻名,内容既技术性强又易于广泛受众理解。该平台每月浏览量超过 200 万次,显示了其在受众中的受欢迎程度。

Designing High-Performance GPU Kernels with TileLang: Tensor-Core GEMM, Fused Softmax, FlashAttention, and Autotuning

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:Datalab 将 Marker 重写为三模式管道,推出 Marker 2。 Aioga 将其归入「技巧观点」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:实践类内容的价值在于是否能被复现、是否有明确边界,以及它能否转化为稳定的开发或工作流方法。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察示例是否可复现、工具版本变化、社区反馈和实际成本。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: marktechpost.com

来源: MarkTechPost(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-25T02:14:53.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Datalab 将 Marker 重写为三模式管道,推出 Marker 2。该版本在 olmOCR-bench 上取得 76.0 分,在单块 B200 上保持每秒 2.9 页的...

MarkTechPost(RSS)2026-07-25T02:14:53.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。