Aioga
AI资讯 / AI资讯
返回 AI资讯

Newer Models, Same Advantage

Hugging Face:Blog(RSS)Aioga 编辑团队2026-07-16T11:49:48.000Z热度

Newer Models, Same Advantage。该动态由 Hugging Face:Blog(RSS) 发布,Aioga 已同步发布时间、来源和原文入口,并将继续跟踪...

AI资讯Hugging Face:Blog(RSS)

今日 AI 情报摘要

Newer Models, Same Advantage。

该动态由 Hugging Face:Blog(RSS) 发布,Aioga 已同步发布时间、来源和原文入口,并将继续跟踪官方更新与行业反馈。

中文正文 · AI 翻译

三个月前,我们发布了一篇关于DharmaOCR的论文:https://arxiv.org/abs/2604.14314,并开源了其中的一个模型:https://huggingface.co/Dharma-AI/Dharma-OCR-LITE。其目标非常明确:面向巴西葡萄牙语的光学字符识别。

Newer Models, Same Advantage

训练流程分为两个阶段。第一阶段是监督式微调,利用来自不同来源、格式和复杂程度各异的葡萄牙语文件的大量集合。这一阶段将模型的权重与巴西葡萄牙语的特定词汇、句法和文档结构对齐——将表征能力集中在目标语言上,而不是分散在更广泛的多语言空间中。第二阶段应用了直接偏好优化(Direct Preference Optimization,DPO):模型不仅仅在正确转录上进行训练,而是从相互竞争输出之间的比较偏好数据中学习,从而在推理时始终选择更优的提取结果。该阶段解决了不同的问题:不是准确性,而是稳定性。通过抑制会导致生成模型产生重复或不连贯输出的失败模式,DPO减少了推理时间和成本,并显著提升了模型在生产中提供结果的可靠性。

最终的综合结果是,在面向葡萄牙语的基准测试中,该模型以最低的退化率获得了最高的提取质量分数。两个阶段都是必要的。微调阶段建立了领域能力;DPO阶段确保了这种能力在模型容易失败的条件下依然稳健。

OCR模型发展迅速。但最初促使DharmaOCR设计的差距(在处理复杂文档的提取质量和生产环境下的模型稳定性方面)仍未消失。实际上,随着该领域的变化,这些差距反而变得更具启发性。

多模态生成模型的普及使基于语言模型的OCR广泛可用,随后出现的一系列微调OCR变体反映了这一采用速度之快。然而,这种普及并没有改变该技术的基本特性。所有建立在生成模型上的OCR系统都是概率性的。转录错误是这种概率技术固有的变量。模型之间的区别在于它们产生错误的数量和类型。这由两方面决定:模型的结构(其架构和参数数量)以及这些参数是如何为任务训练的。

架构和参数数量确定了模型能够学习的上限。训练决定了这种能力如何分配。

这一区别说明了专门化是一个结构性问题,而不是设计偏好。当模型在受限领域训练——单一语言、有限的文档类型或特定任务——其所有参数都专注于该特定任务。当模型被训练以涵盖更广泛的领域——例如处理N种语言的多语言模型——这些相同的参数必须分布在所有领域。分配不是线性的:神经元叠加原理意味着个别参数可以同时编码多个特征。但这种分配是真实的,其后果也是实实在在的。涵盖更多领域的模型在任何特定部分的投入都会减少。

DharmaOCR的训练是反向接受这一约束的。该模型并没有被设计为其他语言的最佳选择,也从未打算如此。作为交换,网络可用的每一个参数都可以面向巴西葡萄牙语的特定词汇、形态和正字法模式——对该领域的模型资源实现了最直接的使用。

这种集中化是相对于多语言及更广泛领域模型的固有优势的结构基础。这一优势并不依赖于拥有比竞争对手更大的架构或更复杂的训练程序——新架构和新训练技术提高了任何模型的能力。它依赖于这些资源被指向的方向:集中在一个领域,而不是分散在多个领域。

三个月后,更先进的模型已经出现。当这些模型更新且功能更强时,专门化的理由是否仍然成立,这是一个不同的问题。

DharmaOCR 论文发布三个月后,两个新的 OCR 模型在研究界引起了广泛关注:Mistral OCR4 和 Unlimited-OCR。它们都代表了真正的技术进步——新的训练技术、新的数据集,以及在多语言和各种基准评估中的出色表现。这类模型会提高 OCR 系统所预期达到的竞争标准。

当我们将两者在 DharmaOCR 基准上进行测试时——该评估是专门针对葡萄牙语设计的——结果是明确的。

DharmaOCR 得分 0.925。Mistral OCR4 得分 0.798。Unlimited-OCR 得分 0.7587。

差距很显著。Mistral OCR4 比 DharmaOCR 低约 13 分;Unlimited-OCR 比 DharmaOCR 低超过 16 分。两者均在我们的模型之后发布,且都拥有可观的研究资源。在 DharmaOCR 的基本设计决策是完全专注于葡萄牙语的任务中,专门化优势是可测量且显著的。

基准测试是核心发现。以下内容说明了为什么这种差距呈现出特定的形式。

处理非平凡的葡萄牙语文档会精确地揭示多语言模型容易出错的地方。ENEM 论文(巴西全国高中考试)结合了手写文本、特定于巴西葡萄牙语的词汇、专有名词和文化参考。它们正是语言特定训练能够产生收益的文档类型。

:https://cdn-uploads.huggingface.co/production/uploads/67b22efa9b36260fe286e99f/XVbylBZ_TyY98EvfkO9pT.png

图 1:用于基准评估的 ENEM 论文手稿及每个模型的输出。错误识别部分用红色标出。

Mistral OCR4 在评估这类文档时,将名字 Chico Buarque(巴西最著名的音乐家和诗人之一)识别为 “Chico Barque”。Unlimited-OCR 将同一个名字识别为 “chico bique”。当面对短语 “O Brasil não exclui, assimila”(“巴西不排斥,而是同化”,这是嵌入同一文档的 Chico Buarque 引用)时,Unlimited-OCR 输出了:“a dose de chico bique, 'o Brasil no exclu, eliminila.'”

这些并非随机错误。对巴西葡萄牙语接触不足的模型不会随意失败——它会在精确区分巴西葡萄牙语与更广泛多语种语料的词汇和专有名词上出现失误。Chico Buarque 并不是一个不为人知的参考;这个名字在全国范围内都是公认的。它在输出中系统性被损坏并不是边缘情况,而是一种诊断:显示模型训练存在的缺口。

DharmaOCR 在同一文档的评估中能够正确处理这些情况。原因直接:模型的训练集中在该语言空间,将资源集中在巴西葡萄牙语特有的词汇和专有名词分布上,而不是同时分散到多种语言。

这些例子说明了基准测试,而不是替代它。基准测试确定了差距的规模;这些例子显示差距为何集中在语言特定识别能力上,而非总体能力上。

然而,抽取准确性只是生产性能的一个维度。视觉困难下的稳定性是另一个维度——在实际操作中,失败的影响更为显著。

当生成模型遇到无法清晰解析的文档——小字体、扫描质量低、手写密集——它的输入信号就会出现不确定性。在主要以下一个标记预测目标训练的模型中,这里存在特定脆弱性:当视觉信号变得模糊时,模型可能会继续基于先前学习的模式生成内容,而非依赖源文档。结果是文本退化——输出重复、无序且与页面内容语义脱节。

面对小字体文档时,Mistral OCR4 生成的输出与文档所写内容没有关联。

:https://cdn-uploads.huggingface.co/production/uploads/69d815b52c6db28cfdfdd422/3YRHeWDsJ8twDlf7ArbZr.png

:https://cdn-uploads.huggingface.co/production/uploads/67b22efa9b36260fe286e99f/yBwDuIrqnY0xQ8RLY5Gbe.png

图 3:DharmaOCR 输出与 Mistral OCR4 退化输出

这不是源文本的低质量转录。这属于完全不同类别的失败。

其操作性后果不同于转录错误。错误的转录是可恢复的——它与源文档存在关系,原则上可以识别并纠正。退化的输出没有这种关系。它无法被纠正,因为没有可纠正的对象。对于依赖结构化 OCR 输出的后续流程——文档分类、信息提取、合规工作流——退化输出并不是“不准确的数据”。它是结构上无法使用的数据。自动化本应带来的效率在输出停止成为信息的那一刻被抵消。

Mistral OCR4 和 Unlimited-OCR 是性能良好的模型,背后有显著的技术进步。这里描述的退化行为并不定义它们;它仅指出当前训练在该领域未解决的特定失败条件。问题是,设计用于解决这个问题的训练流程应是什么样的。

在 DharmaOCR 中,答案是 DPO 阶段。

监督微调将模型的资源集中在目标领域——也就是构建上述语言对齐的阶段。但 SFT 是针对单个 token 进行训练:模型根据前面的上下文学习生成正确的下一个 token。在视觉复杂性下,这就产生了退化的条件。如果输出中的早期 token 与源文档偏离,则后续每个预测都基于该偏离状态,输出会继续漂移。在这种情况下,重复循环和不连贯序列是固有特性——它们是逐步优化目标而未考虑整体提取一致性的可预测结果。

DPO 针对不同的信号进行训练。SFT 是逐个 token 训练,而 DPO 则针对完整输出的质量训练模型——教它基于整个抽取的连贯性来区分竞争的响应,而不是单个预测的准确性。其效果具有稳定性:在视觉复杂性可能引发漂移的文档中,模型不太可能偏离路径,因为训练会惩罚在抽取层面失去连贯性的输出。

结果是原始基准测试所展示的:在同样的文档上,经过此训练阶段的模型表现出较低的退化率,同时抽取准确率更高,而没有此训练阶段的模型则会失去连贯性。

基准测试确立了今天的事实。但对两年后的情况则没有那么明确。

有可能——也很可能——更新的模型最终会在巴西葡萄牙语上超越当前的 DharmaOCR。架构会改进。训练技术会进步。数据集会扩展。整个领域在各个层面都朝着更高能力发展,没有理由认为这一趋势会停止。这是可以预期的,也是值得欢迎的。

每一代架构改变的是绝对性能的上限。不会改变的是决定在特定领域中哪些系统最接近其上限的结构逻辑。

可用资源——计算能力、参数量、训练数据——都是有限的,必须有所指向。将资源集中于单一领域的系统,在该领域的提取效率将高于将相同资源分散于多个领域的系统。无论通用模型能力如何增强,这种关系都成立。随着架构改进,专家模型与通用模型之间的差距可能会变化。结构性动态不会逆转。我们在之前一篇文章中更深入探讨了这一原理,讲述了为何随着 AI 系统的发展,专业化仍然会带来优势(Why Specialization Is Inevitable:https://huggingface.co/blog/Dharma-AI/why-specialization-is-inevitable)。

这就是塑造Dharma处理下一步的方法。目标不是去维护当前模型在基准测试中的位置,而是保持在新兴技术的前沿——新的架构、新的训练方法、对齐和评估的新方法——并将它们调整应用到同一个目标上:一个专用于巴西葡萄牙语OCR的系统,能够在最少成本和最短推理时间内最大限度地利用可用资源。

更好的工具不会与专业化对立。它们拓展了专业化可以实现的成就。

三个月前,我们展示了将模型的训练集中在特定领域上,相较于通用系统(包括更先进、资源更充足的系统)会产生可测量的优势。这种优势得到了保持。相同的原则将决定DharmaOCR如何继续发展——不是通过保持固定,而是通过将领域内的任何进展应用到这个固定的领域上。

在Hugging Face上探索Dharma AI:https://huggingface.co/Dharma-AI 试用我们的互动演示:https://huggingface.co/spaces/Dharma-AI/DharmaOCR-demo 下载我们的开源模型:https://huggingface.co/Dharma-AI/Dharma-OCR-LITE,了解专业化AI系统如何在实际企业应用中优于通用模型。

从文档图像中提取文本和表格

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:DharmaOCR 在针对巴西葡萄牙语的基准测试中取得 0.925 分,而 Mistral OCR4 和 Unlimited-OCR 分别仅获 0.798 和 0.7587 分。 Aioga 将其归入「AI资讯」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:AI 行业动态需要结合来源、时间、实际可用性和后续反馈判断,标题或单次发布本身不能替代完整证据。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察原文更新、官方说明、用户反馈和同类产品的后续动作。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: huggingface.co

来源: Hugging Face:Blog(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-16T11:49:48.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Newer Models, Same Advantage。该动态由 Hugging Face:Blog(RSS) 发布,Aioga 已同步发布时间、来源和原文入口,并将继续跟踪...

Hugging Face:Blog(RSS)2026-07-16T11:49:48.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。