Aioga
AI资讯 / 行业动态
返回 AI资讯

Hugging Face 与 Ai2 发布 BenchMIRT:从题目层面审计 LLM 基准究竟测了什么

Hugging Face:Blog(RSS)Aioga 编辑团队2026-09-01T21:39:07.000Z热度 58

Hugging Face 博客介绍 BenchMIRT,一种基于多维 IRT 在单个题目层面审计 LLM 基准的方法,训练数据覆盖 100 个 LLM、16 个基准和超过 34...

行业动态Hugging Face:Blog(RSS)

今日 AI 情报摘要

Hugging Face 博客介绍 BenchMIRT,一种基于多维 IRT 在单个题目层面审计 LLM 基准的方法,训练数据覆盖 100 个 LLM、16 个基准和超过 34K 道题。

中文正文 · AI 翻译

在基准测试中寻找信号:#finding-the-signals-inside-a-benchmark BenchMIRT揭示了现有基准测试的哪些信息:#what-benchmirt-reveals-about-existing-benchmarks 用更少的问题做更多事情:#doing-more-with-fewer-questions 这对LLM评估可能意味着什么:#what-this-could-mean-for-llm-evaluation 📄 技术报告: http://allenai.org/papers/benchmirt:http://allenai.org/papers/benchmirt | 📊 数据: https://huggingface.co/collections/allenai/benchmirt:https://huggingface.co/collections/allenai/benchmirt | 💻 代码: https://github.com/allenai/BenchMIRT:https://github.com/allenai/BenchMIRT

BenchMIRT blog draft latest - Google Docs-image-1 (3)

:https://cdn-uploads.huggingface.co/production/uploads/638e39b249de7ae552d977b5/jlxf_E3loRcUO5Pu936zP.png

今天我们介绍BenchMIRT,一种用于在单个提示级别审核LLM基准测试的新方法——也就是模型评分所依据的问题和任务。

基准测试通常是为了测量特定能力而设计的,例如安全性、通用推理或遵循指令。但其中的单个任务可能依赖的不仅仅是所声明的目标。以BBQ为例,这是一个用于测试模型是否依赖社会刻板印象的基准测试。一个问题是关于孙子和祖父试图预订Uber的情景。它考察年龄偏见,但同时还要求模型追踪谁是谁,并根据提供的证据而非假设进行推理。

即使在单一基准测试中,不同的问题和任务组也可能测量不同的内容。例如,WildJailbreak包括有害的越狱提示,以及设计来测试模型是否也拒绝无害请求的良性提示。有害提示与安全性更紧密相关,而良性提示与通用推理更紧密相关。将它们平均到一个基准分数中可能掩盖了这种差异。

BenchMIRT帮助研究人员分离这些信号,看看到底是什么在推动基准测试的分数。它通过分析模型在每个问题或任务上的表现,并估计哪些底层能力与答对该问题最密切相关来实现这一点。

BenchMIRT 从项目反应理论(IRT)中获得启发,IRT 是起源于心理测量学的一种技术——该领域关注通过测试反应模式测量能力和特质。IRT 基于一个简单的想法:不是每个问题都能告诉你关于测试者的相同信息。有些问题比其他问题更难,有些问题则更能区分表现强与表现弱的人。

研究人员此前曾将单维 IRT 应用于各个基准测试,包括我们的 Fluid Benchmarking 工作。BenchMIRT 将该方法扩展为多维 IRT,或称 MIRT,使其能够区分可能影响同一问题表现的多种能力。

BenchMIRT 在模型层面和问题层面都应用 IRT。对于给定模型,它估计模型在所选基准测试中反映的各项能力上的强度。对于每个问题,它估计问题的难度以及问题在区分能力较强或较弱模型方面的效果。

我们在从 100 个大型语言模型获取的 16 个基准测试和超过 34K 个问题的基准结果上训练了 BenchMIRT。其中六个基准测试衡量通用推理能力,包括 MMLU-Pro、GPQA、MATH 和 BBH。其他十个基准测试来自我们的 Olmo 3 安全套件,包括 HarmBench、StrongReject、WildJailbreak、BBQ、WMDP 和 XSTest。

关键是,我们没有告诉 BenchMIRT 哪些基准测试衡量哪些能力。它独立发现了两个主要维度:安全性和通用推理能力。当我们从头重复分析时,每次都会出现这两个相同维度,这表明结果是稳定的,而不是特定于某次分析。

BenchMIRT blog draft latest - Google Docs-image-2 (1)

:https://cdn-uploads.huggingface.co/production/uploads/638e39b249de7ae552d977b5/emqg9ENtMBcpo4S86cxy3.png

BenchMIRT blog draft latest - Google Docs-image-3 (1)

:https://cdn-uploads.huggingface.co/production/uploads/638e39b249de7ae552d977b5/LMPWH4haeYge_HJInjhai.png

对于许多基准测试,BenchMIRT 在很大程度上确认了它们的预期焦点:在推理基准测试中表现强劲与推理能力相关,而在越狱和有害内容基准测试中表现强劲与安全性相关。

但 BenchMIRT 也在一些评估中揭示了更加复杂的情况。

BBQ 用于评估社会偏见,通常被归类于安全基准,在 BenchMIRT 的分析中与一般推理的相关性要强得多。这意味着低 BBQ 得分可能部分反映了理解或推理某些问题的困难,而不仅仅是安全行为。

WMDP 的表现与大多数安全基准不同。它测试生物学、化学和网络安全等领域的危险双用知识——例如,可能帮助人滥用生物制剂或利用计算机系统的知识。BenchMIRT 发现 WMDP 得分与一般推理的关联比与安全性的关联更强。然而,更强的一般推理能力与较低的 WMDP 得分相关,因为该基准将拒绝或未能提供危险知识视为期望的回答。

这些发现不一定意味着这些基准存在缺陷或不完整。相反,它们表明,单一基准得分可能结合了几种不同的信号——BenchMIRT 可以帮助解开这些信号,使得分更易于解释。

:https://cdn-uploads.huggingface.co/production/uploads/638e39b249de7ae552d977b5/ue15HltywHtVyTIud5YlY.png

Harmbench 的两个维度下的题目难度和辨别力。维度 0 模拟安全维度,维度 1 对应一般推理维度。

:https://cdn-uploads.huggingface.co/production/uploads/638e39b249de7ae552d977b5/J18F7xrVwgaA68xg92Hs1.png

条形的大小和方向显示在 100 个开放权重 LLM 中,BenchMIRT 能力得分与基准得分之间的皮尔逊相关系数(范围 −1 到 1)——粉色表示一般推理,青绿色表示安全;条形向左延伸表示负相关。加粗带下划线表示每行更强的相关性,除非两者太接近无法区分;星号表示 p 值。

BenchMIRT 还可以帮助识别评估中哪些问题对基准试图测量的能力最具信息性。

利用 BenchMIRT 的题目级估计,我们对训练 BenchMIRT 所使用的相同 16 个基准的题目进行了排序,并保留那些在区分强模型和弱模型方面表现最好的题目,同时仍保持容易题和难题的混合。

在这些基准测试中,只保留10%的问题通常仍然能够几乎保持完整问题集所显示的模型在基础安全性或推理能力上的强弱情况。保留50%的问题通常能更接近地匹配完整基准测试对这些能力的衡量。

BenchMIRT 还可以利用它在模型和问题之间学到的模式,预测模型在未观察到的基准问题上的表现。在我们的实验中,它正确预测模型是否能正确回答保留的问题的准确率为79%。相比之下,另一种更简单的方法假设模型在每个问题上的表现大致与其在整个基准测试上的表现相当,其准确率为70%。

实际上,这意味着 BenchMIRT 可以更精确地估计模型的表现,基于它已学到的模型能力和每个问题的要求,而无需对每个模型的每个问题进行评估。

BenchMIRT 提供了一种更好地理解和优化研究人员用于评估模型能力的基准测试的方法。通过查看单个问题而不仅仅是整体分数,它可以揭示基准测试何时将不同能力混合在一起,识别表现与其他问题不同的题目群组,并发现那些对基准测试旨在衡量的能力提供信息有限的问题。

这其中存在重要限制。用于训练和评估 BenchMIRT 的模型均在 2025 年 3 月前发布,因此我们的分析未涵盖 BenchMIRT 在新一代大型语言模型上的表现。而 BenchMIRT 发现的维度取决于所给的基准测试集合——在我们为本项目选择的16个基准测试中,安全性和推理能力成为主要维度,但不同的评估组合可能会显现不同的潜在能力。

也存在权衡。如果目标是根据模型在随机保留题目上的预测表现来排名,基准测试的平均分略优于 BenchMIRT。BenchMIRT 的优势在于它能提供对单个问题表现的更细致分析。

这种问题级别的细节也可能有双重影响:同样的估计既可以帮助识别基准中最具信息性的安全问题,也可能被用来删除这些问题,从而产生一个不安全的模型也能通过的较弱评估。现有工具已经可以以类似方式修剪评估,我们认为对基准问题实际测量内容的透明度增加是值得冒这个风险的——但这确实是一个真实存在的风险。

尽管如此,我们仍然将 BenchMIRT——以及未来类似的工具——视为朝着更有针对性的基准设计和高效评估迈出的一步。通过展示哪些问题实际上在推动基准结果,这些方法可以帮助研究人员构建更小、更专注且更易于解读的评估,同时更清晰地展示其旨在测量的能力。

情报判断

Aioga 编辑摘要

Hugging Face 博客介绍了 BenchMIRT,一种在单个题目或任务层面审计大语言模型基准的方法。其训练数据覆盖 100 个 LLM、16 个基准和超过 3.4 万道题。

背景分析

BenchMIRT 借鉴项目反应理论,并扩展为多维项目反应理论,用于分析不同题目对模型表现的影响。来源举例称,BBQ 题目可能同时涉及年龄偏见、身份追踪和基于证据推理,WildJailbreak 中不同题目组也可能对应不同信号。

Aioga 观点

Aioga 判断:BenchMIRT 的重点不只是比较模型分数,而是追问分数由哪些题目和潜在能力共同驱动。把基准拆到题目层面,可能有助于识别单一总分掩盖的测量差异。

影响与后续

可能影响:基准评测的解读需要关注题目构成及其区分度,单一平均分不足以说明模型具备某项能力。该方法可能为评测审计提供补充,但不代表仅凭题目层面分析即可完整定义模型能力。 后续观察:需要关注 BenchMIRT 在不同基准和题目集合上的审计结果,以及研究者如何使用其数据、技术报告和代码;这些材料是否改变基准分数的解读,仍待进一步观察。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: huggingface.co

来源: Hugging Face:Blog(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-01T21:39:07.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Hugging Face 博客介绍 BenchMIRT,一种基于多维 IRT 在单个题目层面审计 LLM 基准的方法,训练数据覆盖 100 个 LLM、16 个基准和超过 34...

Hugging Face:Blog(RSS)2026-09-01T21:39:07.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。