Aioga
AI资讯 / 论文研究
返回 AI资讯

Moonshot AI 发布 PerceptionBench:多模态模型视觉感知能力诊断基准

Moonshot AI:Kimi BlogAioga 编辑团队2026-07-15T16:00:00.000Z热度 70

Moonshot AI 发布 PerceptionBench,一个从 40 多个现有基准中模型实际失败案例归纳出的视觉感知基准,包含 10 项原子感知能力和 3000 道验证题...

论文研究Moonshot AI:Kimi Blog

今日 AI 情报摘要

Moonshot AI 发布 PerceptionBench,一个从 40 多个现有基准中模型实际失败案例归纳出的视觉感知基准,包含 10 项原子感知能力和 3000 道验证题。

所有测试模型准确率均未超过 60%,且大量正确答案在重复提问时无法复现,表明模型更多是猜测而非真正感知。 PerceptionBench 旨在精确诊断多模态 AI 的视觉感知断裂点,推动其实现忠实、一致的视觉理解。

中文正文 · AI 翻译

在多模态大语言模型中评估原子视觉感知能力

我们发布了 PerceptionBench,这是一个将视觉感知孤立出来并以一组原子能力进行评估的基准——这些能力是从当今模型的失败中发现的,而非事先定义的。通过将前沿模型在40个基准上的失败归因于其最早的视觉原因,我们提炼出了10种感知能力和3,000个经过验证的问题,每个问题都可以通过观察回答,无需推理或外部知识。

其结果是精确的诊断,而不是又一个分数。我们评估的没有一个模型能达到60%的准确率,且整体分数几乎相同的模型可能表现出截然不同的感知优劣。更令人惊讶的是,大量正确答案在重复提问时未能维持——这表明当前模型常常是猜测而非真正感知。PerceptionBench旨在暴露感知断裂的具体位置,并推动多模态AI朝着忠实且稳定的视觉理解迈进。

每个原始基准都捕捉了感知错误的一个狭窄切片,而这些切片之间的重叠很弱(平均成对加权Jaccard指数0.20)。没有单一基准或少数几个基准能覆盖感知的整体,这促使我们提出以能力为中心的基准,将这些零散视角进行汇总和平衡。

Per-benchmark error-type distributions and their weak pairwise overlap across existing benchmarks

该数据集包含3,000个高质量的经过验证的样本。其分布旨在从干扰因素中孤立出原子感知能力,并且通过三个核心设计原则自成特色:

质量说明:为了使基准成为可靠的黄金标准,所有样本都经过严格验证和难度平衡,仅保留真正的感知失败样本,并保证每个问题有唯一可验证的答案。

Visual Localization example

紫色的线连接到杯子的哪一部分?

Visual Localization example
Visual Attribute example

出现了多少种不同颜色的帽子?

Visual Attribute example

图片中有多少个红点?

Visual Counting example

u₁轴被分成多少个相等的子区间?

图中最右侧的音符接触了多少条五线谱线?

这些小立方体有多少个面直接接触地面?

右下角的方框内的数字是多少?

图片中有多少个动物剪影完全相同?

棋盘上有多少个黑色皇后?

有多少只猴子碰过方向盘罩?

单元格 x 位于多少个圆的交集中?

图中出现了多少个黄色空心环?

卡车里有多少人?

PerceptionBench 是一个简单但具有挑战性的基准测试,用于评估前沿模型的基本视觉感知能力。它衡量的是多模态模型实际看到的内容,而不是它们推断的内容,从而为当前和未来的多模态模型的感知能力提供了真实而细致的诊断。

情报判断

Aioga 编辑摘要

Moonshot AI 发布 PerceptionBench,将前沿模型在40多个既有基准中的失败追溯至最早视觉原因,归纳10项原子感知能力,并形成3000道经过验证的问题。

背景分析

现有基准各自覆盖较窄的感知错误类型,彼此重叠较弱,平均成对加权Jaccard为0.20。该基准因此采用能力导向方式,聚合并重新平衡分散的视觉感知测试。

Aioga 观点

Aioga 判断,PerceptionBench的价值不只在于提供总分,而在于区分模型具体的感知强弱。受测模型准确率均未超过60%,且相近总分可能对应明显不同的能力结构。

影响与后续

值得关注的是,大量正确答案在重复提问时未能保持,材料将其视为模型经常猜测而非真正感知的证据。这可能促使多模态评测进一步重视答案一致性与具体失效位置。 Aioga 判断,后续应关注基准是否公布更细的能力维度结果、重复提问设置与样本验证方法,并观察模型改进能否同时提升准确率和回答稳定性,而非只提高综合得分。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: kimi.com

来源: Moonshot AI:Kimi Blog

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-15T16:00:00.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Moonshot AI 发布 PerceptionBench,一个从 40 多个现有基准中模型实际失败案例归纳出的视觉感知基准,包含 10 项原子感知能力和 3000 道验证题...

Moonshot AI:Kimi Blog2026-07-15T16:00:00.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。