Kimi.ai 发布 PerceptionBench,一个从当前前沿模型在 42 个基准上的失败模式中归纳出的视觉感知基准。
该基准将视觉感知拆解为 10 种原子能力,并构建了 3000 道验证题,每道题只考察单一感知能力,无需推理或外部知识。
Kimi.ai는 현재 최첨단 모델의 42개 벤치마크에서 실패 패턴을 요약한 시각 인식 벤치마크인 PerceptionBench를 발표했습니다. 이 벤치마크는 시각 인식을 10가지 기본 능력으로 분해하고, 각 문제마다 단일 인식 능력만을 시험하는 3000개의 검증 문제를 구축했으며...
Kimi.ai는 현재 최첨단 모델의 42개 벤치마크에서 실패 패턴을 요약한 시각 인식 벤치마크인 PerceptionBench를 발표했습니다. 이 벤치마크는 시각 인식을 10가지
기본 능력으로 분해하고, 각 문제마다 단일 인식 능력만을 시험하는 3000개의 검증 문제를 구축했으며, 추론이나 외부 지식이 필요하지 않습니다.
Kimi.ai 发布 PerceptionBench,一个从当前前沿模型在 42 个基准上的失败模式中归纳出的视觉感知基准。
该基准将视觉感知拆解为 10 种原子能力,并构建了 3000 道验证题,每道题只考察单一感知能力,无需推理或外部知识。
Kimi.ai 发布视觉感知基准 PerceptionBench。该基准源自对当前前沿模型在 42 个基准上失败模式的归纳,包含 3000 道验证题。
PerceptionBench 将视觉感知拆解为 10 种原子能力。按照发布材料,每道验证题仅考察一种感知能力,不要求模型进行推理,也不依赖外部知识。
Aioga 判断,这种单项能力拆解方式有助于更清晰地定位模型的视觉感知薄弱环节,并减少推理能力或外部知识对测试结果的干扰。
该基准可能为视觉模型评测提供更细粒度的观察框架。值得关注的是,其题目设计能否稳定区分不同模型在各类原子感知能力上的表现。 下一步值得关注 PerceptionBench 的具体题型、评测方法与使用方式,以及后续是否披露不同前沿模型在 10 种原子能力上的测试结果。
수집 피드는 제목, 요약, 출처와 원문 링크를 제공합니다. Aioga는 원문 전체를 재게시하지 않습니다.
수집 채널: 요약 집계 · 원본 도메인: x.com
출처: X:Kimi.ai (@Kimi_Moonshot)
원문 링크: 원문 열기
Aioga 아카이브: 정보 페이지 보기
Content record: social-summary · Updated: 2026-07-27T18:45:20.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga는 전 세계 AI 동향을 집계하고 확인과 인용을 위해 출처 정보를 보존합니다.