Kimi.ai 发布 PerceptionBench,一个从当前前沿模型在 42 个基准上的失败模式中归纳出的视觉感知基准。
该基准将视觉感知拆解为 10 种原子能力,并构建了 3000 道验证题,每道题只考察单一感知能力,无需推理或外部知识。
Kimi.ai ra mắt PerceptionBench, một chuẩn đánh giá thị giác được tổng hợp từ các mô hình tiên tiến hiện tại trên 42 tiêu chuẩn về các mô thức thất bại. Chu...
Kimi.ai ra mắt PerceptionBench, một chuẩn đánh giá thị giác được tổng hợp từ các mô hình tiên tiến
hiện tại trên 42 tiêu chuẩn về các mô thức thất bại. Chuẩn đánh giá này chia nhận thức thị giác thành 10 khả năng cơ bản và xây dựng 3000 câu hỏi kiểm tra, mỗi câu chỉ đánh giá một khả năng nhận thức duy nhất, không cần suy luận hay kiến thức bên ngoài.
Kimi.ai 发布 PerceptionBench,一个从当前前沿模型在 42 个基准上的失败模式中归纳出的视觉感知基准。
该基准将视觉感知拆解为 10 种原子能力,并构建了 3000 道验证题,每道题只考察单一感知能力,无需推理或外部知识。
Kimi.ai 发布视觉感知基准 PerceptionBench。该基准源自对当前前沿模型在 42 个基准上失败模式的归纳,包含 3000 道验证题。
PerceptionBench 将视觉感知拆解为 10 种原子能力。按照发布材料,每道验证题仅考察一种感知能力,不要求模型进行推理,也不依赖外部知识。
Aioga 判断,这种单项能力拆解方式有助于更清晰地定位模型的视觉感知薄弱环节,并减少推理能力或外部知识对测试结果的干扰。
该基准可能为视觉模型评测提供更细粒度的观察框架。值得关注的是,其题目设计能否稳定区分不同模型在各类原子感知能力上的表现。 下一步值得关注 PerceptionBench 的具体题型、评测方法与使用方式,以及后续是否披露不同前沿模型在 10 种原子能力上的测试结果。
当前抓取源提供的是标题、摘要、来源和原文入口,不直接搬运完整原文。完整报道请通过下方原文链接前往来源站点查看。
抓取通道: 摘要聚合 · 原始域名: x.com
Nguồn: X:Kimi.ai (@Kimi_Moonshot)
原文链接: Mở nguồn gốc
Aioga 归档: 查看情报页
Content record: social-summary · Updated: 2026-07-27T18:45:20.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。