Aioga
AI资讯 / 论文研究
返回 AI资讯

英国AISI与美国CAISI联合评估:月之暗面Kimi K3网络能力显著低于前沿模型

Hacker News 热门(buzzing.cc 中文翻译)Aioga 编辑团队2026-07-25T15:38:57.711Z热度 66

英国AISI与美国CAISI联合评估了月之暗面7月16日发布的Kimi K3,发现其网络能力显著低于前沿模型。在ExploitBench上Kimi K3得分为32%,高于GLM...

论文研究Hacker News 热门(buzzing.cc 中文翻译)

今日 AI 情报摘要

英国AISI与美国CAISI联合评估了月之暗面7月16日发布的Kimi K3,发现其网络能力显著低于前沿模型。

在ExploitBench上Kimi K3得分为32%,高于GLM-5.2的24%,但未能在41个样本中实现任意代码执行,而前沿模型平均完成20/41。 在32步模拟企业网络攻击中,Kimi K3平均到达第17步,前沿美国模型平均到达28.5步。

中文正文 · AI 翻译

美国政府的官方网站

官方网站使用 .gov .gov 网站属于美国官方政府机构。

安全的 .gov 网站使用 HTTPS 锁(锁 一个上锁的挂锁)或 https:// 表示您已安全连接到 .gov 网站。仅在官方、安全的网站上共享敏感信息。

英国人工智能安全研究所(UK AISI)和美国人工智能标准与创新中心(CAISI)(UK AISI / CAISI)对 Moonshot AI 最新模型 Kimi K3(于2026年7月16日发布,并计划于2026年7月27日开放权重发布)进行了联合评估。本次评估重点关注 Kimi K3 的网络能力,并发现:

图1:Kimi K3 与其他模型在漏洞开发基准(ExploitBench)上的性能。较高的成功率表示更强的网络能力。误差条表示95%置信区间。ExploitBench 衡量模型在给定漏洞的情况下开发端到端漏洞的能力。

这些结果代表在一小部分公共和私人基准上的初步评估。美国封闭权重模型在系统级保护关闭的情况下进行评估,以减少拒绝响应并测量最大能力。这些模型的公开可用版本已启用这些保护。由于 Kimi K3 的托管设置的具体情况,UK AISI / CAISI 仅进行了选择性的网络评估。详细方法请见各独立部分。

模型的网络能力通过一个受项目反应理论(IRT)启发的方法,将多个基准的多个任务聚合得出。关于方法的详细信息,请参见先前发布的报告:https://www.nist.gov/system/files/documents/2026/07/17/CAISI%20-%20Assessment%20of%20Z.ai%27s%20GLM-5.2.pdf。Kimi K3 的整体网络能力比其他模型的置信区间更大,因为它是基于单一基准(ExploitBench,包含41个以漏洞开发为中心的任务)估算的。ExploitBench 是衡量模型沿软件漏洞利用阶梯进展能力的主要基准。所有其他模型的整体网络能力得分来自涵盖更多网络能力领域的更多任务。

图 2:截止 Kimi K3 发布时,美国和中国最先进模型的总体能力随时间的初步比较。美国的趋势线由最前沿美国模型的结果组成。纵轴增加 400 点相当于完成任务的几率增加 10 倍。误差条和阴影区域表示 95% 置信区间。

ExploitBench:https://arxiv.org/abs/2605.14153 是由卡内基梅隆大学开发的公共基准,用于衡量模型沿软件漏洞利用阶梯进展的能力,包括覆盖率和崩溃复现、任意读/写、控制流劫持以及任意代码执行。该基准针对 V8 引擎(驱动 Chrome 的 JavaScript 和 WebAssembly 软件)中的 41 个最近(2023 年之后)漏洞对模型进行测试。

ExploitBench 的结果展示在图 1 和图 3 中。

图 3:Kimi K3 和其他模型的详细 ExploitBench 性能。较深的阴影表示更强的网络能力。每行表示漏洞利用开发链中的一个关键里程碑,每个单元显示该模型在 ExploitBench 任务中达成该里程碑的数量。

截至 2026 年 6 月,Kimi K3 的表现优于 GLM-5.2,这是最具网络能力的开源权重模型:https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber。Kimi K3 的得分为 32%,而 GLM-5.2 的得分为 24%(图 1)。

与最具网络能力的模型不同,Kimi K3 未能开发出在 ExploitBench 任务中实现任意代码执行(ACE)的漏洞利用。ACE 是漏洞开发中严重程度最高的结果,使攻击者能够劫持目标。Kimi K3 在 41 个样本中 ACE 达成 0 个,而最具网络能力的模型平均在 41 个样本中 ACE 达成 20 个(图 3)。

“最后一批”(TLO)网络演练:https://www.aisi.gov.uk/research/measuring-ai-agents-progress-on-multi-step-cyber-attack-scenarios 是一个包含32步的模拟企业网络攻击,横跨4个子网和大约20台主机,人类专家大约需要20小时才能完成。网络演练是由专家构建的、模拟的主机、服务和漏洞网络,排列成连续的攻击链,从初始网络访问点开始,可用于衡量模型在自主开展端到端网络攻击中的能力。

在此次评估中,Kimi K3的表现明显低于领先的美国网络能力模型。具体而言,Kimi K3在这条32步攻击路径中平均完成了第17步,而最具网络能力的美国模型平均完成28.5步。

截至2026年6月,Kimi K3的表现优于最具网络能力的开源权重模型GLM-5.2:https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber。在100M令牌限制内,Kimi K3平均完成第17步,而GLM-5.2平均完成第11步。

在10次尝试中的一次,Kimi K3在100M令牌限制内成功完成了“最后一批”网络演练。这表明,在得到指令并获得初始网络访问权限时,Kimi K3能够自主攻击小型、防御薄弱且存在漏洞的企业系统。然而,TLO在多个方面与现实环境不同。它缺乏主动防御者和防御工具,对可能触发安全警报的动作不施加任何惩罚,并且包含预设的攻击路径。

TLO的解决方案不再仅限于少数模型。在先前测试中,四个公开发布的闭源模型已解决TLO,其中最具能力的模型以6/10和7/10的成功率更可靠地完成任务。Kimi K3在标准的100M令牌限制内完成了1/10次尝试。

网站管理员:/cdn-cgi/l/email-protection#ee8a81c3998b8c838f9d9a8b9cae80879d9ac0898198 | 联系我们:https://www.nist.gov/contact | 我们的其他办公室:https://www.nist.gov/visit

情报判断

Aioga 编辑摘要

英国AISI与美国CAISI对月之暗面Kimi K3开展初步网络能力评估。材料称,其整体表现显著低于前沿模型;ExploitBench得分为32%,但在41个样本中未实现任意代码执行。

背景分析

Kimi K3于2026年7月16日发布,并计划于7月27日前开放权重。此次联合评估聚焦网络能力,仅选择部分测试;其整体能力估计主要来自包含41项任务的ExploitBench。

Aioga 观点

Aioga判断,这些结果支持“Kimi K3在所测网络任务中落后于前沿模型”的有限结论,但不足以全面代表模型能力。评估规模较小、覆盖领域有限,且置信区间更大。

影响与后续

值得关注的是,前沿美国闭源模型测试时关闭了系统级防护,而公开版本通常启用防护;不同模型的测试任务覆盖也不完全一致,因此榜单差距不宜直接外推为真实使用场景中的风险差距。 后续应关注评估方公布的分项方法、完整置信区间及更多网络任务结果,并观察开放权重版本是否按计划发布。若要进行横向比较,还需在相同防护设置、任务范围和运行条件下复测。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: nist.gov

来源: Hacker News 热门(buzzing.cc 中文翻译)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-25T15:38:57.711Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

英国AISI与美国CAISI联合评估了月之暗面7月16日发布的Kimi K3,发现其网络能力显著低于前沿模型。在ExploitBench上Kimi K3得分为32%,高于GLM...

Hacker News 热门(buzzing.cc 中文翻译)2026-07-25T15:38:57.711Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。