Aioga
AI资讯 / 技巧观点
返回 AI资讯

开源模型网络攻击能力仅落后闭源前沿4-7个月,成本低至1/50

The Decoder:AI News(RSS)Aioga 编辑团队2026-07-18T10:16:02.000Z热度 51

英国AISI分析发现,GLM-5.2和DeepSeek V4-Pro等开源模型在网络攻击能力上仅落后闭源前沿模型4-7个月。在70项网络任务中,GLM-5.2达到Opus 4....

技巧观点The Decoder:AI News(RSS)

今日 AI 情报摘要

英国AISI分析发现,GLM-5.2和DeepSeek V4-Pro等开源模型在网络攻击能力上仅落后闭源前沿模型4-7个月。

在70项网络任务中,GLM-5.2达到Opus 4.6水平,DeepSeek V4-Pro每项任务仅需28美分,而Opus 4.6需约15美元。

中文正文 · AI 翻译

英国人工智能安全研究院(AISI)首次公开评估了领先开源权重 AI 模型在网络能力方面落后顶级专有系统的程度。

根据 AISI:https://www.aisi.gov.uk/blog/how-fast-is-autonomous-ai-cyber-capability-advancing,这一差距正在缩小。当前的开源模型如 GLM-5.2 和 DeepSeek V4-Pro 已经达到了封闭前沿模型 4 到 7 个月前达到的水平。在 2025 年的大部分时间里,这一差距仍然为 6 到 10 个月。

批评者认为,开源模型存在风险,其权重任何人都可以下载、修改并运行而无需监督。一旦模型发布,用户可以移除安全防护措施,随意分享副本,并在无法控制的私人系统上运行。AISI 将其称为“持续且不可逆的滥用风险”。

但开源权重模型也有明显优势。用户可以私下托管它们,而无需数据回流给提供者:https://the-decoder.com/nadella-calls-out-ai-labs-like-openai-and-anthropic-for-banning-distillation-while-training-on-everyone-elses-data/,进行定制,降低成本,并依赖提供者无法更改或关闭的基础设施。AISI 表示,需要在这些相互竞争的利益之间取得平衡。

AISI 使用两种不同方法测试模型。“狭义网络任务”基准包括 70 个任务,分四个难度等级,从非技术工作到专家级挑战。它涵盖漏洞研究、逆向工程、网络利用和密码学。

2026 年 6 月发布的 GLM-5.2,在这些任务上的表现与 2026 年 2 月发布的 Opus 4.6 相匹配。也就是说,它大约落后四个月。DeepSeek V4-Pro 的表现达到 2025 年 11 月发布的 Opus 4.5 级别。

开源模型网络攻击能力仅落后闭源前沿4-7个月,成本低至1/50

第二种方法称为网络演练:https://www.aisi.gov.uk/research/measuring-ai-agents-progress-on-multi-step-cyber-attack-scenarios,用于在模拟网络中测试自主网络能力。“最后一人”模拟了对一个包含四个子网和约 20 个主机的企业网络进行 32 步攻击。AISI 估计人工专家完成此任务大约需要 20 小时。

GLM-5.2 在此次测试中的表现大致与 Opus 4.5 相当,而 DeepSeek V4-Pro 的表现低于 Sonnet 4.5。GPT-5.6-Sol 取得了最佳结果,领先于 Claude Mythos 5。Ad DEC_D_Incontent-2

在网络演练(Cyber Ranges)中的差距比在窄网络任务(Narrow Cyber Tasks)中更大,约为七个月。AISI 将这一结果视为较弱的证据,因为它来自的测试场景较少。测试也无法显示模型失败是因为缺乏网络能力,还是因为无法在长时间、复杂攻击中维持计划。Ad

AISI 表示,这些测试可能略微低估了开源模型在最佳状态下的表现,因为它们没有针对评估进行调优。网络演练也未涵盖现实世界的防御措施,例如主动防御者,而这些措施在大多数实际攻击场景中可能会存在。

除了性能差距缩小之外,成本差异也非常显著。AISI 表示,使用 Opus 4.5 或 4.6 进行 1 亿 token 的网络演练测试大约花费 85 美元,使用 GLM-5.2 大约花费 46 美元,而使用 DeepSeek V4-Pro 仅需 1.19 美元。

对于两种模型都能可靠完成的单个任务,Opus 4.6 的成本约为每个任务 15 美元,GLM-5.2 约为 6 美元,Opus 4.5 约为 12.50 美元,而 DeepSeek V4-Pro 仅需 0.28 美元。这使得使用开源模型进行网络攻击既便宜又更易扩展。

AISI 发现,开源模型的安全措施大多无效。DeepSeek V4-Pro 有时会拒绝逆向工程任务,但只需再次尝试即可绕过限制。监控、分类器和用户限制等保护措施无法可靠地应用于开源模型,因为它们依赖于控制模型的访问权限。

不过,无用的安全措施并非开源权重模型独有。最近发布的一项研究显示,恐怖组织也在破解商业聊天机器人:https://the-decoder.com/terrorist-groups-are-using-every-major-ai-chatbot-for-attack-planning-and-weapons-development/,以进行攻击计划。但自由可用的开源模型增加了另一种风险。

AISI认为开放模型和封闭模型之间的差距是一个准备的窗口。在这段时间里,拥有最强封闭系统访问权限的网络防御者可以在相同能力在没有可比安全保障的情况下自由获取之前采取行动:https://www.ncsc.gov.uk/blogs/retaining-defensive-advantage-in-the-age-of-frontier-ai-cyber-capabilities。

最近的进展使这一窗口更加紧迫。2026年4月,两款封闭模型,Mythos Preview 和 GPT-5.5:https://the-decoder.com/new-benchmark-shows-claude-mythos-and-gpt-5-5-can-develop-real-browser-exploits-autonomously/,带来了自AISI开始测试以来在AI网络能力方面的一些最大提升。随后,英国国家网络安全中心发布了国际警告,指出网络威胁格局正在快速变化:https://www.ncsc.gov.uk/news/the-ai-shift-in-cyber-risk-why-leaders-must-act-now。

尚不清楚未来开放权重模型是否能达到这些近期进展。AISI计划测试Kimi-K3:https://the-decoder.com/kimis-open-model-k3-nears-gpt-5-6-sol-and-fable-5-while-signaling-the-end-of-super-cheap-chinese-ai/,其权重预计于七月底发布。当前编码基准测试表明:https://the-decoder.com/kimis-open-model-k3-nears-gpt-5-6-sol-and-fable-5-while-signaling-the-end-of-super-cheap-chinese-ai/ 它可能更接近当前前沿模型,尽管成本远高于其他开放模型。

保持对AI的关注。清晰、有用、无废话。

关注 The Decoder 获取AI新闻、背景故事和专家分析。

The Decoder:https://the-decoder.com/

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:英国AISI分析发现,GLM-5.2和DeepSeek V4-Pro等开源模型在网络攻击能力上仅落后闭源前沿模型4-7个月。 Aioga 将其归入「技巧观点」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: the-decoder.com

来源: The Decoder:AI News(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-18T10:16:02.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

英国AISI分析发现,GLM-5.2和DeepSeek V4-Pro等开源模型在网络攻击能力上仅落后闭源前沿模型4-7个月。在70项网络任务中,GLM-5.2达到Opus 4....

The Decoder:AI News(RSS)2026-07-18T10:16:02.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。