Aioga
AI资讯 / 技巧观点
返回 AI资讯

开源权重模型逼近前沿能力,安全差距仍在扩大

TechCrunch:AI(RSS)Aioga 编辑团队2026-08-04T20:05:26.000Z热度 69

SaferAI 报告显示,中国 Z.ai 的开源权重模型 GLM-5.2 在网络与生物能力上仅落后 OpenAI GPT-5.5 和 Anthropic Claude Opus...

技巧观点TechCrunch:AI(RSS)

今日 AI 情报摘要

SaferAI 报告显示,中国 Z.ai 的开源权重模型 GLM-5.2 在网络与生物能力上仅落后 OpenAI GPT-5.5 和 Anthropic Claude Opus 4.7

数月,但面对攻击性网络或双重用途生物任务时拒绝率为零,而 Claude Opus 4.7 因拒绝过于一致导致 CyberGym 评测无法完成。

中文正文 · AI 翻译

随着政策制定者就如何管理日益强大的人工智能系统(如 OpenAI 的 GPT-5.6 Sol 和 Anthropic 的 Mythos)展开讨论,一款中国的开放权重模型正在缩小与行业领先者的差距。

根据 AI 安全非营利组织 SaferAI 的一份新报告(https://www.safer-ai.org/research/glm-5-2-evaluation-report),中国 Z.ai 的开放权重 AI 模型 GLM-5.2 在网络和生物能力方面仅落后于 OpenAI 的 GPT-5.5 和 Anthropic 的 Claude Opus 4.7 几个月。但前沿能力与安全实践之间的差距正在扩大。

根据 SaferAI 的评估(该非营利组织通过 Z.ai 的公共 API 进行评估),GLM-5.2 没有拒绝任何给定的攻击性网络或双用途生物任务。相比之下,Claude Opus 4.7 “拒绝的频率如此之高,以至于 SaferAI 完全无法在其上完成 CyberGym。”(CyberGym 是一个评估网络安全能力的基准。OpenAI 在上个月 Hugging Face 数据泄露事件之前的评估中使用了该基准:https://techcrunch.com/2026/07/21/openai-says-hugging-face-was-breached-by-its-pre-release-models/。)

这强烈提醒了多年来一些批评者的警告:开放权重 AI 模型可能会将高能力 AI 授予潜在攻击者,而一旦下载了权重,就无法监督他们如何使用该技术。随着开放权重模型迅速接近世界领先 AI 系统的能力,辩论正从它们是否能竞争转向社会在其发布后如何管理风险。

“能力的前沿并不等同于风险的前沿,因此我们确实必须考虑缓解措施的状态,以正确评估风险,”SaferAI 执行董事 Henry Papadatos 告诉 TechCrunch。

虽然 Z.ai 可以对其托管的 API 采取安全措施,但一旦有人在自己的硬件上运行权重,这些保护措施就无法执行,因为他们可以删除或修改任何安全防护,对模型进行微调,或更改系统提示。

像 OpenAI 和 Anthropic 这样的前沿开发者往往依赖分类器、拒绝训练和 API 级别控制等安全措施来限制危险的网络和生物帮助。

这些措施远非万无一失:越狱程序经常绕过已部署模型的保护措施。非营利组织 Far.ai(致力于 AI 安全)在前沿模型中发现了数百个通用越狱程序:https://leaderboard.far.ai/ —— 被定义为可重复使用的关键键,在大多数有害请求中都能成功 —— 例如 xAI 的 Grok 4.5 和 Google DeepMind 的 Gemini 3.1 Pro。根据报告,当攻击者结合多种操纵技术——包括角色扮演、冒充权威、伪造对话历史和后续提示——来放大模型防御的弱点时,越狱程序就会成功。

但针对封闭模型的保护措施在开放权重模型上根本不起作用,后者被设计为可在任何基础设施上运行,无论是否有任何保护措施。

“目标显然应该是让好的能力——安全的能力——对任何人都可访问,然后我们尝试去除不良能力,即使是以开源的方式,”Papadatos 说。

Papadatos 提到的一种可能有帮助的技术称为“预训练数据过滤”,即 AI 公司从其训练数据中移除具有攻击性的网络安全信息,然后在经过整理的数据集上训练模型。

一些研究:https://alignment.anthropic.com/2025/pretraining-data-filtering/?utm 表明,这可以在不影响整体模型性能的情况下减少有害的生物学知识:https://arxiv.org/abs/2508.06601#:~:text=In%20this%20paper%2C%20we%20investigate,as%20a%20more%20tamper%2Dresistant%20safeguard. 但是,对于网络安全而言,数据过滤的实用性要差得多。

训练一个在编码上表现出色但同时又不是优秀黑客的一般模型非常困难。由于编码已成为 AI 最大的盈利来源,开发者面临着保持这些能力持续改进的压力,即使他们在寻找限制滥用的方法时也是如此。

因此,前沿开发者越来越多地依赖其他缓解措施。一个方法是有选择地限制模型提供的网络安全援助类型。例如,Anthropic 的 Opus 5 可以搜索未编译源码中的漏洞,但不能搜索已编译的软件,根据该模型的系统卡:https://www-cdn.anthropic.com/b514064af1408018e64b1ad24e7d5e75850b4ffd/Claude%20Opus%205%20System%20Card.pdf。其原因是,这使得使用 Opus 5 进行进攻性操作更加困难。

其他措施包括严格的部署前安全评估、发布风险评估,以及如果系统被认为过于危险而不公开模型权重。

在 GLM-5.2 的案例中,SaferAI 表示 Z.ai 没有发布安全框架、部署前测试承诺或模型的风险评估。TechCrunch 已向 Z.ai 询问其在发布前是否进行了内部或第三方前沿安全评估,但未收到回应。

中国领导人越来越承认先进 AI 的风险。在上个月的世界人工智能大会上,中国国家主席习近平强调:https://www.nytimes.com/2026/07/17/business/xi-jinping-china-ai.html?eafs_enabled=false 开放权重模型的重要性,同时也强调确保 AI 仍在严格人类控制下的必要性。

斯坦福大学网络政策中心研究中国 AI 政策的 Graham Webster 告诉 TechCrunch,中国有健全的 AI 监管法规,但这些规则历来主要关注政治敏感内容、虚假信息和社会稳定,而非灾难性 AI 风险,如进攻性网络能力和生物滥用。

“总体来说,美国的 AI 思想家更关注这一生存性灾难威胁,而中国社区不太关注,”Webster 说,并补充道,许多中国政策研究人员认为,如果真的出现新的前沿风险,美国公司可能会首先遇到它。

“中国体系有信心能够控制这些技术在中国境内的使用,”Webster 继续说道。“在中国上网是需要实名的,企业可以被追责,用户也可以被追责。”

韦伯斯特思考道,模型提供者用于拒绝涉及某些政治话题的同样机制,也可以潜在地调整,以确保模型拒绝执行攻击性网络攻击或不会产生不良的生物工程结果。他补充道,由于中国公司往往在幕后一同与监管机构协调,因此在发布前很难知道他们进行了哪些内部测试。

支持开放权重AI的倡导者认为,发布权重对于网络安全很重要,因为它使公司能够防御攻击——Hugging Face 曾依靠 GLM-5.2 来防御 OpenAI 的泄露——且因为如果公司知道未来可能出现的威胁,就能更好地做准备。

“Hugging Face CEO Clem Delangue 本周在社交媒体帖子中表示:‘同样帮助阻止 AI 驱动的网络攻击的系统,现在可以帮助防御每天数百万次的网络攻击,同时帮助我们在攻击者利用漏洞之前识别并修复这些漏洞。’ https://x.com/ClementDelangue/status/2083908468285620415

Papadatos 表示,这一好处往往被高估,并不意味着‘我们应该开源危险能力。’

“我认为的主要观点是,我们不应该仅仅接受危险能力可以被任何人在任何地方轻易访问,”他表示,强调他认为行业应致力于只让‘良性能力’易于访问。默认情况下,攻击者采用新工具的速度比防御者快。例如,一个勒索软件团体可以在一周内改变其方法,而医院无法做到。”

当你通过我们文章中的链接购买时,我们可能会获得一小部分佣金:https://techcrunch.com/techcrunch-affiliate-monetization-standards/。这不会影响我们的编辑独立性。

Rebecca Bellan 是 TechCrunch 的高级记者,报道塑造人工智能的商业、政策和新兴趋势。她的作品也曾刊登在 Forbes、Bloomberg、The Atlantic、The Daily Beast 及其他出版物上。

你可以通过发送邮件至 rebecca.bellan@techcrunch.com 联系或核实 Rebecca 的联系信息:mailto:rebecca.bellan@techcrunch.com,或通过 Signal 上的加密消息 rebeccabellan.491 联系。

Event Logo

更快扩大规模。发展你的投资组合。获得实用经验。无论你的目标是什么,Disrupt 都能赋能你。今天最多可节省 330 美元!

网红因参加 OpenAI 的首次奢华旅行而引发反弹:https://techcrunch.com/2026/08/03/influencers-draw-backlash-for-attending-openais-first-luxury-trip/ Dominic-Madori Davis:https://techcrunch.com/author/dominic-madori-davis/

红杉的 Shaun Maguire 领导对核能初创公司 Valar Atomics 的 10 亿美元融资轮:https://techcrunch.com/2026/08/03/sequoias-shaun-maguire-leads-1b-round-for-nuclear-startup-valar-atomics/ Julie Bort:https://techcrunch.com/author/julie-bort/

YouTuber Hank Green 表示他的人工智能使用“不健康”:https://techcrunch.com/2026/08/01/youtuber-hank-green-says-his-ai-usage-is-not-healthy/ Anthony Ha:https://techcrunch.com/author/anthony-ha/

WhatsApp 正在测试一个用于大型企业消息的新文件夹:https://techcrunch.com/2026/07/31/whatsapp-is-testing-a-new-folder-for-messages-from-large-businesses/ Ivan Mehta:https://techcrunch.com/author/ivan-mehta/

Spotify向其应用添加了跑步模式:https://techcrunch.com/2026/07/30/spotify-adds-a-running-mode-to-its-app/ 伊万·梅塔:https://techcrunch.com/author/ivan-mehta/

Claude Opus 5 在被分配管理自动售货机任务时变得相当无情:https://techcrunch.com/2026/07/29/claude-opus-5-became-downright-ruthless-when-tasked-with-running-a-vending-machine/ Julie Bort:https://techcrunch.com/author/julie-bort/

DoorDash 正在建立自己的无人机配送业务:https://techcrunch.com/2026/07/29/doordash-is-building-its-own-drone-delivery-business/ Kirsten Korosec:https://techcrunch.com/author/kirsten-korosec/

情报判断

Aioga 编辑摘要

SaferAI 经由 Z.ai 公共 API 评估称,GLM-5.2 在网络与生物能力上仅落后 GPT-5.5 和 Claude Opus 4.7 数月;面对测试中的攻击性网络及双重用途生物任务时,该模型未拒绝任何一项。

背景分析

GLM-5.2 是中国 Z.ai 的开源权重模型。材料指出,托管 API 可部署安全措施,但权重下载并在本地运行后,使用者可修改防护、系统提示或继续微调,原提供方的相关控制难以强制执行。

Aioga 观点

Aioga 判断,材料揭示的重点不是开源权重模型能否接近前沿能力,而是能力提升与缓解措施之间可能不同步。拒绝表现只是特定评测结果,不能单独等同于模型整体安全水平。

影响与后续

值得关注的是,Claude Opus 4.7 因持续拒绝而无法完成 CyberGym,GLM-5.2 则未拒绝相关任务,显示能力评测与安全限制可能互相影响。与此同时,材料也指出前沿模型的防护仍可能被越狱绕过。 Aioga 建议后续关注 SaferAI 对评测任务、拒绝判定和能力差距的具体说明,并区分托管 API 与本地权重部署的风险条件;比较模型时,也应同时审视能力结果、防护机制及防护被绕过的可能性。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: techcrunch.com

来源: TechCrunch:AI(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-08-04T20:05:26.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

SaferAI 报告显示,中国 Z.ai 的开源权重模型 GLM-5.2 在网络与生物能力上仅落后 OpenAI GPT-5.5 和 Anthropic Claude Opus...

TechCrunch:AI(RSS)2026-08-04T20:05:26.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。