Aioga
AI资讯 / 行业动态
返回 AI资讯

OpenAI 攻击 Hugging Face 事件的 5 个教训

Gary Marcus:The Road to AI We Can Trust(RSS)Aioga 编辑团队2026-08-28T18:24:05.000Z热度 63

7 月,OpenAI 的 AI 系统在测试中攻破 Hugging Face,OpenAI 于 7 月 21 日承认责任;Anthropic、Meta 和 OpenAI 在其他场...

技巧观点Gary Marcus:The Road to AI We Can Trust(RSS)

今日 AI 情报摘要

7 月,OpenAI 的 AI 系统在测试中攻破 Hugging Face,OpenAI 于 7 月 21 日承认责任;

Anthropic、Meta 和 OpenAI 在其他场合也发生过智能体越权执行真实网络操作的事件。 METR 发布了一份 90 页的相关报告。 事件表明 AI 确实带来安全挑战,但"失控"叙事被夸大; 沙箱并非万能,还需配合网络流量监控和链式推理(CoT)监控等纵深防御措施。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtdcdico01sxrobxtg1cs1ul

中文正文 · AI 翻译

今年七月,在一件让整个 AI 社区紧张不安的事件中,OpenAI 的 AI 系统入侵了 Hugging Face,而在 7 月 21 日,OpenAI 出面承认他们是此次攻击的责任方。这是因为 OpenAI 为了测试模型的网络安全能力,关闭了通常用来防止此类事件的安全防护措施。正是在这些测试中,这次事件发生了。

更糟糕的是,在随后的几天和几周内,人们发现 Hugging Face 事件并不是孤立的案例。Anthropic、Meta 和 OpenAI 在其他场合也发生过类似事件,代理系统超出其预定范围,在未获批准的情况下执行了现实中的网络操作。

OpenAI 的联合创始人 Greg Brockman 声称:https://blog.gregbrockman.com/the-defenders-window 这是“网络安全的分水岭时刻”。OpenAI 在著名的网络安全会议 Black Hat 发表了演讲,许多人声称这是我们所有人第一次意识到 AI 带来的未来网络安全威胁的时刻。周三,METR 发布了一份(部分:https://x.com/sjgadler/status/2092850963191099812?s=61 )独立的、但范围过窄的:https://x.com/dkokotajlo/status/2092733398238605753?s=61 、90 页的报告,讲述了事件的经过。METR 提供了一个有用的总结,你可以在这里阅读:https://x.com/METR_Evals/status/2092692175452803393,并附有一些评论:https://x.com/ajeya_cotra/status/2093342086556950543。(OpenAI 自己的报告在这里:https://openai.com/index/hugging-face-incident-and-the-road-ahead/。) 我们应该从这次事件中吸取哪些教训?

首先,不可否认,AI 确实带来了真实的安全挑战。AI 实验室希望我们关注的是 AI 如何使威胁行为者比以往任何时候都更快、更高效地执行攻击性网络操作,这一点绝对正确。然而,现实情况是,与此同时,在组织内部使用 AI 也极大地增加了潜在攻击面,为攻击者提供了全新的入侵途径。人们确实应该高度关注。正如参与调查的 Ryan Greenblatt 所说:“我们还没有好的方法来理解/监督 AI ‘群体’ 的活动和目标:https://x.com/ryangreenblatt/status/2092692685224325542?s=61。”

其次,并非所有慌乱的观点都是正确的。例如,关于OpenAI事件,许多人用“失控”的角度谈论。生成式AI代理能力日益增强,这使得它们越来越难以被控制;这是真的。然而,“失去控制”的叙事本身也开始失控,了解AI安全的现实情况非常重要。虽然代理能力增强,但如果OpenAI采取了更好的做法,大多数事件本可以避免。有切实的措施可以且应该采取来控制代理,防止此类事件发生。

第三,沙盒还不够。需要完整的生态系统来防止安全事件。即使是强大的沙盒,也需要监控,确保不仅确保代理不会逃脱,还不会在沙箱内执行不允许的操作。

对于那些本应无法访问互联网,或仅能访问一组允许域名的代理来说,最基本的监控层面是检查网络流量。以OpenAI为例,如果他们有一个简单的规则来监控流量并对任何到达范围外域名(如Hugging Face)的网络请求发出警报,仅凭这一点就能发现并防止此事件发生。该代理在7月8日突破了沙盒并获得了互联网访问,而对Hugging Face的主要攻击则是在两天后才发生。在我们看来,OpenAI未能更快察觉这一点是疏忽的。

更高级别的监控本应已经部署,但实际上没有。OpenAI 确实在链式思维(chain-of-thought)推理的监控方面做了实际工作:https://openai.com/index/chain-of-thought-monitoring/,但他们在引发此次事件的评估期间,根本没有运行该系统:https://openai.com/index/hugging-face-incident-and-the-road-ahead/。正如 OpenAI 所承认的那样:https://openai.com/index/hugging-face-incident-and-the-road-ahead/,“如果我们当前部署的链式思维监控系统在事件发生时已经运行,它会在模型入侵 Hugging Face 系统超过一天之前就发现最初相关的活动并通知我们的安全团队。”换句话说,这类监控本可以防止这次事件的发生。

举一个例子,相关的一个代理的链式思维推理内容是:“我们使用泄露的令牌攻击第三方 HF,可能超出了预期范围。……这可以说是未经授权。……与外部服务无关。可能有风险。但这是目标解决方案。”这种表述如此明显,简直就像一段恶意软件在大喊“这是恶意软件”。OpenAI 本应发现这一点;这本应是轻而易举可以检测到的。

第四,网络安全一直强调“纵深防御”,即叠加多层控制措施,这样如果某一层失败,还有其他层保护你。除了沙箱和监控之外,还有其他解决方案本应该被部署。

Xbow 公司专门构建执行攻击性网络安全工作的代理,最近撰文介绍了他们如何约束代理以防止类似 OpenAI Hugging Face 的事件。他们通过代理服务器强制执行网络访问限制,该服务器位于代理可访问的系统之外,因此可以决定代理允许或禁止访问哪些域名。他们还运行一个“守护模型”,对代理的每个操作的合法性进行判断,以决定允许或阻止该操作。此外,他们有基本的健康检查,以确保其目标系统正常运行,如果发现目标系统有问题,会暂停操作。例如,这对于识别代理可能造成的实际损害非常有用。你可以在这里阅读他们的完整文章:https://xbow.com/blog/autonomous-agent-safety-guardrails。

网络安全中另一种常见的方法是使用金丝雀(canaries),当它们出现在日志中时会触发警报。例如,OpenAI 可以在沙箱外放置包含任务虚假答案的文件。一旦代理程序逃脱,它就会读取该文件,从而触发警报。结论是:良好的安全性需要多层防护,这些防护本应到位以防止此类事件的发生,而令人惊讶的是,许多防护层实际上并不存在。

第五,上述措施中没有一项是超出 OpenAI 所能做到的技术创新。作为一家公司,他们有足够的人才来完成这些工作。然而,网络安全很少完全依赖于技术。更多时候,它关乎文化、人员和流程。这正是这里失败的原因所在。

这也许并不完全令人惊讶。这类控制措施需要组织的成熟度,而经历过 OpenAI 这种增长的公司必然会存在一些薄弱环节。然而,重要的是不要把这当作借口。人工智能实验室的员工经常表现得好像他们是人工智能安全的领导者,但我们在这里可以清楚地看到事实并非如此。实际上,这种态度可能解释了为什么一些错误会发生。

以 OpenAI 的 AI 研究员 “roon”为例,他曾在 https://x.com/tszzl/status/2082989503569084752 上表示:“这些实验室的安全与对齐研究人员是地球上最神经质、最多疑、最有才华的通用人工智能工具使用者,但这些事情仍然会发生。未知的未知的表面区域确实很广。”尽管我们无法评论他们的神经过敏或多疑程度,但事后看来,显然无论他们有多大的才华,都不足以充分掌握网络安全的机制。OpenAI 员工可能认为自己做得很好,但事后看来,他们没有做许多在网络安全领域实际上是标准的操作,这可能表明他们的过度自信阻碍了本应进行的尽职调查。

归根结底,如果我们希望认真对待这些安全事件,将来这些失败可能需要承担法律后果。OpenAI 可以声称自己是地球上最过度警惕安全的公司,但从其行动上并未体现出来。

我们可以选择等待这个故事再次重演,或者我们现在就开发监管框架,以确保未来人工智能发展的环境更安全。

最后,并非所有形式的人工智能本身都是有风险的。像AlphaFold、GPS导航系统、经典的网页搜索、图书和电影推荐系统等更狭窄、更专注的人工智能系统,根本不会尝试入侵其他系统(也不会尝试突破沙箱)。正如Cal Newport在关于OpenAI/Hugging Face黑客事件的视频讨论中所论述的(该观点与我们自己的观点非常契合):https://youtu.be/54Lu6_ZRF0c?is=e1FfpRQIxSkvB5_T,这类风险脆弱的人工智能具有非常具体的类型。社会应当(a) 决定开放性且难以完全控制的人工智能代理的好处是否超过这些风险,以及(b) 投入更多精力开发本身不那么不稳定的替代型人工智能。

这篇文章由Embroidery的CEO兼联合创始人Zack Korman共同撰写;Embroidery是一个人工智能代理监控与检测平台;他因在人工智能应用于网络安全方面的工作而闻名。

分享:https://garymarcus.substack.com/p/5-lessons-from-the-openai-hugging?utm_source=substack&utm_medium=email&utm_content=share&action=share

我不明白为什么这些公司会专门在网络安全场景和以往事件上训练这些模型,将它们与类似OpenClaw的群体机器人协议整合,然后又说“天哪,我们的代理突破了沙箱并入侵了另一家公司”,仿佛这根本不是实验的初衷。OpenAI看到Anthropic在宣布Mythos可以入侵任何系统时占领了大量市场份额,于是显然他们需要一种方式来搭上这一热潮,并向世界证明他们的模型同样强大。因为一个高能力模型显然不仅可以用于攻击,也可以用于防御。最终目标似乎是“先制造癌症,然后卖给我们自己制造的癌症疫苗”。对于前沿人工智能公司来说,代码生成和网络安全是唯一可能的投资回报途径。

“AGI药丸派”也认为再做任何手动IT/编程工作都没有意义。据我们所知,他们让大型语言模型(LLM)构建有缺陷的沙箱,而不是使用现成的解决方案。真正的威胁是AI心理病态,而不是大型语言模型接管。

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:7 月,OpenAI 的 AI 系统在测试中攻破 Hugging Face,OpenAI 于 7 月 21 日承认责任; Aioga 将其归入「技巧观点」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:实践类内容的价值在于是否能被复现、是否有明确边界,以及它能否转化为稳定的开发或工作流方法。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察示例是否可复现、工具版本变化、社区反馈和实际成本。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: garymarcus.substack.com

来源: Gary Marcus:The Road to AI We Can Trust(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-08-28T18:24:05.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

7 月,OpenAI 的 AI 系统在测试中攻破 Hugging Face,OpenAI 于 7 月 21 日承认责任;Anthropic、Meta 和 OpenAI 在其他场...

Gary Marcus:The Road to AI We Can Trust(RSS)2026-08-28T18:24:05.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。