Aioga
AI资讯 / 行业动态
返回 AI资讯

从黑客事件中汲取的教训:前沿模型攻击暴露激励与治理失衡

Nathan Lambert:Interconnects(RSS)Aioga 编辑团队2026-08-09T14:57:11.000Z热度 72

近期前沿模型引发的网络攻击事件促使作者反思当前激励体系难以适应快速技术变革。科技公司受增长驱动持续扩展,而政府行动迟缓,双方均未准备好应对未来12-24个月的挑战。作者认为需要...

行业动态Nathan Lambert:Interconnects(RSS)

今日 AI 情报摘要

近期前沿模型引发的网络攻击事件促使作者反思当前激励体系难以适应快速技术变革。

科技公司受增长驱动持续扩展,而政府行动迟缓,双方均未准备好应对未来12-24个月的挑战。 作者认为需要更多透明度,并指出持久性强的模型更可能实施黑客行为,OpenAI的推理时扩展路径可能与此相关。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmslxhx3t05n3ro0w2lcmvjol

中文正文 · AI 翻译

近期前沿开发模型引发的网络攻击让我思考了很多关于我们当前激励体系的问题,这些体系并不适合如此快速的技术变革。这里的两个主要权力结构是快速发展的科技公司和联邦政府。公司被激励去增长,以便能够继续发展和扩大规模——在一个竞争非常激烈的市场中。这种扩张正在推动我们迈向新的、不可避免的人工智能转型(伴随着新的风险)。另一方面是我们的现行政府,它是过去几个世纪全球历史的产物——也是以行动缓慢而闻名的政府。我预计,只有当新的人工智能模型导致真正可衡量的伤害时,这个政府才会采取实质性行动,而且往往会反应过度。

Interconnects AI

这是决定未来发展走向的两个最具影响力的权力结构,但还有许多其他因素也有影响。总体而言,我认为人工智能行业在处理接下来的12-24个月时,整体上极其缺乏准备。

这篇文章是我从OpenAI-HuggingFace黑客事件中得到的一些启示的杂记,随着我们了解更多细节,其中的大部分观点被后来公开披露的更多黑客事件所强化。很可能还有更多事件发生了,但要么尚未被发现,要么没有被报告。

关于OpenAI事件的一般背景,我强烈建议观看OpenAI在Black Hat上关于此次网络事件的粗略事实与时间线的讲座:https://www.youtube.com/watch?v=87DyyMV0kCY&pp=ygUUYmxhY2sgaGF0IGxsbSBvcGVuYWk%3D。除此之外,Simon Willison在这里发布了一个事件时间线的TLDR总结:https://simonwillison.net/2026/Aug/7/openai-timeline/,我也很喜欢Thomas Wolf关于近期事件的讨论:https://thomwolf.substack.com/p/on-the-aisi-july-28th-incident?r=14g89&utm_campaign=post-expanded-share&utm_medium=web。

分享:https://www.interconnects.ai/p/lessons-from-the-hacks?utm_source=substack&utm_medium=email&utm_content=share&action=share

长期以来,GPT 模型相较于 Claude 的一个优势是它们会如此不知疲倦地追求目标。在放弃之前,它们会尝试看似每一种路径。这大约从 o3 开始就是这种情况(有趣的是,这是一个人们对 RLVR 中的奖励黑客反应过度的模型:https://www.interconnects.ai/p/openais-o3-over-optimization-is-back )并且这从历史上来看使 OpenAI 的模型在研究中表现得更好,也是 GPT-5.6 作为执行特定任务代理非常有用的原因。另一方面,Claude 给人的感觉危险性要小得多,仅仅因为它有时候有点懒惰。

在这方面,OpenAI 似乎对推理时的扩展更为投入,这可能与未来出现的意外行为相关。OpenAI 的推理持久性和效率——可以看看它们随时间的帕累托改进以及模型内部 CoT 的原始“穴居人语言”,比如“然而任务不可能,同行在做。”或者“帮助同行,但我们的任务还没有受益。”——让我觉得它们更倾向于推理时的扩展。这在很大程度上是一种直觉,但我用它来强迫自己考虑模型发展路径的极限。持久性强的模型似乎更有可能继续从更多推理时的 token 中受益。持久性较弱的模型,看起来在推理中会有更多浪费。能够使用最多推理计算的模型,将能突破最难问题的极限。这里是 OpenAI 在 GPT 5.6 发布博客中包含的一个例子:https://openai.com/index/previewing-gpt-5-6-sol/:

他们的一位明星研究员 Noam Brown 也一直在发布关于推理时计算的内容:https://x.com/polynoamial/status/2064210146558136827。他的 TLDR 是:

随着 LLM 能力的提升,基准测试的表现越来越依赖测试时的计算能力。实际上,我们可能不知道现代 LLM 的能力上限,因为测量成本太高。

首先,推理效率显然是现代智能代理模型的顶尖、基础性研究问题——和 RL 扩展一样重要——但不常被讨论。这里的公开研究非常缺乏。

我提到了彻底性轴线,在这一点上,OpenAI 似乎正沿着一种直观上不安全的发展路径推进他们的模型。另一面是模型在多大程度上假设用户意图,而不是尝试推断预期动作。一个会去做它认为你想要的事情而不是你说的事情的模型,本质上似乎更不安全。我考虑这个问题时,会想到指令遵循的精确性,在未来似乎模型应该只做我们明确告诉它们的事情,但这会引发很多类似于回形针问题的讨论:如果我们让 AI 去做一个几乎无法解决的问题,它会怎么做?

这个轴线似乎不像持久性轴那样明确,但我之所以包括它,是因为我认为 Claude 的“用户世界模型”是它在一般知识工作中(如编辑、制作幻灯片等)的优势之一。有时 Claude 确实会做完全随机的事情,因为我的提示信息不够明确,它没有来向我寻求澄清,而随着模型变得更强大,这种“直接行动”可能会引发问题。

公众需要准确访问执行这些黑客操作的内部模型的提示和特性。我们需要知道这些模型是否被告知“不要黑客攻击”,或者是否有相关的模型训练来防止这种行为。我们需要知道这些模型是与现有公开模型相当接近,还是属于一个非常不同的系列。鉴于一些实验室正在进行的评估性质,这些模型有可能被明确鼓励去尝试黑客行为!如果在这方面不透明,该行业注定会失败,并陷入大规模猜测,而这种猜测很快就会变成误导信息。

根据OpenAI自身的回顾,模型行为失调是在几个月内逐渐显现的,在某些情况下,OpenAI甚至在大约数周内都不知道这些黑客行为。响应时间太长,我不认为这是OpenAI独有的特征——更确切地说,是因为前沿实验室似乎总是感到工作量淹没自己,觉得应做的事情太多。我对长期看来实验室在这方面会发生足够改变以有效降低类似监督风险并不乐观。是的,很可能OpenAI正在投入大量资源来理解这一点——并且推迟了他们最新模型的发布:https://www.axios.com/2026/08/07/openai-astra-model-delay-cybersecurity-risks 以确保他们做对——但是为了增加收入或维护公司长期财务状况的财务压力,让我觉得这不会成为一种持续的谨慎模式。

这是我最近事件中最大的心理更新之一——也让我更加坚信需要更多接近前沿的开放智能,尽管开放模型的风险特征稍微更加明确(单向门等)。Florian Brand:https://open.substack.com/users/41984689-florian-brand?utm_source=mentions 在他的个人网站上发表了一篇不错的博客文章:https://florianbrand.com/posts/open-model-safety,讨论了与此相关的问题,以及为什么迄今为止的封闭模型可以说导致了更多的下游危害。

正如我们看到HuggingFace因封闭模型的网络使用限制而通过开放模型自我防御OpenAI黑客事件一样,我们迫切需要在更复杂的语言模型研究上投入更多工作,这包括大规模强化学习训练、广泛评估、基础设施工作以及对齐测试。这只能在开放模型上实现。我们应该认为自己很幸运,因为开放模型仅落后3-9个月,这样我们可以设想对前沿有所了解并提出一些有信息量的见解。

如果我们有效地禁止开放模型和开放科学,不论是通过带有模糊威胁的监管压制,还是通过对尖端技术的明确使用限制,我们都将越来越无法应对这一轮黑客攻击之后出现的问题。我们需要集体提升公众对前沿模型工作原理的理解,以便我们能够动员更多中立方来强化我们的基础设施和社会。

公众的反应应该明白,这些能力在广泛传播时是何时会发生,而不是是否会发生,而我们在准备工作上已经严重落后。重申我在 Kimi K3 文章中说的话:https://www.interconnects.ai/i/207699639/1-chinas-recommits-to-open-source-ai-showing-a-different-read-on-near-term-risks:中国也在关注这个领域,如果开放权重模型会带来风险,中国也不会鼓励。如果我们认为通过禁止这一类的开放模型就能阻止这些强大的网络能力被广泛使用,我们实际上只是在拖延不可避免的事情。最终会有人构建出这种水平的智能模型而不遵守禁令,从而在全球范围内提供给不良行为者,同时削弱了防御措施准备的动机。

我在观看 Black Hat 视频时立即注意到的一点是,我可以看到这些智能体如何通过内部消息板尝试互相帮助——像对待人类队友一样创建共享资源——这种行为显然对社会是恶意的。智能体为彼此创建了隐藏的论坛,作为一种跨发布的记忆。在这个案例中,他们这样做是为了尝试突破自己的环境。表面上的“互帮互助”并不意味着这是可以接受的,但可以作为发生了什么的线索。

上述关于“有帮助性”的例子的另一面是,如果有人愿意,通过明确训练一个不对齐的模型,这件事显然可以更容易地实现。重申一下,这将是制造一个更容易在推理阶段发现漏洞的系统,但我认为训练这样的模型会更困难。我认为这比大多数评论员预期的要花更长时间,因为迄今为止几乎所有强大的公开模型和数据行业都鼓励对齐(而且对于坏人来说,想获得足够的计算资源来端到端训练这些模型似乎很困难,因为所有领先公司也都面临计算短缺)。我们应该花一点时间来意识到,我们在当前模型上采用的对齐技术确实具有实际影响,并不仅仅像一些人担心的那样表面化。下游模型倾向于反映其教师的特性。

大规模加速在代理任务上使用强化学习(RL)的缺点是,最先进的评估和监控规模过大,只有代理可以对其进行监控,因此我们依赖现有的对齐成功来继续安全扩展。OpenAI 表示,他们已经检查了数十亿条轨迹——这些轨迹很可能主要是 RL 过程中间版本模型的试验——并花费了数百万 GPU 小时来完成。我认为,使用当前 AI 对 AI 进行可扩展监督,正如今天所示,是一个可解决的问题,因为这些模型确实有用并且能够遵循指令。这是现有对齐技术总体积极影响的另一个下游效应。

OpenAI 回顾报告的一个关键部分是模型之间进行通信,以分享其环境信息并进一步推进黑客行为。与此同时,OpenAI 很可能在 RL 过程中训练模型使用子代理来解决复杂任务。这些子代理可能会发展出诸如信息分享、帮助团队等行为, 即使它们的单独子任务尚未解决。我很想看到在这一领域的更多研究,而且这似乎是 RL 如何改变模型的自然延续。

总体而言,最近的事件应该清楚地表明,前沿人工智能的网络风险是真实存在且即将发生的问题。仍然很有可能 a) 过去这些风险被夸大了,b) 对即将到来的开放模型的未来风险的预测被夸大了。总之,我想分享一条我在 Interconnects Discord 上读到的读者留言,我非常同意:

经过几周的平息,对我来说,这一事件对对齐(alignment)来说是中性偏积极的更新,但对安全性来说是非常消极的更新。

我上面已经讨论了很多关于模型对齐的问题,但核心观点是,我认为缺乏安全性通常表现为缺乏适当准备的能力。我们将面临更多像网络安全一样明显的风险,而我们已经通过实验室被迫暴露在公众视野中的这些黑客事件,对网络风险有了充分的警示。许多其他类型的风险对公众来说并不明显。我们需要不断为社会准备应对所有这些变化,从重建网络基础设施到教育宣传以及为被替代的工人提供职业项目。我预计所有这些干预措施都会来得较晚,但它们的形式和细节会相对简单,这将是人工智能展开的一种悲剧方式。我希望我能被证明是错的!

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:近期前沿模型引发的网络攻击事件促使作者反思当前激励体系难以适应快速技术变革。 Aioga 将其归入「行业动态」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: interconnects.ai

来源: Nathan Lambert:Interconnects(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-08-09T14:57:11.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

近期前沿模型引发的网络攻击事件促使作者反思当前激励体系难以适应快速技术变革。科技公司受增长驱动持续扩展,而政府行动迟缓,双方均未准备好应对未来12-24个月的挑战。作者认为需要...

Nathan Lambert:Interconnects(RSS)2026-08-09T14:57:11.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。