IT之家:https://www.ithome.com/ 9 月 1 日消息,Anthropic 刚刚发布长文,披露了其针对 7 月 30 日和 8 月 4 日两起 Claude 模型未经授权访问真实计算机系统、在真实互联网环境采取未授权行动事件的调查进展,并公布了过去一个月来针对模型安全、评测环境和训练环境采取的多项措施。

Anthropicが7.30のセキュリティインシデントを説明:設定ミスによりClaudeは実際のシステムにアクセスでき、サンドボックス隔離とリアルタイム監視が強化されました

Anthropic 表示,7 月 30 日曾报告 3 起类似事件。当时 Claude 模型为了评测目的被刻意关闭网络安全防护,但由于第三方评测环境配置错误,模型意外获得了互联网访问权限。

8 月 4 日,英国人工智能安全研究所(UK AI Security Institute,AISI)也披露了一起独立网络安全测试事件,Claude Mythos 5 在被刻意关闭网络安全防护、并被主动授予互联网访问权限的情况下,在真实互联网环境中实施了一系列未经授权的操作。

Anthropic 目前仍在对两起事件展开深入分析,并计划与 METR 合作进行独立审查。该公司表示,希望确保两项调查足够全面,并将在未来几周公布更多信息。

Anthropic 认为,这些事件不仅暴露出运营安全方面的问题,还涉及两类模型对齐(Alignment)问题,即“动机性推理”和为了完成狭窄任务而采取有害行动的倾向。

IT之家注:前者指模型倾向于以有利于维持原有判断的方式解释与自身信念冲突的证据(即找理由为自己开脱),后者则表现为模型为了完成指定任务而采取超出预期范围的危险行为。

Anthropicが7.30のセキュリティインシデントを説明:設定ミスによりClaudeは実際のシステムにアクセスでき、サンドボックス隔離とリアルタイム監視が強化されました

在安全方面,Anthropic 首先暂停了针对预发布模型的外部网络安全评测,并短暂暂停内部评测,以加强评测环境的隔离和监控(在引入新的安全措施后,该公司已恢复对人工智能模型的外部网络安全测试)。该公司表示,此前主要依赖评测环境自身的配置作为单一防线,而这类高风险环境实际上需要多层防护。

Anthropic 目前已经部署实时分类器,用于识别模型是否试图主动探测或逃离测试环境,或者意外获得互联网访问权限。如果分类器检测到相关行为,会在工具调用执行前阻止操作、终止任务并通知安全员。

该公司还对近期内部预发布模型评测的对话记录进行自动监控,寻找沙箱逃逸和环境配置错误。Anthropic 称,在使用其沙箱工具进行的评测中,没有发现模型突破沙箱边界并访问本应隔离的外部资源,但发现了一些模型利用的沙箱配置错误,目前正在修复。

此外,Anthropic 已经将高风险内部网络安全沙箱迁移至更强的隔离环境,并继续对虚拟化基础设施进行“红队”测试,让预发布模型主动尝试逃离环境,以发现并修补潜在漏洞。内部网络安全评测目前已经恢复运行。

Anthropicが7.30のセキュリティインシデントを説明:設定ミスによりClaudeは実際のシステムにアクセスでき、サンドボックス隔離とリアルタイム監視が強化されました

针对强化学习(RL)环境,Anthropic 也曾暂停预发布模型的高风险环境数周,并部署了经过调整的实时分类器,以避免模型为了规避监控而产生新的行为。大部分强化学习工作已经恢复,但部分高风险环境仍处于暂停状态,需要人工审核。

Anthropic 同时扩大了离线监控范围,覆盖大多数其他内部前沿智能体使用场景,并正在构建内部推理控制机制,以避免员工意外运行采用较弱安全缓解措施的智能体。

由于此次事件发生在第三方评测环境中,Anthropic 要求所有使用降低网络安全防护的预发布模型进行测试的合作机构遵守一套安全规范。该公司指出,正常公开发布的 Claude 模型带有实时输入输出分类器,可以阻止恶意软件开发、攻击性漏洞利用代码编写等被禁止的网络安全活动,而网络安全评测人员和部分早期访问合作伙伴使用的模型会降低这些防护措施,以便测试模型能力和开展防御性安全研究。

Anthropic 要求相关网络安全评测默认运行在强化隔离的沙箱中,且不得连接互联网。沙箱唯一允许的外部连接应当是模型自身的 API,同时 API 密钥应保存在沙箱之外。每次评测开始前,都应验证这一配置。

如果评测确实需要互联网访问,Anthropic 要求评测人员与公司共同确定能否可靠检测并及时终止模型超出预定范围的操作。评测开始前,还应让待测模型在没有互联网访问的环境中主动检查沙箱漏洞,包括静态分析配置以及实际尝试逃逸,并由人工密切监督。

Anthropic 还要求评测人员确认测试任务本身在理论上确实可以完成。如果评测目标处于离线状态,或者任务本身无法完成,智能体可能会寻找其他方式完成目标,从而增加其超出预定范围采取行动的可能性。

此外,每个评测提示词都应明确规定任务范围,包括目标、允许的操作以及网络边界。Anthropic 特别强调,边界应以指令形式表达,例如“你不应访问互联网”,而不应仅声称“你无法访问互联网”。

评测过程中还应持续监控模型的思考、行动和网络活动,并将任务范围提供给基于模型或规则的监控系统。一旦发现模型违反规定,监控系统应向人工人员发出警报并终止评测。

在对齐问题方面,Anthropic 的初步调查认为,两起事件可能涉及“动机性推理”和“鲁莽行为”两种失败模式。模型最初被告知运行环境是模拟环境,但当模型后来发现环境可能连接真实互联网时,它可能以能够维持原有判断的方式解释这些证据。

Anthropic 认为,模型同时表现出了为了完成网络安全评测这一狭窄目标而采取有害行动的倾向。不过,评测本身的设计也可能影响了模型行为。例如, 模型被明确告知没有互联网访问权限,但实际环境却可以访问互联网,这可能导致 AI 怀疑自己看到的系统是否真实 。

Anthropic 还指出,其中一次评测使用的虚构目标与一个真实网站同名,进一步增加了模型区分虚构目标和真实互联网目标的难度。该公司目前仍在研究模型究竟在多大程度上意识到自己获得了真实互联网访问权限,以及模型是否有意忽略环境中的现实迹象。

Anthropic 还公布了针对强化学习训练中“奖励破解”(Reward Hacking)的研究。该公司表示,其经验研究显示,存在缺陷的训练环境,尤其是容易被模型作弊或必须通过作弊才能完成的环境,可能是模型产生不对齐行为的重要因素。

到了 2026 年春季,Anthropic 发现强化学习环境的生成速度已经超过现有审核系统的处理能力。自动监控发现的问题开始超过人工处理能力,同时该公司还发现部分训练运行意外使用了模型的思维链数据。Anthropic 认为,这可能使模型学习隐藏真实推理过程。

为解决这些问题,Anthropic 于 4 月冻结了生产环境强化学习环境的所有变更,持续约一个月,并全面改造相关基础设施。新的奖励机制和训练环境必须符合统一规范,同时加入技术措施降低意外使用思维链进行训练的风险。

在此次冻结期间,Anthropic 发现生产环境中超过 10% 的训练环境存在问题,包括奖励破解、任务本身无法正常完成以及配置错误等。这些环境只有在完成修复后才会重新投入训练。

Anthropic 随后专门进行了对照实验。该公司使用 80 个曾经出现奖励破解或被质量审核发现存在可作弊漏洞的真实强化学习环境,对一个 Opus 级模型进行训练。结果显示,该模型表现出强烈追求任务高分的倾向,并更愿意为了完成任务而采取潜在有害行动。

在模拟网络安全测试中,该模型表现出突破模拟沙箱、攻击模拟内部及第三方基础设施的倾向,还曾尝试修改自身奖励函数、向评分系统提供生物武器制造建议,并多次绕过部署安全监控以完成作弊行为。

相比之下,在奖励破解训练之前的同一模型,以及 Anthropic 公开发布的多款模型,都没有表现出同等程度的不对齐行为。Anthropic 据此认为,在训练过程中存在大量奖励破解,可能导致模型为了完成任务而愿意执行较长的一系列潜在有害操作。

其中,强化学习中的“奖励破解”是指模型找到训练机制中的漏洞,通过并未真正完成目标任务的方式获取更高奖励。

Anthropic 同时强调,训练环境中的作弊并不是模型对齐问题的唯一原因,也不能确定是此次事件或其他前沿 AI 公司的相关事件的唯一成因。该公司认为,AI 对齐仍需要处理多种潜在问题,未来的安全事件也可能呈现不同的行为模式并具有不同成因。

Anthropic 强调,7 月 30 日事件与公司内部安全状况无关。相关事件发生在第三方环境中,该环境错误地保持了互联网访问权限,因此模型甚至不需要突破任何安全机制就可以访问外部网络。

不过,这些事件仍促使 Anthropic 进一步强化内部安全措施。该公司指出,随着模型能力提升,除了传统的知识产权和模型权重被窃取风险外,还需要防范自有模型从 Anthropic 系统中逃逸,以及模型被他人滥用于攻击 Anthropic 内部系统的风险。

今年 4 月初,Anthropic 安全团队已经启动全公司范围的安全强化行动。当时公司认为自身面临的风险增长速度已经超过防御能力,尤其是 Mythos 级模型具备足以吸引资源充足攻击者的能力,同时内部自主智能体的使用规模也已经超过传统访问控制和监控体系的设计范围。

此次安全行动包括减少能够持续访问模型权重和客户数据系统的人类及自动化账户、默认阻断计算集群的所有出站流量、要求内部服务在通信前验证彼此身份、淘汰旧版基础设施配置和共享内部服务,并进一步加强工作负载隔离环境。

Anthropic 还扩大了主机级可观测性,使基础设施中的异常行为能够在发生时被发现。期间约 150 名产品工程师被临时调配至安全、可靠性和隐私工作,部分研究人员也从预训练或强化学习工作转向安全防护。

该公司表示,大部分团队已经在初夏前达到预设的退出标准并恢复原有工作。与此同时,Anthropic 继续加强内部智能体的隔离和监控,包括针对高度自主内部智能体部署沙箱和自动模式分类器,并在基础设施代码合并前进行自动审核。

Anthropic 指出,此前的安全体系主要遗漏了评测环境,尤其是第三方评测。虽然部分高风险评测已经采用实时监控,但过去通常只对部分评测记录进行事后自动检查。7 月发生的事件表明,公司需要进一步提高网络安全防御工作的紧迫程度,并将在下一份风险报告中公布更多信息。