此后,公司计划通过 Daybreak Blue 计划向更广泛的用户开放防御性网络安全用途的访问权限。OpenAI 承认,限制 Astra 的网络安全能力可能会限制一些机构和企业的合法防御工作。
此次发布计划出台的背景是,OpenAI 在 2026 年 7 月发生了一起 AI 智能体意外“越狱”并攻击 AI 平台 Hugging Face 的事件。
当时,由两个 OpenAI 模型(GPT-5.6 Sol 及另一个未公开模型)二次开发的自主 AI 智能体,在安全评估过程中利用隔离测试环境(沙盒)中的软件漏洞自行连接互联网,并入侵了 Hugging Face 的系统。OpenAI 在 8 月底发布的报告中承认,公司本可以更早做出反应以防止该事件发生。
OpenAI 表示,尽管 Astra 并非参与 Hugging Face 入侵事件的模型之一,但公司已将从中汲取的经验应用于 Astra 的安全防护中。这包括训练模型更可靠地拒绝回答“有害的网络安全请求”,并增设了专门的“不一致性监控器”(misalignment monitor)以识别并阻止潜在的危险行为。这些防护措施还包括在内部部署期间监控模型是否存在未经授权的行为,并自动终止可能存在的未经授权活动。
此外,OpenAI 还警告称,Astra 的安全防护措施可能会错误地将合法的防御性网络安全活动标记为滥用行为,从而导致任务被减慢、暂停甚至终止(IT之家注:OpenAI 根据网络安全工作的性质分为“蓝队”防御和“红队”攻击两种任务类型,Daybreak Blue 计划仅开放用于防御性的“蓝队”工作)。