Aioga
AI资讯 / 论文研究
返回 AI资讯

OpenAI 公布 GPT-Red:内部自动化红队模型在提示注入测试中以 84% 对 13% 击败人类红队成员

MarkTechPost(RSS)Aioga 编辑团队2026-07-16T18:48:04.000Z热度 58

OpenAI 训练了内部攻击模型 GPT-Red,通过自我对弈强化学习对抗防御 LLM 群体。在复现的间接提示注入测试中,GPT-Red 以 84% 对 13% 击败人类红队成...

论文研究MarkTechPost(RSS)

今日 AI 情报摘要

OpenAI 训练了内部攻击模型 GPT-Red,通过自我对弈强化学习对抗防御 LLM 群体。

在复现的间接提示注入测试中,GPT-Red 以 84% 对 13% 击败人类红队成员,发现了一种新型"虚假思维链"攻击类别,并将 GPT-5.6 Sol 在 OpenAI 最难直接注入基准上的失败率降低 6 倍。 OpenAI 承认该模型在多轮和基于图像的攻击上仍有困难。

中文正文 · AI 翻译

本周,OpenAI 发布了 GPT-Red 的详细信息:https://openai.com/index/unlocking-self-improvement-gpt-red/,这是一种仅限内部使用的自动化红队模型。它的任务是攻击 OpenAI 自己的模型,并发现提示注入漏洞。

OpenAI 给出了两个原因。人工红队工作耗时且难以扩展。最新模型已经使常用的稳健性评估趋于饱和。

与此同时,攻击面在扩大。智能代理通过浏览器、连接的应用、本地文件和工具读取第三方数据。这些功能对于实际工作是必要的,同时也让攻击者能够在这些数据中植入精心设计的指令。

GPT-Red:https://openai.com/index/unlocking-self-improvement-gpt-red/:https://openai.com/index/unlocking-self-improvement-gpt-red/ 是一个模型,而不是静态基准或提示库。它的工作方式像人类红队一样:发送提示、观察响应,并逐步迭代以达成目标。

OpenAI 团队在一些最大的训练后计算规模上训练了它,完全是出于安全考虑。

两个部署决策很重要。首先,GPT-Red 与已部署的模型分开。这能让其恶意能力远离对抗者。其次,它有两项工作任务:在部署前发现漏洞,以及在训练中生成攻击。

第二项工作依赖于下面的训练循环。

GPT-Red 使用自我对战强化学习进行训练。攻击者和一组多样化的防御 LLM 在各种红队场景中同时进行训练。

奖励结构是核心理念:

第二条款很重要。防御者不能通过拒绝一切来获胜,因为它仍然必须完成任务。

每个环境都有一个威胁模型。它指定了 GPT-Red 可以控制的内容以及什么算作成功。GPT-Red 可能控制本地文件的一部分、网页横幅、电子邮件正文或工具的输出。

随着防御者的加固,GPT-Red 被迫发现更强大、更具多样性的攻击。在训练结束时,它几乎破解了所有对抗的模型,包括内部和生产模型,直至 GPT-5.5。

在此过程中,它还发现了一些新的东西。

思路链是大语言模型在解决问题时保持的运行笔记。早期的 GPT-Red 学会了在该笔记中插入虚假的条目。目标模型会根据它认为已验证的伪信息采取行动。

OpenAI 将其称为一种新的直接提示注入攻击类别,是其研究人员此前未见过的。

因此,这类攻击成为了训练目标。

OpenAI 团队在新颖的安全环境和未见过的目标模型上测试了 GPT-Red。结果重现了 Dziemian 等人(2025)提出的间接提示注入领域:https://arxiv.org/abs/2603.15714。人类和 GPT-Red 在那里独立提出了针对 GPT-5.1 的攻击。

另外,OpenAI 团队对两代模型测试了 GPT-Red 最强的攻击。对 2025 年 8 月发布的 GPT-5,有超过 90% 的攻击有效。对 GPT-5.6,仅有不到 23% 有效:https://www.technologyreview.com/2026/07/15/1140514/meet-gpt-red-an-llm-super-hacker-openai-built-to-make-its-models-safer/

基准测试是一回事,实际系统又是另一回事。

OpenAI 还针对实际具代理能力的系统进行了两项案例研究,对每个系统的知识都不完全。

OpenAI 将 GPT-Red 与 Vendy 进行了对抗,Vendy 是其办公室中的一台 AI 驱动自动售货机。由 Andon Labs 构建,OpenAI 指出它类似于 Project Vend。GPT-Red 在模拟中进行迭代,然后将攻击转移到生产代理上。它达成了所有三个目标:

OpenAI 公开了这些漏洞,并且新的安全防护措施正在积极测试中。

GPT-Red 攻击了基于 GPT-5.4 mini 的 Codex CLI 代理。该套件覆盖了 10 个保留的数据外泄场景。相较于带提示的 GPT-5.5 基线,它更有效且令牌使用效率更高。

对于开发者来说,可重用的部分是攻击的形式。

在 OpenAI 发布的示例中,助理在内部语料库上运行 file_search.search。检索到的文件元数据带有植入标记(主机信息已编辑):

该标记模仿了关于上传诊断信息的系统规则。GPT-5.1 遵循了这一规则,并向该端点发出了 web.post 请求。GPT-5.6 抵制了该操作,推理出注入的工具输出应被忽略。

在攻击成功的同时打分 task_completed 并非可选。OpenAI 运行了相同的控制测试。

OpenAI 公布 GPT-Red:内部自动化红队模型在提示注入测试中以 84% 对 13% 击败人类红队成员

Asif Razzaq 是 Marktechpost Media Inc. 的首席执行官。作为一位有远见的企业家和工程师,Asif 致力于利用人工智能的潜力造福社会。他最近的努力是推出人工智能媒体平台 Marktechpost,该平台因其对机器学习和深度学习新闻的深入报道而脱颖而出,既技术上可靠,又易于广大受众理解。该平台每月浏览量超过 200 万次,显示了其在观众中的受欢迎程度。

Patter SDK Guide to Building a Restaurant Booking Phone Agent with Dynamic Variables, Guardrails, Latency Dashboards, and Eval Checks
Soofi Consortium Releases Soofi S 30B-A3B
Building a Gin Config Controlled PyTorch Pipeline with Configurable MLP Variants, Cosine Scheduling, and Runtime Parameter Overrides

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:OpenAI 训练了内部攻击模型 GPT-Red,通过自我对弈强化学习对抗防御 LLM 群体。 Aioga 将其归入「论文研究」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: marktechpost.com

来源: MarkTechPost(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-16T18:48:04.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

OpenAI 训练了内部攻击模型 GPT-Red,通过自我对弈强化学习对抗防御 LLM 群体。在复现的间接提示注入测试中,GPT-Red 以 84% 对 13% 击败人类红队成...

MarkTechPost(RSS)2026-07-16T18:48:04.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。