Aioga
AI资讯 / 论文研究
返回 AI资讯

OpenAI 用 AI 攻击自家 AI:GPT-Red 自动发现安全漏洞,成功率 84% 远超人类

The Decoder:AI News(RSS)Aioga 编辑团队2026-07-15T19:47:53.000Z热度 71

OpenAI 训练了内部 AI 模型 GPT-Red,通过自我对弈强化学习自动模拟提示词注入等攻击,在测试场景中成功率达 84%,而人类红队仅为 13%。GPT-Red 的发现...

论文研究The Decoder:AI News(RSS)

今日 AI 情报摘要

OpenAI 训练了内部 AI 模型 GPT-Red,通过自我对弈强化学习自动模拟提示词注入等攻击,在测试场景中成功率达 84%,而人类红队仅为 13%。

GPT-Red 的发现直接用于训练,使 GPT-5.6 Sol 在直接提示词注入上的故障次数比四个月前的最佳模型减少六倍,且未影响通用性能。 约 3.8% 的"更强"提示词注入仍能成功,GPT-Red 暂不对外开放。

中文正文 · AI 翻译

OpenAI训练了一个内部AI模型,叫做GPT-Red,用于自动发现GPT模型的安全漏洞。GPT-Red模拟提示注入:https://the-decoder.com/openai-admits-prompt-injection-may-never-be-fully-solved-casting-doubt-on-the-agentic-ai-vision/ 以及其他攻击方式,其中恶意指令隐藏在电子邮件、网站或文件中。通过自我博弈强化学习训练,GPT-Red在防御模型阻挡时进行攻击,并且双方随着时间提升能力。在测试场景中,它找到了84%的成功攻击,而人类红队成员只有13%。在一次测试中,它操纵了OpenAI办公室内的AI自动售货机,修改价格,并取消了其他客户的订单。

这些结果直接用于训练。OpenAI表示,GPT-5.6 Sol:https://the-decoder.com/openais-claude-mythos-competitor-gpt-5-6-sol-launches-under-government-controlled-access-it-calls-unsustainable/ 在直接提示注入测试中的失败率比四个月前的最佳模型低六倍,同时未影响总体性能。但约有3.8%的“强提示注入”仍然成功。如果放大到数百或数千次尝试,就会有相当数量通过,这与Claude Opus 4.5:https://the-decoder.com/claude-opus-4-5-resists-prompt-injections-better-than-rivals-but-still-falls-to-strong-attacks-alarmingly-often/ 类似。

rompt injection success rates dropped steadily from GPT-5.3 through GPT-5.6 Sol, but haven't hit zero. | Image: OpenAI

GPT-Red保持内部使用;一篇包含更多细节的论文将随后发布。Ad DEC_D_Incontent-1 广告

保持对AI的关注。内容清晰、有用,无废话。

关注The Decoder,获取AI新闻、背景故事和专家分析。

The Decoder:https://the-decoder.com/

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:OpenAI 训练了内部 AI 模型 GPT-Red,通过自我对弈强化学习自动模拟提示词注入等攻击,在测试场景中成功率达 84%,而人类红队仅为 13%。 Aioga 将其归入「论文研究」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: the-decoder.com

来源: The Decoder:AI News(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-15T19:47:53.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

OpenAI 训练了内部 AI 模型 GPT-Red,通过自我对弈强化学习自动模拟提示词注入等攻击,在测试场景中成功率达 84%,而人类红队仅为 13%。GPT-Red 的发现...

The Decoder:AI News(RSS)2026-07-15T19:47:53.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。