OpenAI 训练了自动化红队模型 GPT-Red,用于在部署前发现漏洞并在训练中生成攻击以提升模型鲁棒性。
GPT-Red 能攻破此前几乎所有模型,其攻击被用于对抗训练 GPT-5.6 Sol,使该模型在直接提示注入基准测试中的失败率降至四个月前最佳生产模型的 1/6。
GPT-Red 通过自对弈强化学习训练,投入了 OpenAI 后训练中前所未有的计算规模。
OpenAIは自動化されたレッドチームモデルGPT-Redを訓練し、展開前に脆弱性を発見し、トレーニング中に攻撃を生成してモデルの堅牢性を高めました。 GPT-Redはほぼすべての従来のモデルを突破可能であり、その攻撃はGPT-5.6 Solのトレーニングにも使われ、4か月前には直接プロンプトインジェクション...
OpenAIは自動化されたレッドチームモデルGPT-Redを訓練し、展開前に脆弱性を発見し、トレーニング中に攻撃を生成してモデルの堅牢性を高めました。
GPT-Redはほぼすべての従来のモデルを突破可能であり、その攻撃はGPT-5.6 Solのトレーニングにも使われ、4か月前には直接プロンプトインジェクションの失敗率を最高の生産モデルの6分の1にまで削減しました。 GPT-Redは、Auto-reforcement learningトレーニングを通じてOpenAIのトレーニングにおいて前例のない計算規模を実現しました。
OpenAI 训练了自动化红队模型 GPT-Red,用于在部署前发现漏洞并在训练中生成攻击以提升模型鲁棒性。
GPT-Red 能攻破此前几乎所有模型,其攻击被用于对抗训练 GPT-5.6 Sol,使该模型在直接提示注入基准测试中的失败率降至四个月前最佳生产模型的 1/6。
GPT-Red 通过自对弈强化学习训练,投入了 OpenAI 后训练中前所未有的计算规模。
OpenAI 发布自动化红队模型 GPT-Red,用于部署前发现漏洞,并在训练阶段生成攻击样本。其攻击被用于对抗训练 GPT-5.6 Sol,以提升模型面对直接提示注入时的鲁棒性。
公开材料显示,GPT-Red 采用自对弈强化学习训练,使用了 OpenAI 后训练中前所未有的计算规模。该模型能够攻破此前几乎所有模型,为后续对抗训练提供攻击样本。
Aioga 判断,GPT-Red 的重点不只是自动发现漏洞,而是把红队攻击直接纳入模型训练流程,使安全测试与鲁棒性改进形成更紧密的迭代机制。
值得关注的是,GPT-5.6 Sol 在直接提示注入基准测试中的失败率,已降至四个月前最佳生产模型的六分之一。这可能表明自动化攻击样本对特定安全训练具有实际价值。 后续值得关注 OpenAI 是否披露更完整的基准设置、失败率口径与跨模型测试结果,以及 GPT-Red 在部署前评估和训练阶段的具体使用方式,以判断其效果能否稳定延伸到更多场景。
取得元が提供するタイトル、要約、出典、元記事リンクを掲載しています。記事全文は転載していません。
取得経路: RSS · 元ドメイン: openai.com
出典: OpenAI:官网动态(RSS · 排除企业/客户案例)
元記事: 元記事を開く
Aioga アーカイブ: 情報ページを開く
Content record: summary-fallback · Updated: 2026-07-15T10:00:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga は世界の AI 動向を集約し、確認と引用のため出典情報を保持します。