OpenAI 训练了自动化红队模型 GPT-Red,用于在部署前发现漏洞并在训练中生成攻击以提升模型鲁棒性。
GPT-Red 能攻破此前几乎所有模型,其攻击被用于对抗训练 GPT-5.6 Sol,使该模型在直接提示注入基准测试中的失败率降至四个月前最佳生产模型的 1/6。
GPT-Red 通过自对弈强化学习训练,投入了 OpenAI 后训练中前所未有的计算规模。
OpenAI trainierte das automatisierte Red-Team-Modell GPT-Red, um Schwachstellen vor der Bereitstellung zu erkennen und während des Trainings Angriffe zu ge...
OpenAI trainierte das automatisierte Red-Team-Modell GPT-Red, um Schwachstellen vor der
Bereitstellung zu erkennen und während des Trainings Angriffe zu generieren, um die Modellrobustheit zu verbessern. GPT-Red kann fast alle vorherigen Modelle durchbrechen, und seine Angriffe wurden gegen das Training von GPT-5.6 Sol eingesetzt, wodurch die Ausfallquote bei direkten Prompt-Injection-Benchmarks auf ein Sechstel des besten Produktionsmodells vor vier Monaten reduziert wurde. GPT-Red hat eine beispiellose Rechenleistung im Training von OpenAI durch Auto-Reinforcement Learning erreicht.
OpenAI 训练了自动化红队模型 GPT-Red,用于在部署前发现漏洞并在训练中生成攻击以提升模型鲁棒性。
GPT-Red 能攻破此前几乎所有模型,其攻击被用于对抗训练 GPT-5.6 Sol,使该模型在直接提示注入基准测试中的失败率降至四个月前最佳生产模型的 1/6。
GPT-Red 通过自对弈强化学习训练,投入了 OpenAI 后训练中前所未有的计算规模。
OpenAI 发布自动化红队模型 GPT-Red,用于部署前发现漏洞,并在训练阶段生成攻击样本。其攻击被用于对抗训练 GPT-5.6 Sol,以提升模型面对直接提示注入时的鲁棒性。
公开材料显示,GPT-Red 采用自对弈强化学习训练,使用了 OpenAI 后训练中前所未有的计算规模。该模型能够攻破此前几乎所有模型,为后续对抗训练提供攻击样本。
Aioga 判断,GPT-Red 的重点不只是自动发现漏洞,而是把红队攻击直接纳入模型训练流程,使安全测试与鲁棒性改进形成更紧密的迭代机制。
值得关注的是,GPT-5.6 Sol 在直接提示注入基准测试中的失败率,已降至四个月前最佳生产模型的六分之一。这可能表明自动化攻击样本对特定安全训练具有实际价值。 后续值得关注 OpenAI 是否披露更完整的基准设置、失败率口径与跨模型测试结果,以及 GPT-Red 在部署前评估和训练阶段的具体使用方式,以判断其效果能否稳定延伸到更多场景。
当前抓取源提供的是标题、摘要、来源和原文入口,不直接搬运完整原文。完整报道请通过下方原文链接前往来源站点查看。
抓取通道: RSS · 原始域名: openai.com
Quelle: OpenAI:官网动态(RSS · 排除企业/客户案例)
原文链接: Originalquelle öffnen
Aioga 归档: 查看情报页
Content record: summary-fallback · Updated: 2026-07-15T10:00:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。