OpenAI 训练了自动化红队模型 GPT-Red,用于在部署前发现漏洞并在训练中生成攻击以提升模型鲁棒性。
GPT-Red 能攻破此前几乎所有模型,其攻击被用于对抗训练 GPT-5.6 Sol,使该模型在直接提示注入基准测试中的失败率降至四个月前最佳生产模型的 1/6。
GPT-Red 通过自对弈强化学习训练,投入了 OpenAI 后训练中前所未有的计算规模。
OpenAI는 자동화된 레드팀 모델 GPT-Red를 훈련시켜 배포 전에 취약점을 발견하고 훈련 중 공격을 생성하여 모델의 견고성을 강화했습니다. GPT-Red는 거의 모든 이전 모델을 뚫을 수 있으며, 이 공격은 GPT-5.6 Sol 훈련에 사용되어 4개월 전 직접 프로프트 인...
OpenAI는 자동화된 레드팀 모델 GPT-Red를 훈련시켜 배포 전에 취약점을 발견하고 훈련 중 공격을 생성하여 모델의 견고성을 강화했습니다. GPT-Red는 거의 모든 이전
모델을 뚫을 수 있으며, 이 공격은 GPT-5.6 Sol 훈련에 사용되어 4개월 전 직접 프로프트 인젝션 벤치마크에서 실패율을 최고의 생산 모델의 6분의 1로 낮췄습니다. GPT-Red는 자동강화학습 훈련을 통해 OpenAI 훈련에서 전례 없는 연산 규모를 달성했습니다.
OpenAI 训练了自动化红队模型 GPT-Red,用于在部署前发现漏洞并在训练中生成攻击以提升模型鲁棒性。
GPT-Red 能攻破此前几乎所有模型,其攻击被用于对抗训练 GPT-5.6 Sol,使该模型在直接提示注入基准测试中的失败率降至四个月前最佳生产模型的 1/6。
GPT-Red 通过自对弈强化学习训练,投入了 OpenAI 后训练中前所未有的计算规模。
OpenAI 发布自动化红队模型 GPT-Red,用于部署前发现漏洞,并在训练阶段生成攻击样本。其攻击被用于对抗训练 GPT-5.6 Sol,以提升模型面对直接提示注入时的鲁棒性。
公开材料显示,GPT-Red 采用自对弈强化学习训练,使用了 OpenAI 后训练中前所未有的计算规模。该模型能够攻破此前几乎所有模型,为后续对抗训练提供攻击样本。
Aioga 判断,GPT-Red 的重点不只是自动发现漏洞,而是把红队攻击直接纳入模型训练流程,使安全测试与鲁棒性改进形成更紧密的迭代机制。
值得关注的是,GPT-5.6 Sol 在直接提示注入基准测试中的失败率,已降至四个月前最佳生产模型的六分之一。这可能表明自动化攻击样本对特定安全训练具有实际价值。 后续值得关注 OpenAI 是否披露更完整的基准设置、失败率口径与跨模型测试结果,以及 GPT-Red 在部署前评估和训练阶段的具体使用方式,以判断其效果能否稳定延伸到更多场景。
수집 피드는 제목, 요약, 출처와 원문 링크를 제공합니다. Aioga는 원문 전체를 재게시하지 않습니다.
수집 채널: RSS · 원본 도메인: openai.com
출처: OpenAI:官网动态(RSS · 排除企业/客户案例)
원문 링크: 원문 열기
Aioga 아카이브: 정보 페이지 보기
Content record: summary-fallback · Updated: 2026-07-15T10:00:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga는 전 세계 AI 동향을 집계하고 확인과 인용을 위해 출처 정보를 보존합니다.