OpenAI 训练了自动化红队模型 GPT-Red,用于在部署前发现漏洞并在训练中生成攻击以提升模型鲁棒性。
GPT-Red 能攻破此前几乎所有模型,其攻击被用于对抗训练 GPT-5.6 Sol,使该模型在直接提示注入基准测试中的失败率降至四个月前最佳生产模型的 1/6。
GPT-Red 通过自对弈强化学习训练,投入了 OpenAI 后训练中前所未有的计算规模。
OpenAI entrenó al modelo automatizado de equipo rojo GPT-Red para descubrir vulnerabilidades antes del despliegue y generar ataques durante el entrenamient...
OpenAI entrenó al modelo automatizado de equipo rojo GPT-Red para descubrir vulnerabilidades antes
del despliegue y generar ataques durante el entrenamiento para mejorar la robustez del modelo. GPT-Red puede superar casi todos los modelos anteriores, y sus ataques se utilizaron contra el entrenamiento de GPT-5.6 Sol, reduciendo su tasa de fallos en benchmarks de inyección directa rápida a una sexta parte del mejor modelo de producción hace cuatro meses. GPT-Red ha logrado una escala de cálculo sin precedentes en el entrenamiento de OpenAI mediante aprendizaje por refuerzo automático.
OpenAI 训练了自动化红队模型 GPT-Red,用于在部署前发现漏洞并在训练中生成攻击以提升模型鲁棒性。
GPT-Red 能攻破此前几乎所有模型,其攻击被用于对抗训练 GPT-5.6 Sol,使该模型在直接提示注入基准测试中的失败率降至四个月前最佳生产模型的 1/6。
GPT-Red 通过自对弈强化学习训练,投入了 OpenAI 后训练中前所未有的计算规模。
OpenAI 发布自动化红队模型 GPT-Red,用于部署前发现漏洞,并在训练阶段生成攻击样本。其攻击被用于对抗训练 GPT-5.6 Sol,以提升模型面对直接提示注入时的鲁棒性。
公开材料显示,GPT-Red 采用自对弈强化学习训练,使用了 OpenAI 后训练中前所未有的计算规模。该模型能够攻破此前几乎所有模型,为后续对抗训练提供攻击样本。
Aioga 判断,GPT-Red 的重点不只是自动发现漏洞,而是把红队攻击直接纳入模型训练流程,使安全测试与鲁棒性改进形成更紧密的迭代机制。
值得关注的是,GPT-5.6 Sol 在直接提示注入基准测试中的失败率,已降至四个月前最佳生产模型的六分之一。这可能表明自动化攻击样本对特定安全训练具有实际价值。 后续值得关注 OpenAI 是否披露更完整的基准设置、失败率口径与跨模型测试结果,以及 GPT-Red 在部署前评估和训练阶段的具体使用方式,以判断其效果能否稳定延伸到更多场景。
La fuente proporciona título, resumen, atribución y enlace original. Aioga no republica el artículo completo.
Canal de ingesta: RSS · Dominio original: openai.com
Fuente: OpenAI:官网动态(RSS · 排除企业/客户案例)
Enlace original: Abrir fuente original
Archivo Aioga: Abrir página de inteligencia
Content record: summary-fallback · Updated: 2026-07-15T10:00:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga agrega novedades globales de IA y conserva las fuentes para verificación y cita.