{"@context":"https://schema.org","@type":"NewsArticle","generatedAt":"2026-07-23T06:40:50.084Z","headline":"OpenAI 公布 GPT-Red：内部自动化红队模型在提示注入测试中以 84% 对 13% 击败人类红队成员","description":"OpenAI 训练了内部攻击模型 GPT-Red，通过自我对弈强化学习对抗防御 LLM 群体。在复现的间接提示注入测试中，GPT-Red 以 84% 对 13% 击败人类红队成员，发现了一种新型\"虚假思维链\"攻击类别，并将 GPT-5.6 Sol 在 OpenAI 最难直接注入基准上的失败率降低 6 倍。OpenAI 承认该模型在多轮和基于图像的攻击上仍有困难。","url":"https://www.aioga.com/news/cmrnw0hk501dabixya1ypjg7l/","mainEntityOfPage":"https://www.aioga.com/news/cmrnw0hk501dabixya1ypjg7l/","datePublished":"2026-07-16T18:48:04.000Z","dateModified":"2026-07-16T18:48:04.000Z","inLanguage":"zh-CN","publisher":{"@type":"NewsMediaOrganization","name":"Aioga","url":"https://www.aioga.com"},"citation":["https://www.marktechpost.com/2026/07/16/openai-details-gpt-red-an-internal-automated-red-teaming-model-that-beat-human-red-teamers-84-to-13-on-prompt-injection","https://aihot.virxact.com/items/cmrnw0hk501dabixya1ypjg7l"],"canonicalUrl":"https://www.aioga.com/news/cmrnw0hk501dabixya1ypjg7l/","directAnswer":{"@type":"Answer","text":"Aioga 编辑摘要：OpenAI 训练了内部攻击模型 GPT-Red，通过自我对弈强化学习对抗防御 LLM 群体。 Aioga 将其归入「论文研究」方向，重点关注它对真实使用和行业竞争的影响。","url":"https://www.aioga.com/news/cmrnw0hk501dabixya1ypjg7l/","dateCreated":"2026-07-16T18:48:04.000Z","author":{"@type":"Organization","@id":"https://www.aioga.com/authors/aioga-editorial/#editorial-team","name":"Aioga Editorial Team","url":"https://www.aioga.com/authors/aioga-editorial/"}},"evidence":[{"@type":"CreativeWork","name":"marktechpost.com source article","url":"https://www.marktechpost.com/2026/07/16/openai-details-gpt-red-an-internal-automated-red-teaming-model-that-beat-human-red-teamers-84-to-13-on-prompt-injection","datePublished":"2026-07-16T18:48:04.000Z","provider":{"@type":"Organization","name":"marktechpost.com","url":"https://www.marktechpost.com/2026/07/16/openai-details-gpt-red-an-internal-automated-red-teaming-model-that-beat-human-red-teamers-84-to-13-on-prompt-injection"}},{"@type":"CreativeWork","name":"AIHot archive record","url":"https://aihot.virxact.com/items/cmrnw0hk501dabixya1ypjg7l","datePublished":"2026-07-16T18:48:04.000Z","provider":{"@type":"Organization","name":"AIHot","url":"https://aihot.virxact.com/items/cmrnw0hk501dabixya1ypjg7l"}}],"aggregationSource":"MarkTechPost（RSS）","originalPublisher":{"name":"marktechpost.com","url":"https://www.marktechpost.com/2026/07/16/openai-details-gpt-red-an-internal-automated-red-teaming-model-that-beat-human-red-teamers-84-to-13-on-prompt-injection"},"article":{"id":"cmrnw0hk501dabixya1ypjg7l","slug":"cmrnw0hk501dabixya1ypjg7l","url":"https://www.aioga.com/news/cmrnw0hk501dabixya1ypjg7l/","title":"OpenAI 公布 GPT-Red：内部自动化红队模型在提示注入测试中以 84% 对 13% 击败人类红队成员","title_en":"OpenAI Details GPT-Red： An Internal Automated Red-Teaming Model That Beat Human Red-Teamers 84% To 13% On Prompt Injection","summary":"OpenAI 训练了内部攻击模型 GPT-Red，通过自我对弈强化学习对抗防御 LLM 群体。在复现的间接提示注入测试中，GPT-Red 以 84% 对 13% 击败人类红队成员，发现了一种新型\"虚假思维链\"攻击类别，并将 GPT-5.6 Sol 在 OpenAI 最难直接注入基准上的失败率降低 6 倍。OpenAI 承认该模型在多轮和基于图像的攻击上仍有困难。","source":"MarkTechPost（RSS）","sourceUrl":"https://www.marktechpost.com/2026/07/16/openai-details-gpt-red-an-internal-automated-red-teaming-model-that-beat-human-red-teamers-84-to-13-on-prompt-injection","aiHotUrl":"https://aihot.virxact.com/items/cmrnw0hk501dabixya1ypjg7l","publishedAt":"2026-07-16T18:48:04.000Z","category":"论文研究","score":58,"selected":false,"articleBody":["This week, OpenAI published details of GPT-Red：https://openai.com/index/unlocking-self-improvement-gpt-red/ , an internal-only automated red-teaming model. Its job is to attack OpenAI’s own models and find prompt injection vulnerabilities.","OpenAI gives two reasons. Human red-teaming is time-intensive and does not scale. Commonly used robustness evaluations are already saturated by its latest models.","Meanwhile, the attack surface grows. Agents read third-party data through browsers, connected apps, local files, and tools. Those affordances are necessary for real work. They also let an attacker plant a crafted instruction in that data.","GPT-Red：https://openai.com/index/unlocking-self-improvement-gpt-red/ ：https://openai.com/index/unlocking-self-improvement-gpt-red/is a model, not a static benchmark or a prompt library. It works like a human red-teamer. It sends a prompt, observes the response, and iterates toward a goal.","OpenAI team trained it at the compute scale of some of its largest post-training runs, purely for safety.","Two deployment decisions matter. First, GPT-Red is kept separate from deployed models. That keeps its malicious capabilities away from adversarial actors. Second, it does two jobs. It uncovers vulnerabilities before deployment, and generates attacks during training.","The second job depends on the training loop below.","GPT-Red is trained using self-play reinforcement learning. The attacker and a collection of diverse defender LLMs train simultaneously across a broad set of red-teaming scenarios.","The reward structure is the core idea:","That second clause matters. A defender cannot win by refusing everything, since it must still finish the task.","Each environment carries a threat model. It specifies what GPT-Red controls and what counts as success. GPT-Red might control part of a local file, a webpage banner, an email body, or a tool’s output.","As defenders harden, GPT-Red is forced to discover stronger and more diverse attacks. By the end of training, it breaks nearly all models it is pitted against. That includes internal and production models up to and including GPT-5.5.","Along the way, it also found something new.","A chain of thought is the running note an LLM keeps while solving a problem. An early GPT-Red learned to insert a fake entry into that note. The target then acts on spoofed information it thinks it verified.","OpenAI calls it a novel class of direct prompt injection attack, unseen by its researchers.","Consequently, that class became a training target.","OpenAI team tested GPT-Red on novel safety environments and unseen target models. The result replicates the indirect prompt injection arena from Dziemian et al. (2025)：https://arxiv.org/abs/2603.15714 . Humans and GPT-Red independently proposed attacks against GPT-5.1 there.","Separately, OpenAI team ran GPT-Red’s strongest attacks against two generations. Over 90% worked against GPT-5, released August 2025. Fewer than 23% work against GPT-5.6.：https://www.technologyreview.com/2026/07/15/1140514/meet-gpt-red-an-llm-super-hacker-openai-built-to-make-its-models-safer/","Benchmarks are one thing. Live systems are another.","OpenAI also ran two case studies against real agentic systems, with incomplete knowledge of each harness.","OpenAI pitted GPT-Red against Vendy, an AI-powered vending machine in its office. Andon Labs built it, and OpenAI notes it resembles Project Vend. GPT-Red iterated in simulation, then transferred the attack to the production agent. It achieved all three objectives:","OpenAI disclosed these vulnerabilities, and new safeguards are actively being tested.","GPT-Red attacked a Codex CLI agent based on GPT-5.4 mini. The suite covered 10 held-out data-exfiltration scenarios. Against a prompted GPT-5.5 baseline, it was more effective and more token efficient.","For developers, the reusable part is the attack’s shape.","In OpenAI’s published sample, an assistant runs file_search.search over an internal corpus. The retrieved file’s metadata carries a planted marker (host redacted):","The marker imitates a system rule about uploading diagnostics. GPT-5.1 followed it and issued a web.post to that endpoint. GPT-5.6 resisted, reasoning the injected tool output should be ignored.","Scoring task_completed alongside attack success is not optional. OpenAI ran the same control.","Asif Razzaq is the CEO of Marktechpost Media Inc.. As a visionary entrepreneur and engineer, Asif is committed to harnessing the potential of Artificial Intelligence for social good. His most recent endeavor is the launch of an Artificial Intelligence Media Platform, Marktechpost, which stands out for its in-depth coverage of machine learning and deep learning news that is both technically sound and easily understandable by a wide audience. The platform boasts of over 2 million monthly views, illustrating its popularity among audiences."],"articleImages":[{"sourceUrl":"https://www.marktechpost.com/wp-content/uploads/2019/06/Screen-Shot-2021-09-14-at-9.02.24-AM-300x300.png","alt":"","afterParagraph":26,"url":"/media/articles/cmrnw0hk501dabixya1ypjg7l/787a6d54564e8e19.webp"},{"sourceUrl":"https://www.marktechpost.com/wp-content/uploads/2026/07/high-level-description-a-developer-focus_feCO3rqGV4ig6q7LaBcN2w_K5t5TwjZTPWy666HxX0epA-100x70.png","alt":"Patter SDK Guide to Building a Restaurant Booking Phone Agent with Dynamic Variables, Guardrails, Latency Dashboards, and Eval Checks","afterParagraph":27,"url":"/media/articles/cmrnw0hk501dabixya1ypjg7l/c998049732b3b311.webp"},{"sourceUrl":"https://www.marktechpost.com/wp-content/uploads/2026/07/high-level-description-a-cartoonish-meme_mx9sd4-zUJ2CQbUyJxX95w_w7GS0nEmTc6N2_1EO2Snmg-100x70.png","alt":"Soofi Consortium Releases Soofi S 30B-A3B","afterParagraph":27,"url":"/media/articles/cmrnw0hk501dabixya1ypjg7l/02ab67c4ea79309c.webp"},{"sourceUrl":"https://www.marktechpost.com/wp-content/uploads/2026/07/high-level-description-a-technical-blog-_jc7iI1-vWAa65GFgmnBhwQ_U7n28gZXRDeiQEimQU9cAw_cover-100x70.png","alt":"Building a Gin Config Controlled PyTorch Pipeline with Configurable MLP Variants, Cosine Scheduling, and Runtime Parameter Overrides","afterParagraph":27,"url":"/media/articles/cmrnw0hk501dabixya1ypjg7l/7ac38241502a486f.webp"}],"mediaStatus":"ok","articleBodyZh":["本周，OpenAI 发布了 GPT-Red 的详细信息：https://openai.com/index/unlocking-self-improvement-gpt-red/，这是一种仅限内部使用的自动化红队模型。它的任务是攻击 OpenAI 自己的模型，并发现提示注入漏洞。","OpenAI 给出了两个原因。人工红队工作耗时且难以扩展。最新模型已经使常用的稳健性评估趋于饱和。","与此同时，攻击面在扩大。智能代理通过浏览器、连接的应用、本地文件和工具读取第三方数据。这些功能对于实际工作是必要的，同时也让攻击者能够在这些数据中植入精心设计的指令。","GPT-Red：https://openai.com/index/unlocking-self-improvement-gpt-red/：https://openai.com/index/unlocking-self-improvement-gpt-red/ 是一个模型，而不是静态基准或提示库。它的工作方式像人类红队一样：发送提示、观察响应，并逐步迭代以达成目标。","OpenAI 团队在一些最大的训练后计算规模上训练了它，完全是出于安全考虑。","两个部署决策很重要。首先，GPT-Red 与已部署的模型分开。这能让其恶意能力远离对抗者。其次，它有两项工作任务：在部署前发现漏洞，以及在训练中生成攻击。","第二项工作依赖于下面的训练循环。","GPT-Red 使用自我对战强化学习进行训练。攻击者和一组多样化的防御 LLM 在各种红队场景中同时进行训练。","奖励结构是核心理念：","第二条款很重要。防御者不能通过拒绝一切来获胜，因为它仍然必须完成任务。","每个环境都有一个威胁模型。它指定了 GPT-Red 可以控制的内容以及什么算作成功。GPT-Red 可能控制本地文件的一部分、网页横幅、电子邮件正文或工具的输出。","随着防御者的加固，GPT-Red 被迫发现更强大、更具多样性的攻击。在训练结束时，它几乎破解了所有对抗的模型，包括内部和生产模型，直至 GPT-5.5。","在此过程中，它还发现了一些新的东西。","思路链是大语言模型在解决问题时保持的运行笔记。早期的 GPT-Red 学会了在该笔记中插入虚假的条目。目标模型会根据它认为已验证的伪信息采取行动。","OpenAI 将其称为一种新的直接提示注入攻击类别，是其研究人员此前未见过的。","因此，这类攻击成为了训练目标。","OpenAI 团队在新颖的安全环境和未见过的目标模型上测试了 GPT-Red。结果重现了 Dziemian 等人（2025）提出的间接提示注入领域：https://arxiv.org/abs/2603.15714。人类和 GPT-Red 在那里独立提出了针对 GPT-5.1 的攻击。","另外，OpenAI 团队对两代模型测试了 GPT-Red 最强的攻击。对 2025 年 8 月发布的 GPT-5，有超过 90% 的攻击有效。对 GPT-5.6，仅有不到 23% 有效：https://www.technologyreview.com/2026/07/15/1140514/meet-gpt-red-an-llm-super-hacker-openai-built-to-make-its-models-safer/","基准测试是一回事，实际系统又是另一回事。","OpenAI 还针对实际具代理能力的系统进行了两项案例研究，对每个系统的知识都不完全。","OpenAI 将 GPT-Red 与 Vendy 进行了对抗，Vendy 是其办公室中的一台 AI 驱动自动售货机。由 Andon Labs 构建，OpenAI 指出它类似于 Project Vend。GPT-Red 在模拟中进行迭代，然后将攻击转移到生产代理上。它达成了所有三个目标：","OpenAI 公开了这些漏洞，并且新的安全防护措施正在积极测试中。","GPT-Red 攻击了基于 GPT-5.4 mini 的 Codex CLI 代理。该套件覆盖了 10 个保留的数据外泄场景。相较于带提示的 GPT-5.5 基线，它更有效且令牌使用效率更高。","对于开发者来说，可重用的部分是攻击的形式。","在 OpenAI 发布的示例中，助理在内部语料库上运行 file_search.search。检索到的文件元数据带有植入标记（主机信息已编辑）：","该标记模仿了关于上传诊断信息的系统规则。GPT-5.1 遵循了这一规则，并向该端点发出了 web.post 请求。GPT-5.6 抵制了该操作，推理出注入的工具输出应被忽略。","在攻击成功的同时打分 task_completed 并非可选。OpenAI 运行了相同的控制测试。","Asif Razzaq 是 Marktechpost Media Inc. 的首席执行官。作为一位有远见的企业家和工程师，Asif 致力于利用人工智能的潜力造福社会。他最近的努力是推出人工智能媒体平台 Marktechpost，该平台因其对机器学习和深度学习新闻的深入报道而脱颖而出，既技术上可靠，又易于广大受众理解。该平台每月浏览量超过 200 万次，显示了其在观众中的受欢迎程度。"],"translationStatus":"translated","bodyOrigin":"source-page","editorial":{"summary":"Aioga 编辑摘要：OpenAI 训练了内部攻击模型 GPT-Red，通过自我对弈强化学习对抗防御 LLM 群体。 Aioga 将其归入「论文研究」方向，重点关注它对真实使用和行业竞争的影响。","background":"背景分析：模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断，单项指标领先不等于已经形成稳定采用。","viewpoint":"Aioga 判断：这条动态更适合作为行业观察信号，当前信息足以建立线索，但不足以推导长期结论。","implications":"影响分析：对相关团队而言，短期应先核对来源、可用范围和实际成本，再判断是否值得接入或跟进。","nextStep":"后续观察：继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。","evidenceRefs":["title","summary","articleBody"],"confidence":"medium","status":"published","aiGenerated":false,"autoApproved":true,"generatedBy":"rule-safe-fallback","generatedAt":"2026-07-23T06:49:19.199Z","sourceHash":"c509d17301ad19dd","validation":{"passed":true,"mode":"rule-safe-fallback","checks":["schema","length","source-attribution","no-html"]}},"tags":["论文研究","MarkTechPost（RSS）"],"translations":{"zh-CN":{"title":"OpenAI 公布 GPT-Red：内部自动化红队模型在提示注入测试中以 84% 对 13% 击败人类红队成员","summary":"OpenAI 训练了内部攻击模型 GPT-Red，通过自我对弈强化学习对抗防御 LLM 群体。在复现的间接提示注入测试中，GPT-Red 以 84% 对 13% 击败人类红队成员，发现了一种新型\"虚假思维链\"攻击类别，并将 GPT-5.6 Sol 在 OpenAI 最难直接注入基准上的失败率降低 6 倍。OpenAI 承认该模型在多轮和基于图像的攻击上仍有困难。","category":"论文研究","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"OpenAI 公布 GPT-Red：内部自动化红队模型在提示注入测试中以 84% 对 13% 击败人类红队成员 - Aioga AI资讯","description":"OpenAI 训练了内部攻击模型 GPT-Red，通过自我对弈强化学习对抗防御 LLM 群体。在复现的间接提示注入测试中，GPT-Red 以 84% 对 13% 击败人类红队成员，发现了一种新型\"虚假思维链\"攻击类别，并将 GPT-5.6 Sol 在 OpenAI 最难直接注入基准上的失败率降低 6 倍。OpenAI 承认该模型在多轮和基于图像的攻击上仍有困","url":"https://www.aioga.com/news/cmrnw0hk501dabixya1ypjg7l/"},"en":{"title":"OpenAI Announces GPT-Red: Internal Automated Red Team Model Beats Human Red Team Members 84% to 13% in Prompt Injection Testing","summary":"OpenAI trained an internal attack model, GPT-Red, to counter LLM defenses through self-play reinforcement learning. In reproduced indirect prompt injection tests, GPT-Red defeated human red team members 84% to 13%, discovering a new type of 'false chain of thought' attack, and reduced the failure rate of GPT-5.6 Sol on OpenAI's hardest direct injection benchmark by sixfold. OpenAI acknowledged that the model still struggles with multi-turn and image-based attacks.","category":"Research","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"OpenAI Announces GPT-Red: Internal Automated Red Team Model Beats Human Red Team Members 84% to 13% in Prompt Injection Testing - Aioga AI News","description":"OpenAI trained an internal attack model, GPT-Red, to counter LLM defenses through self-play reinforcement learning. In reproduced indirect prompt injection tests, GPT-Red defeated...","url":"https://www.aioga.com/en/news/cmrnw0hk501dabixya1ypjg7l/","contentTranslated":true,"sourceHash":"f5653ef013632c9a","translatedAt":"2026-07-23T00:22:05.442Z"},"ja":{"title":"OpenAI は GPT-Red を発表：内部自動化レッドチームモデルがプロンプト注入テストで人間のレッドチームメンバーを 84% 対 13% で打ち負かす","summary":"OpenAI は内部攻撃モデル GPT-Red を訓練し、自己対戦強化学習を通じて防御 LLM 集団に対抗させた。再現された間接プロンプトインジェクションテストでは、GPT-Red は人間のレッドチームメンバーを 13% に対して 84% の割合で打ち負かし、新しい「偽の思考連鎖」攻撃カテゴリーを発見し、GPT-5.6 Sol の OpenAI 最難直接インジェクションベンチマークでの失敗率を 6 倍減少させた。OpenAI は、このモデルが複数ラウンドおよび画像ベースの攻撃では依然として困難を抱えていることを認めている。","category":"論文研究","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"OpenAI は GPT-Red を発表：内部自動化レッドチームモデルがプロンプト注入テストで人間のレッドチームメンバーを 84% 対 13% で打ち負かす - Aioga AIニュース","description":"OpenAI は内部攻撃モデル GPT-Red を訓練し、自己対戦強化学習を通じて防御 LLM 集団に対抗させた。再現された間接プロンプトインジェクションテストでは、GPT-Red は人間のレッドチームメンバーを 13% に対して 84% の割合で打ち負かし、新しい「偽の思考連鎖」攻撃カテゴリーを発見し、GPT-5.6 Sol の OpenAI 最難直接イン...","url":"https://www.aioga.com/ja/news/cmrnw0hk501dabixya1ypjg7l/","contentTranslated":true,"sourceHash":"f5653ef013632c9a","translatedAt":"2026-07-23T00:22:21.573Z"},"ko":{"title":"OpenAI, GPT-Red 공개: 내부 자동화 레드팀 모델이 프롬프트 주입 테스트에서 인간 레드팀 구성원을 84% 대 13%로 이겼습니다","summary":"OpenAI는 내부 공격 모델 GPT-Red를 훈련시켰으며, 자가 대국 강화 학습을 통해 방어 LLM 집단에 맞서도록 했습니다. 재현된 간접 프롬프트 주입 테스트에서 GPT-Red는 84% 대 13%로 인간 레드팀 구성원을 이기고, 새로운 유형의 '가짜 사고 연쇄' 공격 범주를 발견했으며, OpenAI의 가장 어려운 직접 주입 벤치마크에서 GPT-5.6 Sol의 실패율을 6배 줄였습니다. OpenAI는 이 모델이 다중 라운드 및 이미지 기반 공격에서는 여전히 어려움을 겪고 있음을 인정했습니다.","category":"연구","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"OpenAI, GPT-Red 공개: 내부 자동화 레드팀 모델이 프롬프트 주입 테스트에서 인간 레드팀 구성원을 84% 대 13%로 이겼습니다 - Aioga AI 뉴스","description":"OpenAI는 내부 공격 모델 GPT-Red를 훈련시켰으며, 자가 대국 강화 학습을 통해 방어 LLM 집단에 맞서도록 했습니다. 재현된 간접 프롬프트 주입 테스트에서 GPT-Red는 84% 대 13%로 인간 레드팀 구성원을 이기고, 새로운 유형의 '가짜 사고 연쇄' 공격 범주를 발견했으며, OpenAI의 가장 어려운 직접...","url":"https://www.aioga.com/ko/news/cmrnw0hk501dabixya1ypjg7l/","contentTranslated":true,"sourceHash":"f5653ef013632c9a","translatedAt":"2026-07-23T00:23:10.463Z"},"es":{"title":"OpenAI anuncia GPT-Red: modelo de red roja automatizado interno derrota a los miembros humanos de la red roja en pruebas de inyección de indicaciones con un 84% contra 13%","summary":"OpenAI entrenó un modelo de ataque interno llamado GPT-Red, mediante aprendizaje reforzado de auto-juego para enfrentar defensas de grupos de LLM. En pruebas de inyección de indicios indirectos reproducidas, GPT-Red derrotó a miembros humanos del equipo rojo con un 84% frente a 13%, descubriendo una nueva categoría de ataque llamada \"cadena de pensamiento falsa\", y redujo la tasa de fracaso de GPT-5.6 Sol en el benchmark de inyección directa más difícil de OpenAI en 6 veces. OpenAI reconoce que el modelo todavía tiene dificultades con ataques de múltiples rondas y basados en imágenes.","category":"Investigación","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"OpenAI anuncia GPT-Red: modelo de red roja automatizado interno derrota a los miembros humanos de la red roja en pruebas de inyección de indicaciones con un 84% contra 13% - Aioga Noticias de IA","description":"OpenAI entrenó un modelo de ataque interno llamado GPT-Red, mediante aprendizaje reforzado de auto-juego para enfrentar defensas de grupos de LLM. En pruebas de inyección de indici...","url":"https://www.aioga.com/es/news/cmrnw0hk501dabixya1ypjg7l/","contentTranslated":true,"sourceHash":"f5653ef013632c9a","translatedAt":"2026-07-23T00:23:05.580Z"},"fr":{"title":"OpenAI annonce GPT-Red : le modèle de red team automatisé interne bat les membres humains de la red team à 84 % contre 13 % lors des tests d'injection de prompt","summary":"OpenAI a entraîné le modèle d'attaque interne GPT-Red, en utilisant l’apprentissage par renforcement par auto-jeu pour contrer la défense des groupes de LLM. Dans des tests de reproduction d'injections de suggestions indirectes, GPT-Red a battu les membres de l'équipe rouge humaine 84 % contre 13 %, découvrant une nouvelle catégorie d'attaque de \"chaîne de pensée fallacieuse\", et a réduit par 6 fois le taux d’échec de GPT-5.6 Sol sur la référence d’injection directe la plus difficile d’OpenAI. OpenAI reconnaît que ce modèle rencontre encore des difficultés avec les attaques multi-tours et basées sur l’image.","category":"Recherche","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"OpenAI annonce GPT-Red : le modèle de red team automatisé interne bat les membres humains de la red team à 84 % contre 13 % lors des tests d'injection de prompt - Aioga Actualités IA","description":"OpenAI a entraîné le modèle d'attaque interne GPT-Red, en utilisant l’apprentissage par renforcement par auto-jeu pour contrer la défense des groupes de LLM. Dans des tests de repr...","url":"https://www.aioga.com/fr/news/cmrnw0hk501dabixya1ypjg7l/","contentTranslated":true,"sourceHash":"f5653ef013632c9a","translatedAt":"2026-07-23T00:23:56.910Z"},"de":{"title":"OpenAI kündigt GPT-Red an: Internes automatisiertes Red-Team-Modell schlägt menschliche Red-Team-Mitglieder in Prompt-Injection-Tests mit 84 % gegen 13 %","summary":"OpenAI hat das interne Angriffsmodell GPT-Red trainiert, das durch selbst gegeneinander gerichtetes Verstärkungslernen die Abwehr großer Sprachmodelle (LLM) getestet hat. In reproduzierten Tests mit indirekten Prompt-Injektionen besiegte GPT-Red menschliche Red-Team-Mitglieder mit 84 % zu 13 %, entdeckte eine neue Art von ‚falscher Gedankenketten‘-Angriffen und verringerte die Ausfallrate von GPT-5.6 Sol beim schwierigsten direkten Injektions-Benchmark von OpenAI um das Sechsfache. OpenAI räumt ein, dass das Modell bei mehrstufigen und bildbasierten Angriffen weiterhin Schwierigkeiten hat.","category":"论文研究","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"OpenAI kündigt GPT-Red an: Internes automatisiertes Red-Team-Modell schlägt menschliche Red-Team-Mitglieder in Prompt-Injection-Tests mit 84 % gegen 13 % - Aioga KI-News","description":"OpenAI hat das interne Angriffsmodell GPT-Red trainiert, das durch selbst gegeneinander gerichtetes Verstärkungslernen die Abwehr großer Sprachmodelle (LLM) getestet hat. In reprod...","url":"https://www.aioga.com/de/news/cmrnw0hk501dabixya1ypjg7l/","contentTranslated":true,"sourceHash":"f5653ef013632c9a","translatedAt":"2026-07-23T00:23:57.614Z"},"pt-BR":{"title":"OpenAI anuncia GPT-Red: modelo de equipe vermelha automatizado interno derrota membros humanos da equipe vermelha em testes de injeção de prompts por 84% a 13%","summary":"A OpenAI treinou um modelo de ataque interno chamado GPT-Red, usando aprendizado por reforço de auto-jogo para atacar defensivamente grupos de LLMs. Em testes indiretos de injeção de prompts reproduzidos, o GPT-Red derrotou membros da equipe vermelha humana por 84% a 13%, descobrindo uma nova categoria de ataque chamada \"cadeia de pensamento falsa\" e reduziu a taxa de falha do GPT-5.6 Sol nos benchmarks de injeção direta mais difíceis da OpenAI em 6 vezes. A OpenAI reconhece que o modelo ainda enfrenta dificuldades em ataques multimodais e baseados em múltiplas rodadas.","category":"论文研究","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"OpenAI anuncia GPT-Red: modelo de equipe vermelha automatizado interno derrota membros humanos da equipe vermelha em testes de injeção de prompts por 84% a 13% - Aioga Notícias de IA","description":"A OpenAI treinou um modelo de ataque interno chamado GPT-Red, usando aprendizado por reforço de auto-jogo para atacar defensivamente grupos de LLMs. Em testes indiretos de injeção...","url":"https://www.aioga.com/pt-BR/news/cmrnw0hk501dabixya1ypjg7l/","contentTranslated":true,"sourceHash":"f5653ef013632c9a","translatedAt":"2026-07-23T00:24:39.792Z"},"ru":{"title":"OpenAI объявила о GPT-Red: внутренний автоматизированный красный командный модель победила участников человеческой красной команды с результатом 84% против 13% в тестах на внедрение подсказок","summary":"OpenAI обучила внутреннюю атакующую модель GPT-Red, которая с помощью стратегии обучения с подкреплением через самопротивостояние противостоит защите групп LLM. В воспроизведенном тесте косвенной инъекции подсказок, GPT-Red победила членов красной команды из числа людей с результатом 84% против 13%, выявив новый тип атаки «ложная цепочка рассуждений», и снизила вероятность неудачи GPT-5.6 Sol на самом сложном для прямых инъекций эталоне OpenAI в 6 раз. OpenAI признает, что модель по-прежнему испытывает трудности в многократных атаках и атаках на основе изображений.","category":"论文研究","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"OpenAI объявила о GPT-Red: внутренний автоматизированный красный командный модель победила участников человеческой красной команды с результатом 84% против 13% в тестах на внедрение подсказок - Aioga Новости ИИ","description":"OpenAI обучила внутреннюю атакующую модель GPT-Red, которая с помощью стратегии обучения с подкреплением через самопротивостояние противостоит защите групп LLM. В воспроизведенном...","url":"https://www.aioga.com/ru/news/cmrnw0hk501dabixya1ypjg7l/","contentTranslated":true,"sourceHash":"f5653ef013632c9a","translatedAt":"2026-07-23T00:24:45.671Z"},"ar":{"title":"أعلنت OpenAI عن GPT-Red: نموذج الفريق الأحمر الداخلي الآلي يتفوق على أعضاء الفريق الأحمر البشري بنسبة 84٪ مقابل 13٪ في اختبارات حقن المطالبات","summary":"لقد قامت OpenAI بتدريب نموذج هجوم داخلي يُدعى GPT-Red، من خلال التعلم المعزز الذاتي المعارض لمواجهة الدفاعات ضد جماعات LLM. في اختبارات حقن الإيحاءات غير المباشرة المستنسخة، تغلب GPT-Red على أعضاء الفريق الأحمر البشري بنسبة 84٪ مقابل 13٪، واكتشف نوعًا جديدًا من هجوم \"سلسلة التفكير الزائف\"، وخفض معدل فشل GPT-5.6 Sol في أشد اختبارات الحقن المباشر صعوبة لدى OpenAI بمقدار 6 أضعاف. وتعترف OpenAI أن هذا النموذج لا يزال يواجه صعوبات في الهجمات متعددة الجولات والمعتمدة على الصور.","category":"论文研究","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"أعلنت OpenAI عن GPT-Red: نموذج الفريق الأحمر الداخلي الآلي يتفوق على أعضاء الفريق الأحمر البشري بنسبة 84٪ مقابل 13٪ في اختبارات حقن المطالبات - Aioga أخبار الذكاء الاصطناعي","description":"لقد قامت OpenAI بتدريب نموذج هجوم داخلي يُدعى GPT-Red، من خلال التعلم المعزز الذاتي المعارض لمواجهة الدفاعات ضد جماعات LLM. في اختبارات حقن الإيحاءات غير المباشرة المستنسخة، تغلب G...","url":"https://www.aioga.com/ar/news/cmrnw0hk501dabixya1ypjg7l/","contentTranslated":true,"sourceHash":"f5653ef013632c9a","translatedAt":"2026-07-23T00:25:30.414Z"},"hi":{"title":"OpenAI ने GPT-Red की घोषणा की: आंतरिक स्वचालित रेड टीम मॉडल ने प्रॉम्प्ट इंजेक्शन टेस्ट में मानव रेड टीम सदस्यों को 84% के मुकाबले 13% पर हराया","summary":"OpenAI ने आंतरिक हमले वाला मॉडल GPT-Red प्रशिक्षित किया, जो आत्म-सहयोग सुदृढ़ीकरण सीखने के माध्यम से LLM समूह के रक्षात्मक प्रयासों का मुकाबला करता है। पुनरुत्पादित अप्रत्यक्ष संकेत इंजेक्शन परीक्षण में, GPT-Red ने मानव रेड टीम के सदस्यों को 84% बनाम 13% की दर से हरा दिया, और एक नए प्रकार की 'झूठी सोच श्रृंखला' हमले की श्रेणी की खोज की, तथा GPT-5.6 Sol की OpenAI के सबसे कठिन प्रत्यक्ष इंजेक्शन बेंचमार्क में विफलता दर को 6 गुना तक कम कर दिया। OpenAI ने यह स्वीकार किया कि मॉडल बहु-राउंड और छवि आधारित हमलों पर अभी भी कठिनाइयों का सामना कर रहा है।","category":"论文研究","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"OpenAI ने GPT-Red की घोषणा की: आंतरिक स्वचालित रेड टीम मॉडल ने प्रॉम्प्ट इंजेक्शन टेस्ट में मानव रेड टीम सदस्यों को 84% के मुकाबले 13% पर हराया - Aioga AI समाचार","description":"OpenAI ने आंतरिक हमले वाला मॉडल GPT-Red प्रशिक्षित किया, जो आत्म-सहयोग सुदृढ़ीकरण सीखने के माध्यम से LLM समूह के रक्षात्मक प्रयासों का मुकाबला करता है। पुनरुत्पादित अप्रत्यक्ष संके...","url":"https://www.aioga.com/hi/news/cmrnw0hk501dabixya1ypjg7l/","contentTranslated":true,"sourceHash":"f5653ef013632c9a","translatedAt":"2026-07-23T00:25:36.634Z"},"it":{"title":"OpenAI ha annunciato GPT-Red: il modello di red team automatizzato interno ha superato i membri umani del red team nei test di iniezione di prompt con un punteggio dell'84% contro il 13%","summary":"OpenAI ha addestrato un modello interno di attacco, GPT-Red, utilizzando l'auto-gioco e l'apprendimento per rinforzo per contrastare la difesa delle LLM. Nei test riprodotti di iniezione indiretta di prompt, GPT-Red ha sconfitto i membri del team umano di sicurezza con un punteggio dell'84% contro il 13%, scoprendo una nuova categoria di attacco 'catena di pensiero falsa', e ha ridotto di 6 volte il tasso di fallimento di GPT-5.6 Sol sul benchmark più difficile di iniezione diretta di OpenAI. OpenAI riconosce che il modello ha ancora difficoltà negli attacchi multi-turno e basati su immagini.","category":"论文研究","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"OpenAI ha annunciato GPT-Red: il modello di red team automatizzato interno ha superato i membri umani del red team nei test di iniezione di prompt con un punteggio dell'84% contro il 13% - Aioga Notizie IA","description":"OpenAI ha addestrato un modello interno di attacco, GPT-Red, utilizzando l'auto-gioco e l'apprendimento per rinforzo per contrastare la difesa delle LLM. Nei test riprodotti di ini...","url":"https://www.aioga.com/it/news/cmrnw0hk501dabixya1ypjg7l/","contentTranslated":true,"sourceHash":"f5653ef013632c9a","translatedAt":"2026-07-23T00:26:18.874Z"},"nl":{"title":"OpenAI kondigt GPT-Red aan: intern geautomatiseerd roodteammodel verslaat menselijke roodteamleden met 84% tegen 13% bij test van promptinjecties","summary":"OpenAI heeft een intern aanvalmodel GPT-Red getraind, dat door middel van zelftegenovergestelde versterkingsleren de defensie van LLM-groepen tegenspreekt. In gereproduceerde indirecte promptinvoertests versloeg GPT-Red menselijke redteammaatjes met 84% tegen 13%, ontdekte een nieuwe categorie van 'valse denkketens'-aanvallen, en verminderde het faalpercentage van GPT-5.6 Sol op OpenAI's moeilijkste directe injectiestandaard met een factor 6. OpenAI erkent dat dit model nog steeds moeite heeft met meertraps- en op afbeeldingen gebaseerde aanvallen.","category":"论文研究","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"OpenAI kondigt GPT-Red aan: intern geautomatiseerd roodteammodel verslaat menselijke roodteamleden met 84% tegen 13% bij test van promptinjecties - Aioga AI-nieuws","description":"OpenAI heeft een intern aanvalmodel GPT-Red getraind, dat door middel van zelftegenovergestelde versterkingsleren de defensie van LLM-groepen tegenspreekt. In gereproduceerde indir...","url":"https://www.aioga.com/nl/news/cmrnw0hk501dabixya1ypjg7l/","contentTranslated":true,"sourceHash":"f5653ef013632c9a","translatedAt":"2026-07-23T00:26:17.968Z"},"tr":{"title":"OpenAI, GPT-Red'i duyurdu: İç otomatik kırmızı takım modeli, prompt enjeksiyonu testlerinde insan kırmızı takım üyelerini %84'e %13 yeniyor","summary":"OpenAI, GPT-Red adlı dahili bir saldırı modeli eğitti ve kendi kendine oyun yoluyla pekiştirmeli öğrenme ile LLM topluluklarına karşı savunma yaptı. Yeniden üretilen dolaylı istem enjeksiyonu testlerinde, GPT-Red insan kırmızı takım üyelerini %84'e karşı %13 oranında yendi, yeni bir \"sahte düşünce zinciri\" saldırı türü keşfetti ve GPT-5.6 Sol'un OpenAI'nin en zor doğrudan enjeksiyon kıyaslamasında başarısızlık oranını 6 kat azalttı. OpenAI, modelin çok turlu ve görsel tabanlı saldırılarda hâlâ zorluk yaşadığını kabul ediyor.","category":"论文研究","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"OpenAI, GPT-Red'i duyurdu: İç otomatik kırmızı takım modeli, prompt enjeksiyonu testlerinde insan kırmızı takım üyelerini %84'e %13 yeniyor - Aioga AI Haberleri","description":"OpenAI, GPT-Red adlı dahili bir saldırı modeli eğitti ve kendi kendine oyun yoluyla pekiştirmeli öğrenme ile LLM topluluklarına karşı savunma yaptı. Yeniden üretilen dolaylı istem...","url":"https://www.aioga.com/tr/news/cmrnw0hk501dabixya1ypjg7l/","contentTranslated":true,"sourceHash":"f5653ef013632c9a","translatedAt":"2026-07-23T00:27:12.512Z"},"vi":{"title":"OpenAI công bố GPT-Red: Mô hình đội đỏ tự động nội bộ đánh bại thành viên đội đỏ con người trong thử nghiệm tiêm lệnh với tỷ lệ 84% so với 13%","summary":"OpenAI đã huấn luyện mô hình tấn công nội bộ GPT-Red, thông qua tự đối kháng trong học tăng cường để chống lại cộng đồng LLM. Trong các thử nghiệm tiêm gợi ý gián tiếp được tái hiện, GPT-Red đã đánh bại các thành viên đội đỏ của con người với tỷ lệ 84% so với 13%, phát hiện ra một loại tấn công mới gọi là “chuỗi tư duy giả” và giảm tỷ lệ thất bại của GPT-5.6 Sol trên chuẩn mực tiêm trực tiếp khó nhất của OpenAI xuống thấp hơn 6 lần. OpenAI thừa nhận rằng mô hình này vẫn gặp khó khăn trong các cuộc tấn công đa vòng và dựa trên hình ảnh.","category":"论文研究","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"OpenAI công bố GPT-Red: Mô hình đội đỏ tự động nội bộ đánh bại thành viên đội đỏ con người trong thử nghiệm tiêm lệnh với tỷ lệ 84% so với 13% - Tin tức AI Aioga","description":"OpenAI đã huấn luyện mô hình tấn công nội bộ GPT-Red, thông qua tự đối kháng trong học tăng cường để chống lại cộng đồng LLM. Trong các thử nghiệm tiêm gợi ý gián tiếp được tái hiệ...","url":"https://www.aioga.com/vi/news/cmrnw0hk501dabixya1ypjg7l/","contentTranslated":true,"sourceHash":"f5653ef013632c9a","translatedAt":"2026-07-23T00:27:02.917Z"},"id":{"title":"OpenAI Mengumumkan GPT-Red: Model Red Team Otomatis Internal Mengalahkan Anggota Red Team Manusia dalam Tes Injeksi Prompt dengan Skor 84% terhadap 13%","summary":"OpenAI melatih model serangan internal GPT-Red, menggunakan pembelajaran penguatan melalui permainan melawan diri sendiri untuk menentang pertahanan kelompok LLM. Dalam pengujian injeksi petunjuk tidak langsung yang direproduksi, GPT-Red mengalahkan anggota tim merah manusia dengan 84% melawan 13%, menemukan kategori serangan baru bernama \"rantai pemikiran palsu\", dan menurunkan tingkat kegagalan GPT-5.6 Sol di tolok ukur injeksi langsung tersulit OpenAI hingga 6 kali lipat. OpenAI mengakui bahwa model ini masih mengalami kesulitan dalam serangan multi-putaran dan berbasis gambar.","category":"论文研究","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"OpenAI Mengumumkan GPT-Red: Model Red Team Otomatis Internal Mengalahkan Anggota Red Team Manusia dalam Tes Injeksi Prompt dengan Skor 84% terhadap 13% - Berita AI Aioga","description":"OpenAI melatih model serangan internal GPT-Red, menggunakan pembelajaran penguatan melalui permainan melawan diri sendiri untuk menentang pertahanan kelompok LLM. Dalam pengujian i...","url":"https://www.aioga.com/id/news/cmrnw0hk501dabixya1ypjg7l/","contentTranslated":true,"sourceHash":"f5653ef013632c9a","translatedAt":"2026-07-23T00:27:51.764Z"},"th":{"title":"OpenAI ประกาศ GPT-Red: โมเดลทีมแดงอัตโนมัติภายในเอาชนะสมาชิกทีมแดงของมนุษย์ได้ 84% ต่อ 13% ในการทดสอบการฉีดข้อความคำสั่ง","summary":"OpenAI ได้ฝึกโมเดลโจมตีภายใน GPT-Red ผ่านการเรียนรู้แบบเสริมด้วยการเล่นเองเพื่อต่อกรกับกลุ่ม LLM ในการป้องกัน ในการทดสอบการฝังคำสั่งโดยอ้อมที่ทำซ้ำได้ GPT-Red ชนะสมาชิกทีมแดงมนุษย์ด้วยคะแนน 84% ต่อ 13% ค้นพบประเภทการโจมตี \"ห่วงโซ่ความคิดเท็จ\" ใหม่ และลดอัตราความล้มเหลวของ GPT-5.6 Sol ในมาตรฐานการฝังคำสั่งโดยตรงที่ยากที่สุดของ OpenAI ลง 6 เท่า OpenAI รับว่าโมเดลนี้ยังคงมีความยากลำบากในการโจมตีหลายรอบและโจมตีที่อิงกับภาพ","category":"论文研究","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"OpenAI ประกาศ GPT-Red: โมเดลทีมแดงอัตโนมัติภายในเอาชนะสมาชิกทีมแดงของมนุษย์ได้ 84% ต่อ 13% ในการทดสอบการฉีดข้อความคำสั่ง - ข่าว AI Aioga","description":"OpenAI ได้ฝึกโมเดลโจมตีภายใน GPT-Red ผ่านการเรียนรู้แบบเสริมด้วยการเล่นเองเพื่อต่อกรกับกลุ่ม LLM ในการป้องกัน ในการทดสอบการฝังคำสั่งโดยอ้อมที่ทำซ้ำได้ GPT-Red ชนะสมาชิกทีมแดงมนุษย์...","url":"https://www.aioga.com/th/news/cmrnw0hk501dabixya1ypjg7l/","contentTranslated":true,"sourceHash":"f5653ef013632c9a","translatedAt":"2026-07-23T00:28:01.490Z"},"pl":{"title":"OpenAI ogłosiło GPT-Red: wewnętrzny zautomatyzowany model czerwonego zespołu pokonał członków ludzkiego czerwonego zespołu w testach wstrzykiwania poleceń w stosunku 84% do 13%","summary":"OpenAI wytrenowało wewnętrzny model ataku GPT-Red, który poprzez uczenie się wzmocnione w grze przeciwko sobie wzmacniał obronę społeczności LLM. W powtórzonych testach pośredniego wstrzykiwania podpowiedzi, GPT-Red pokonał członków czerwonego zespołu ludzi w stosunku 84% do 13%, odkrywając nową kategorię ataku \"fałszywego łańcucha myślowego\" i zmniejszając wskaźnik niepowodzeń GPT-5.6 Sol w najtrudniejszym bezpośrednim benchmarku wstrzykiwania OpenAI sześciokrotnie. OpenAI przyznaje, że model wciąż ma trudności w przypadku ataków wieloetapowych i opartych na obrazach.","category":"论文研究","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"OpenAI ogłosiło GPT-Red: wewnętrzny zautomatyzowany model czerwonego zespołu pokonał członków ludzkiego czerwonego zespołu w testach wstrzykiwania poleceń w stosunku 84% do 13% - Aioga Wiadomości AI","description":"OpenAI wytrenowało wewnętrzny model ataku GPT-Red, który poprzez uczenie się wzmocnione w grze przeciwko sobie wzmacniał obronę społeczności LLM. W powtórzonych testach pośredniego...","url":"https://www.aioga.com/pl/news/cmrnw0hk501dabixya1ypjg7l/","contentTranslated":true,"sourceHash":"f5653ef013632c9a","translatedAt":"2026-07-23T00:28:51.946Z"}}}}