Aioga
AI资讯 / 行业动态
返回 AI资讯

GPT-6 Astra 幻觉更少但仍易受隐藏提示词注入攻击

The Decoder:AI News(RSS)Aioga 编辑团队2026-09-04T17:23:35.000Z热度 72

The Decoder 报道,OpenAI 新模型 GPT-6 Astra 幻觉少于前代 GPT-5.6 Sol,直接提示词注入防御率达 99.99%,但多轮自适应攻击下防御率...

行业动态The Decoder:AI News(RSS)

今日 AI 情报摘要

The Decoder 报道,OpenAI 新模型 GPT-6 Astra 幻觉少于前代 GPT-5.6 Sol,直接提示词注入防御率达 99.99%,但多轮自适应攻击下防御率降至约 67%。

中文正文 · AI 翻译

OpenAI的新模型GPT-6 Astra比其前代产品产生的虚假信息更少,并且能够更有效地阻止提示注入攻击。但它仍然不足以用于真正安全的AI代理部署。

根据OpenAI的系统卡:https://deploymentsafety.openai.com/gpt-6-astra/,新的Astra模型:https://the-decoder.com/benchmarks-disagree-on-gpt-6-astra-but-its-human-beating-efficiency-on-arc-agi-3-pulls-chollets-agi-forecast-forward/比其前代模型GPT-5.6 Sol犯的事实性错误要少得多。OpenAI将其测试对象设定为用户标记出错误答案的ChatGPT对话,这意味着这些案例特别容易出错,其失败率不应被视为日常使用的典型情况。Astra重现这些报告错误的频率明显下降,最大改进出现在低延迟设置和较低推理水平下。

GPT-6 Astra 幻觉更少但仍易受隐藏提示词注入攻击

对于直接提示注入,即用户试图通过自己的提示操控模型,Astra的防御率接近完美,达到99.99%。OpenAI将此归功于其GPT-Red方法:https://the-decoder.com/openai-is-now-using-ai-to-attack-its-own-ai-and-its-working-better-than-humans-ever-did/,该方法使用自动化攻击者在训练过程中强化模型。Ad

防越狱能力表现类似。在尝试提取有关生物学、暴力和网络安全的有害响应的已知攻击固定数据集上,Astra在91.5%到98.3%的案例中拒绝提供帮助。Ad

当攻击者在多轮对话中调整策略时,Astra的防御率下降到约67%,这意味着持续的对手大约每三次尝试中就能诱导出一次有问题的响应。同样的测试中,前代模型的得分刚低于50%。OpenAI指出,这些测试是在裸模型上进行的,没有使用实际产品中附带的分类器等生产安全层。

Astra在间接提示注入方面取得进展,这种攻击被隐藏在AI读取的文档中。安全公司Gray Swan的外部测试中,使用他们的IPI Arena收集的1,810个攻击案例:https://arxiv.org/abs/2603.15714,发现在每种场景尝试15次时,Astra至少有一次被攻破的概率为8.5%。GPT-5.6 Sol的失败率为27%。Claude Opus 5在同一评估中表现更好,失败率为4.8%,但也并非完全免疫。广告

GPT-6 Astra 幻觉更少但仍易受隐藏提示词注入攻击

Gray Swan结合Q1和Q2的测试数据显示,数字实际上比早期结果还要高。Anthropic之前仅基于较简单的Q1测试报告了2%的攻击成功率:https://the-decoder.com/opus-5-may-have-solved-browser-based-prompt-injection-the-biggest-security-flaw-haunting-ai-agents/,而GPT-5.6 Sol在那里的得分也只有20%。Anthropic还在所有模型上启用了扩展推理功能,这与更广泛的测试范围一起,可能解释了差距。

即使这些攻击是经过策划和人工挑选的,其成功率也应让任何企业安全团队感到担忧。Astra在大约每十二个场景中就可能被注入指令欺骗一次。Opus 5表现更好,但仍大约有每二十一次失败一次的情况。而且风险还在增长。AI代理正越来越多地编写代码、操作工具并独立控制计算机,这也是Gray Swan所测试的内容。这些代理还被设计为全天候、大规模运行,将读取和处理文档作为核心工作之一。广告

保持对人工智能的了解。清晰、有用,无废话。

关注The Decoder获取AI新闻、背景故事和专家分析。

解码器:https://the-decoder.com/

情报判断

Aioga 编辑摘要

The Decoder 报道称,OpenAI 的 GPT-6 Astra 在被用户标记为错误回答的 ChatGPT 对话测试中,比 GPT-5.6 Sol 更少复现事实错误。其对直接提示词注入的防御率为 99.99%,但在多轮自适应攻击测试中约降至 67%。

背景分析

来源称,这些幻觉测试选取的是用户曾标记为错误的对话,因此失败率不应视为日常使用的典型水平。安全公司 Gray Swan 以 1,810 个精选间接提示词注入攻击测试,在每个场景尝试 15 次时,Astra 至少一次被攻破的比例为 8.5%。

Aioga 观点

Aioga 判断:Astra 在来源披露的错误复现、直接注入和间接注入测试中均显示出相较 GPT-5.6 Sol 的改进,但多轮自适应攻击与间接注入结果表明,其安全表现仍不足以单独证明智能体部署已具备可靠的安全性。

影响与后续

可能影响:计划让模型读取文档、调用工具或操作计算机的使用方,可能需要继续保留产品级安全层与多轮攻击评估。来源中的测试为特定错误对话和精选攻击集,结果不代表所有真实场景,也不足以推导实际部署中的总体风险。 后续观察:可关注 OpenAI 是否披露更多覆盖真实部署条件的测试,以及其生产环境安全层在多轮自适应和间接提示词注入情境下的表现。也值得关注不同测试范围、尝试次数与推理设置对结果可比性的影响。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: the-decoder.com

来源: The Decoder:AI News(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-04T17:23:35.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

The Decoder 报道,OpenAI 新模型 GPT-6 Astra 幻觉少于前代 GPT-5.6 Sol,直接提示词注入防御率达 99.99%,但多轮自适应攻击下防御率...

The Decoder:AI News(RSS)2026-09-04T17:23:35.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。