Aioga
AI资讯 / 行业动态
返回 AI资讯

OpenAI Astra 发布在即,研究人员担忧其架构更难监控

The Verge:AI(RSS)Aioga 编辑团队2026-09-02T16:40:50.000Z热度 58

OpenAI 推迟发布最强模型 Astra 以加强安全协议,The Information 报道称 Astra 可能采用更不透明的 recurrent depth / loop...

行业动态The Verge:AI(RSS)

今日 AI 情报摘要

OpenAI 推迟发布最强模型 Astra 以加强安全协议,The Information 报道称 Astra 可能采用更不透明的 recurrent depth / looped

transformer 技术,内部思考更难监测。

中文正文 · AI 翻译

OpenAI 正准备发布其迄今为止最强大的 AI 模型 Astra,此前经历了数周的延迟:/ai-artificial-intelligence/987695/openai-astra-unreleased-model-cybersecurity-delay,以加强安全协议:/ai-artificial-intelligence/972380/open-ai-hugging-face-hack-ai-safety-warning,因为其代理在测试期间攻击了真实目标:/ai-artificial-intelligence/987566/ai-civilizations-opeai-hugging-face-hack。随着关于该模型的细节逐渐披露,研究人员警告称:https://x.com/RyanGreenblatt/status/2094996656186081642?s=20 它“可能是迄今为止对 AI 安全/安全性影响最严重的发展。”

就在 OpenAI 周二表示:/ai-artificial-intelligence/987695/openai-astra-unreleased-model-cybersecurity-delay 因安全问题而推迟 Astra 的发布时间后,The Information 报道称:https://www.theinformation.com/articles/secret-technique-behind-openais-astra-model-sparks-security-concerns Astra 显示的“思考”远不如其他前沿 AI 模型,这引发了它可能难以监控的担忧。

如今大多数顶级 AI 系统都是使用一种称为 Transformer 的技术构建的,它通过层线性处理某些类型的信息,然后生成答案。模型可以在处理过程中展示其推理过程,本质上就是“边思考边表达”。这种“思维链”允许研究人员和自动化安全系统监控 AI 模型正在做什么,并可能在它们采取行动之前发现不良行为,例如撒谎或规避安全防护措施的计划。

根据 The Information 引述一位不愿透露姓名的熟悉未发布模型开发的人士称,Astra 使用了一种更不透明的技术,称为递归深度或循环 Transformer,它在输出结果之前循环处理信息内部层。这意味着模型的大部分“思考”发生在系统内部,而其形式看起来远不如自然人类语言,研究人员也难以轻易监控。虽然这可以提升模型性能,但也让潜在威胁和不良行为更难被发现。

据《The Information》匿名消息人士透露,OpenAI已限制其在Astra上使用环形变换器/循环深度技术,以便研究人员能够继续监测模型的推理。

在周二发布的一篇博客文章:https://openai.com/index/path-to-astra/ 中,OpenAI表示它正在“部署Astra,并配备额外的思维链监控,以快速检测并控制可能错位的行为。”但未提及该模型是否有不同的技术基础。

The Information的报告在社交媒体上引发了人工智能安全研究人员的广泛关注。Redwood Research的首席科学家Ryan Greenblatt是OpenAI允许研究的三位外部人士之一:https://metr.org/hugging-face-incident-report-aug-2026.pdf Hugging Face 黑客事件,他表示:https://x.com/RyanGreenblatt/status/2094996656186081642?s=20 决定为Astra使用更不透明的架构“可能是迄今为止AI安全领域最糟糕的发展”。

格林布拉特表示,对“拥抱脸”事件的调查很大程度上依赖模型的思维链,警告说,较不显眼的推理可能让人工智能系统设计和执行更难被研究人员发现的策略。

Greenblatt的主要担忧,正如其他安全专家所呼应的:https://x.com/_NathanCalvin/status/2094957301564092914?s=20,其他:https://x.com/sjgadler/status/2094959837691908214?s=20,是对更先进AI系统的竞争可能导致“在架构上竞相淘汰,这可能对我们监管和监控AI的能力造成灾难性”——开发者采用越来越不透明的系统以获得优势,直到模型变得难以监控甚至无法。他补充说,OpenAI的沟通让他担心公司“计划极度依赖思维链式监控来保障安全”。

OpenAI 高管在一系列社交媒体帖子中回应了批评,这些帖子没有明确否认公司使用该技术。几位高管表达了对可能出现无法监控的人工智能或透明度竞争的担忧,包括 OpenAI 安全研究员 Micah Carroll:https://x.com/MicahCarroll/status/2095023282051563835?s=20 和 Tomek Korbak:https://x.com/tomekkorbak/status/2095031132781961346?s=20,战略未来负责人 Dean Ball:https://x.com/deanwball/status/2095121884991922223?s=20,以及首席科学家 Jakub Pachocki:https://x.com/merettm/status/2095023204993490967?s=20,他们对“由于混乱报道引发的不可监控竞赛”表示担忧。他表示,Astra 的计算深度——衡量其内部可以执行多少步骤——“与 GPT-4 相差不超过两倍”,这表明如果采用了该技术,透明度下降的程度并不像某些反应所暗示的那么显著。OpenAI 没有回应 The Verge 关于确认或否认 Astra 是否使用了循环变换器的请求,而是将我们引导至 Pachocki 的 X 帖子:https://x.com/merettm/status/2095023204993490967?s=20。

“自我们最早的推理模型以来,OpenAI 就致力于保留和利用链式思维监控,”Pachocki 写道,并补充说这种监控“是脆弱的,不幸的是正朝着负面的方向发展,这是由于一些与架构变化无关的原因,我将很快写出来。”

Robert Hart

情报判断

Aioga 编辑摘要

据《The Verge》援引《The Information》报道,OpenAI 推迟 Astra 发布以加强安全协议。报道称,该模型可能采用 recurrent depth 或 looped transformer,使更多内部处理不易被监测。

背景分析

材料称,链式思维可帮助研究人员和自动化安全系统观察模型行为。匿名知情人士称,Astra 使用更不透明的循环式技术;OpenAI 则表示将部署额外的链式思维监测,以发现并控制潜在失配行为。

Aioga 观点

Aioga 判断:当前争议核心不是 Astra 是否采用某一架构已获官方确认,而是报道所述的可观测性变化。OpenAI 的公开说明提到监测措施,但未说明模型的技术基础。

影响与后续

可能影响:若报道中的架构描述属实,研究人员可能更难依靠可见推理识别不当行为;额外链式思维监测可能提供补充,但现有材料不足以判断其覆盖范围或实际效果。 后续观察:需要核对 OpenAI 后续公开材料是否说明 Astra 的技术基础、监测方式及发布状态,并关注安全研究者对可观测性和测试结果的进一步披露。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: theverge.com

来源: The Verge:AI(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-02T16:40:50.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

OpenAI 推迟发布最强模型 Astra 以加强安全协议,The Information 报道称 Astra 可能采用更不透明的 recurrent depth / loop...

The Verge:AI(RSS)2026-09-02T16:40:50.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。