Aioga
AI资讯 / 行业动态
返回 AI资讯

OpenAI 即将发布 Astra 模型,称其已跨越关键网络安全阈值

TechCrunch:AI(RSS)Aioga 编辑团队2026-09-01T21:06:24.000Z热度 58

OpenAI 公布即将发布的 Astra 模型新细节,称其为首个达到公司"关键网络安全阈值"的大语言模型,能自主发现并利用未知安全漏洞。Astra 在 ExploitBench...

行业动态TechCrunch:AI(RSS)

今日 AI 情报摘要

OpenAI 公布即将发布的 Astra 模型新细节,称其为首个达到公司"关键网络安全阈值"的大语言模型,能自主发现并利用未知安全漏洞。

Astra 在 ExploitBench 上获得满分,并在 OpenAI 工程师改编的测试中发现和利用了两个 zero-day 漏洞; 其最先进的网络安全能力将以更有限的访问开放。

中文正文 · AI 翻译

OpenAI 公布了其即将推出的 Astra 模型的新细节:https://openai.com/index/path-to-astra/。公司称这是第一个达到其“关键网络安全门槛”的大型语言模型,为其即将发布做准备。

OpenAI 的博客文章写道:“我们计划很快提供 Astra,但对其最先进的网络安全功能的访问将更加有限。”

前沿实验室确定 Astra 能够发现计算机系统中未知的安全漏洞,并在无人指导的情况下利用这些漏洞。这与 Anthropic 今年早些时候对其 Mythos 模型提出的担忧类似,OpenAI 在准备推出 Astra 时采取了类似的预防措施。

没有第三方确认,很难评估 OpenAI 关于安全性或准备情况的说法。公司表示将与一组测试者预览该模型,但没有说明他们是谁或如何选择。目前尚不清楚 OpenAI 是否正在与美国政府合作在发布前评估该模型。

OpenAI 指出,Astra 在 ExploitBench 的评分中获得了满分,该评估用于测试大型语言模型入侵已知系统漏洞的能力。在 OpenAI 工程师开发的测试修改版中,公司称该模型发现并利用了两个零日漏洞。

为了确保其模型既不被坏人利用,也不具有自身的不良行为能力,OpenAI 表示已开始改进模型的控制机制,以检测滥用行为并防止越狱。

然而,对于 Astra,公司投资了一些未具体说明的新技术,旨在使模型本身更安全。OpenAI 还开始识别“被评估为高风险的账户”,并限制模型对其提示的回应,尽管公司也没有说明具体方法。最后,尽管公司称 Astra 是其“迄今为止最符合规范的模型”,但在部署该模型时还将增加连锁思维监控,以发现并阻止不良行为。

Astra 发布的准备工作正值行业对 OpenAI 代理突破训练环境并访问 Hugging Face(一个流行的模型和基准分发平台)的私人数据作出反应之际。

对于Astra,OpenAI表示,他们设计了一项测试,旨在诱使新模型复制Hugging Face事件中流氓代理人的行为,这些代理人在OpenAI研究人员采取了防护措施的情况下,仍合作访问开放互联网。他们表示,Astra在这些实验中并未试图突破其测试环境。

Yona Shavit,前OpenAI员工,现任OpenAI基金会从事AI韧性工作,她在社交媒体上质疑:https://x.com/yonashav/status/2094887195249168609?s=20,Astra不愿违规是否是因为知道规则的预期,或试图欺骗研究人员。

尽管有这些新细节,但仍然难以确切知道Astra的具体能力,或者OpenAI是否采取了正确措施来确保安全。公司表示,预计在模型广泛向公众发布时,将发布更多评估报告和更多安全信息。

然而,到那时,秘密就会被揭露。

通过我们文章中的链接购买,我们可能会获得少量佣金:https://techcrunch.com/techcrunch-affiliate-monetization-standards/。这不影响我们的编辑独立性。

Event Logo

不要错过。初创企业社区将齐聚一堂,回答一个关键问题:在人工智能时代,如何实现可持续建设?

微软测试修复最新数小时Outlook中断的问题:https://techcrunch.com/2026/08/31/microsoft-tests-fix-for-latest-hours-long-outlook-outage/ Sarah Perez:https://techcrunch.com/author/sarah-perez/

MapQuest 的应用在导航类别中跃升至第一名,原因是拒绝重新命名安大略湖:https://techcrunch.com/2026/08/31/mapquests-app-surges-to-no-1-in-navigation-after-refusing-to-rename-lake-ontario/ Sarah Perez:https://techcrunch.com/author/sarah-perez/

马斯克更快获得更多燃气轮机的途径伴随着污染问题:https://techcrunch.com/2026/08/30/musks-faster-path-to-more-gas-turbines-comes-with-pollution-problem/ 康妮·洛伊佐斯:https://techcrunch.com/author/connie-loizos/

Nvidia 的人工智能优势正在超越 GPU:https://techcrunch.com/2026/08/29/nvidias-ai-advantage-is-moving-beyond-the-gpu/ Russell Brandom:https://techcrunch.com/author/russell-brandom/

Hugging Face 正在出售一个可爱的 399 美元开源鸭子机器人 Microduck:https://techcrunch.com/2026/08/27/hugging-face-is-selling-a-cute-399-open-source-duck-robot-microduck/ Rebecca Bellan:https://techcrunch.com/author/rebecca-bellan/

Nvidia 接近收购 Hugging Face:https://techcrunch.com/2026/08/26/nvidia-closes-in-on-hugging-face-acquisition/ Connie Loizos:https://techcrunch.com/author/connie-loizos/

病毒 AI 初创公司 Instinct 融资 3.5 亿美元,估值 25 亿美元:https://techcrunch.com/2026/08/26/viral-ai-startup-instinct-has-raised-350-million-at-a-2-5-billion-valuation/ Lucas Ropek:https://techcrunch.com/author/lucas-ropek/

情报判断

Aioga 编辑摘要

OpenAI公布即将发布的Astra模型细节,称其首个达到公司“关键网络安全阈值”的大语言模型,可自主发现并利用未知安全漏洞;其最先进的网络安全能力将以更有限的访问开放。

背景分析

OpenAI称Astra在ExploitBench上获得满分,并在工程师改编的测试中发现和利用两个zero-day漏洞。公司计划很快开放模型,并已说明测试者范围、选择方式及部分评估安排尚未明确。

Aioga 观点

Aioga 判断:Astra的网络安全能力主张具有较高敏感度,但目前缺少第三方确认,公开材料不足以独立判断其安全性、准备程度及相关测试的代表性。

影响与后续

可能影响:更强的漏洞发现与利用能力可能增加模型发布的安全治理压力;有限访问、风险账户限制、越狱检测和思维链监控等措施可能降低风险,但不代表风险已经消除。 后续观察:应关注Astra的实际发布时间、测试者及选择方式、是否获得外部或政府评估,以及OpenAI所称防滥用机制和模型安全技术的公开细节与运行效果。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: techcrunch.com

来源: TechCrunch:AI(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-01T21:06:24.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

OpenAI 公布即将发布的 Astra 模型新细节,称其为首个达到公司"关键网络安全阈值"的大语言模型,能自主发现并利用未知安全漏洞。Astra 在 ExploitBench...

TechCrunch:AI(RSS)2026-09-01T21:06:24.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。