Aioga
AI资讯 / 模型更新
返回 AI资讯

Anthropic 发布 Claude Opus 5

Anthropic:Newsroom(网页)Aioga 编辑团队2026-07-23T16:00:00.000Z热度 92

Anthropic 发布 Claude Opus 5,其智能水平接近 Claude Fable 5,但价格减半。该模型在 Frontier-Bench v0.1 上性能超过 O...

模型更新Anthropic:Newsroom(网页)Simon Willison 博客

今日 AI 情报摘要

Anthropic 发布 Claude Opus 5,其智能水平接近 Claude Fable 5,但价格减半。

该模型在 Frontier-Bench v0.1 上性能超过 Opus 4.8 两倍以上,在 ARC-AGI 3 上得分是次优模型的三倍。 Opus 5 即日起成为 Claude Max 的默认模型和 Claude Pro 的最强模型。

中文正文 · AI 翻译

Claude Opus 5 今天可用。它是一个深思熟虑且主动的模型,其智能接近 Claude Fable 5 的前沿水平,但价格只有后者的一半。

Introducing Claude Opus 5

在编码和知识工作评估中,比如 Frontier-Bench:https://www.frontierbench.ai/ 和 GDPval-AA:https://artificialanalysis.ai/evaluations/gdpval-aa,Opus 5 是新的最先进模型,尽管在网络安全任务上仍落后于 Mythos 5。

Opus 5 设计为日常使用:它的效率比其他模型更高。它是 Claude Max 的新默认模型,也是 Claude Pro 上最强的模型。

Anthropic 发布 Claude Opus 5

Claude Opus 5 在与其前身 Opus 4.8 相同的成本下提供了大幅提升的性能。本节中的图表显示了根据模型的努力设置性能如何变化,客户可以使用这些设置优化智能或节省代币以获得更快、更便宜的结果。

Opus 5 在有价值的软件工程任务中表现出色。例如,在 Frontier-Bench v0.1 上,Opus 5 超过了所有其他模型,同时在每个任务成本更低的情况下,其性能是 Opus 4.8 的两倍以上。在 CursorBench 3.2 上,在最大努力模式下,该模型的表现与 Fable 5 的峰值分数相差不到 0.5%,但每个任务的成本只有一半;此外,在高、极高和最大努力下,它在给定成本下的表现优于所有其他模型。

Anthropic 发布 Claude Opus 5
Anthropic 发布 Claude Opus 5
Anthropic 发布 Claude Opus 5

我们在知识工作和问题解决任务中也看到类似的结果。例如:

它在几个相关评估中也是我们最优且最具成本效益的模型:

Anthropic 发布 Claude Opus 5

Opus 5 在科学研究方面相比 Opus 4.8 有显著提升。在我们所有的生命科学评估中,Opus 5 的表现都优于 Opus 4.8,这些评估涵盖了结构生物学、有机化学和生物信息学等主题。其改进在有机化学任务上尤为明显,例如从光谱数据推断分子结构(在我们内部基准测试中,它比 Opus 4.8 高出 10.2 个百分点),以及蛋白质相关任务,如预测蛋白质序列变化如何影响功能(在此项中,它高出 7.7 个百分点)。

最后,Opus 5 能够生成更强大的视觉输出:

Claude Opus 5 在验证其工作和仔细迭代直到成功方面要强得多。在评估和早期访问测试中,我们和用户发现了许多 Opus 5 展现出的主动性和彻底性的例子:

以下是我们早期访问客户在使用 Opus 5 时的进一步报告:

一致性。在部署前测试中,我们的自动行为审计发现 Opus 5 是迄今为止我们最符合标准的模型(如下图所示)。它遵循 Claude 宪法:https://www.anthropic.com/constitution,比 Opus 4.8、Sonnet 5 或 Fable 5 更好;表现出最低的欺骗行为率;并且最不容易被误导用于不当用途。在避免可能产生难以逆转副作用的鲁莽行为方面,它同样是我们迄今为止最安全的模型。

安全性。Opus 5 并未在风险性“双用途”能力方面推进前沿。在与私营部门和政府合作伙伴一起进行的严格评估中,我们发现它在生物学研究和进攻性网络安全方面仍落后于 Mythos 5。有关这些评估的更多信息,请参阅我们的系统卡:https://www.anthropic.com/claude-opus-5-system-card。

与其前身 Opus 4.8 一样,我们有意避免将 Opus 5 训练用于网络任务。然而,由于模型变得更通用,它在这些任务上的表现仍有显著提升,并且在寻找网络安全漏洞方面接近 Mythos 5。然而,在漏洞利用方面——即将漏洞转化为实质性网络威胁——它仍明显落后于 Mythos 5。

这一点可从 Opus 5 在 OSS-Fuzz 上的表现看出,这是我们开发的一项评估,用于评估模型在无需大量人工指导的情况下发现并利用漏洞的能力。尽管 Mythos 5 和 Opus 5 在识别漏洞上成功率相似,但 Opus 5 在开发漏洞利用方案方面的得分远远落后于 Mythos 5。

Claude Opus 5 的安全保护措施旨在允许模型在网络安全和生物学中进行有益的使用。它们与我们应用于 Opus 4.8 的措施相似,只是在某些有限的网络任务上设定了更强的防护栏。

网络安全。Opus 5 的网络分类器相较于 Fable 5 更加宽松。它们允许 Opus 5 查找源代码中的漏洞,但会阻止“基于二进制”的漏洞扫描(一种更可能与恶意行为者相关的方法)、渗透测试和漏洞利用生成。

根据我们的测试,我们预计这些分类器介入的频率比在 Fable 5 上低约 85%。在 Claude.ai:http://claude.ai/redirect/website.v1.66aba3b9-1d35-4b13-8282-dd904dd7310f、Claude Code 和 Claude Cowork 中,任何被标记的请求将默认回退到 Opus 4.8。API 上也可以启用回退到 Opus 4.8 的功能。

我们的网络验证计划(CVP):https://support.claude.com/en/articles/14604842-real-time-cyber-safeguards-on-claude-opus-and-sonnet,使那些原本会被模型安全措施阻碍的网络安全工作得以进行。已经加入 CVP 的企业和研究人员可以立即访问安全限制更少的 Opus 5 版本。

生物学。由于 Opus 5 拥有与 Opus 4.8 类似的一系列安全防护,因此它现在是我们在科学研究方面最强大的通用可用模型。不过,该模型在长时间运行的自主研究任务中仍显示出重要的局限性,这些任务正是我们预计 AI 模型在生物学相关风险中可能产生最大影响的领域。(Mythos 5 在这类生物学工作中仍然是更强的模型。)作为此次发布的一部分,在 Fable 5 上被阻止的生物学相关请求现在将路由到 Opus 5,而不是 Opus 4.8。

Claude Opus 5 今天已在所有平台上可用,价格为每百万输入令牌 5 美元,每百万输出令牌 25 美元(与 Opus 4.8 相同)。开发者可以通过 Claude API 开始使用 claude-opus-5。

它还提供快速模式,其运行速度约为默认速度的 2.5 倍。与 Opus 4.8 一样,快速模式在 Claude 平台和通过 Claude Code 的使用信用中,价格是 Opus 5 基础价格的两倍。

除了 Opus 5,我们还发布了两个处于测试阶段的更新:

与之前的 Opus 模型一致,Opus 5 在一般访问中没有数据保留要求。

有关如何最大限度地利用 Opus 5 的更多指导,请参阅我们的提示指南:https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-opus-5。

Frontier-Bench v0.1,努力图:这些结果来自 Frontier-Bench v0.1 的内部运行,使用 mini-SWE-agent 测试器和 GKE 后端,每个任务平均尝试 5 次的平均奖励。Opus 4.8 在 Opus 5 和 Fable 5 的安全分类器拒绝时用作备用。

我们正在分享 Anthropic 经济未来研究基金的研究议程。

我们正在为 Claude 推出 Anthropic 经济指数连接器,它让任何人都可以探索关于 AI 和工作的真实数据。

Anthropic 正在向 Public First Action 额外捐赠 2000 万美元,使我们的总支持资金达到 4000 万美元。

情报判断

Aioga 编辑摘要

Anthropic 发布 Claude Opus 5,称其智能水平接近 Claude Fable 5,而价格为后者一半。该模型已成为 Claude Max 默认模型,并被定位为 Claude Pro 当前最强模型。

背景分析

官方材料将 Opus 5 与前代 Opus 4.8、Fable 5 等模型进行比较,并展示其在编程、知识工作和生命科学评测中的表现;用户还可通过 effort 设置权衡智能水平、速度与令牌消耗。

Aioga 观点

Aioga 判断,Opus 5 的核心定位不是单纯追求最高能力,而是在接近前沿智能的同时强调成本效率。不过,现有成绩主要来自官方列举的评测,实际任务中的稳定性仍值得关注。

影响与后续

对 Claude Max 和 Claude Pro 用户而言,默认模型与最强模型的调整可能直接改变日常使用选择。对开发者而言,按 effort 设置优化成本与性能,可能成为采用 Opus 5 时的重要考量。 后续值得关注 Opus 5 在 Frontier-Bench、GDPval-AA、CursorBench 及生命科学任务中的外部复核结果,同时观察其在网络安全任务上落后 Mythos 5 的差距是否缩小。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: anthropic.com

来源: Anthropic:Newsroom(网页)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-23T16:00:00.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Anthropic 发布 Claude Opus 5,其智能水平接近 Claude Fable 5,但价格减半。该模型在 Frontier-Bench v0.1 上性能超过 O...

Anthropic:Newsroom(网页)2026-07-23T16:00:00.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。