Aioga
AI资讯 / 模型更新
返回 AI资讯

Anthropic 发布 Claude Opus 5:前沿级智能体编程与计算机使用能力,Opus 定价不变

MarkTechPost(RSS)Aioga 编辑团队2026-07-24T21:50:46.000Z热度 58

Anthropic 推出 Claude Opus 5,取代 Opus 4.8 成为 Opus 系列旗舰模型。定价维持不变,输入每百万 token 5 美元、输出每百万 toke...

模型更新MarkTechPost(RSS)

今日 AI 情报摘要

Anthropic 推出 Claude Opus 5,取代 Opus 4.8 成为 Opus 系列旗舰模型。

定价维持不变,输入每百万 token 5 美元、输出每百万 token 25 美元。 Anthropic 称 Opus 5 的智能水平接近 Claude Fable 5,但价格仅为后者一半。

中文正文 · AI 翻译

今天,Anthropic 发布了 Claude Opus 5:https://www.anthropic.com/news/claude-opus-5。它取代了 Claude Opus 4.8,成为 Opus 级旗舰。定价维持不变:每百万输入令牌 5 美元,每百万输出令牌 25 美元。

Anthropic 团队将 Opus 5 定位为以一半价格接近 Claude Fable 5 的智能水平。它现在是 Claude Max 的默认模型,也是 Claude Pro 上最强的模型。

在进行任何基准测试前,三个变化非常重要:

模型 ID 为 claude-opus-5。上下文为 100 万令牌,既是默认值也是最大值,没有更小的版本。在同步 Messages API 上最大输出为 128k 令牌。Message Batches API 在 output-300k-2026-03-24 测试版标题下可达到 300k 令牌。可缓存的最小提示从 1024 令牌降至 512 令牌。

在 FrontierBench v0.1:https://www.frontierbench.ai/ 上,一个 74 任务的 Terminal-Bench 2.1 继任者,Opus 5 在最大努力下得分为 43.3%。Opus 4.8 得分为 18.7%。Fable 5 达到 33.7%,GPT-5.6 Sol 达到 37.5%。在 xhigh 努力下,Opus 5 达到 44.4% 的平均奖励,这是它的最佳成绩。

该运行中的一个细节值得注意。Opus 5 的安全分类器标记并拒绝了 5% 的 API 调用,占 4% 的试验。Fable 5 的分类器标记了 42% 的调用,占 26% 的试验。

Opus 5 在 SWE-bench Verified 上得分 96.0%,在 SWE-bench Pro 上得分 79.2%:https://arxiv.org/abs/2509.16941。Fable 5 在 Pro 上仍略胜一筹,为 80.0%。在 SWE-bench Multimodal 上提升更大,从 38.4% 提升到 59.4%。

自主代理的数字是最明显的胜利。Opus 5 在 OSWorld 2.0:https://arxiv.org/abs/2606.29537 上达到 70.57%,而 Opus 4.8 为 55.7%。在 Zapier AutomationBench:https://arxiv.org/abs/2604.18934 上,它得分 26.0%,而 Opus 4.8 为 17.0%,Fable 5 为 17.4%。在中等努力下,它仍以每任务 0.89 美元得分 24%。

在 Artificial Analysis GDPval-AA v2:https://artificialanalysis.ai/evaluations/gdpval-aa 上,Opus 5 占据排行榜前两名,ELO 分别为 1861 和 1827。xhigh 设置击败了所有其他模型,同时使用的输出令牌比最大值少 25%。

Anthropic 在没有工具或代理辅助的情况下,让 Opus 5 对 IMO 2026 的全部六个问题进行了提示。一个由三名模型组成的评审小组对生成的 24 个解答全部评分为正确。人类专家独立对每个问题的一个预先指定解答评分为 7/7。最终的 42/42 是金牌水平,高于 29/42 的及格线。

ARC 奖基金会报告称,在高强度努力下,Opus 5 在 ARC-AGI-3 测试中的验证分数为 30.16%。这大约是此前排行榜上最好成绩的四倍。GPT-5.6 Sol 的成绩为 7.78%,Opus 4.8 的成绩为 1.52%。Opus 5 在最大努力下的成绩在发布时尚不可用。

在人类的最后考试中:https://arxiv.org/abs/2501.14249,Opus 5 在没有工具的情况下得分为 56.3%,使用工具后得分为 64.7%。

多模态部分带来了一个实际的教训。代理工具的使用比单纯的适应性思考更具成本效益地扩展了测试时的计算能力。

在 Chartography 上,Opus 5 无工具得分为 29.6%,使用一个容器和图像裁剪工具得分为 83.0%。在 BenchCAD:https://arxiv.org/abs/2605.10865 Vision2Code 上,体素 IoU 从 0.366 升至 0.821。使用工具后,这一成绩远超 Claude Mythos 5 的 0.678。

Anthropic 并未让 Opus 5 参与网络安全任务训练。然而,该能力依然提升,作为通用能力提升的副产品。

在 ExploitBench:https://arxiv.org/abs/2605.14153 上,Opus 5 在 AutoNudge 模块捕获了平均 10.14 个能力标志。它生成了 99 个完整任意代码执行漏洞。Mythos 5 生成了 132 个。在 OSS-Fuzz 上,Opus 5 对 79.4% 的目标得分非零。Mythos 5 大约达到 80%。但 Opus 5 完成了 4 个完整漏洞,而 Mythos 5 完成 13 个。

这种差距定义了安全保护设计。Opus 5 在发现漏洞方面几乎和 Mythos 5 一样强,但在利用漏洞方面明显落后。因此,Anthropic 在源代码漏洞发现方面解锁了,但基于二进制的扫描、渗透测试和漏洞生成依然被阻止。预期分类器介入的频率比 Fable 5 少约 85%。防御者可以申请网络验证计划:https://support.claude.com/en/articles/14604842-real-time-cyber-safeguards-on-claude-opus-and-sonnet。

英国AISI在三个网络演练场上对早期检查点进行了测试,每次尝试处理1亿个令牌。Opus 5在10次尝试中,有8次端到端解决了《最后一批》。它未能解决更高难度的《终身监禁》演练。它达到了第23步中的第22步,比任何测试过的模型都更进一步。

根据RSP,Anthropic将Opus 5视为具有CB-1能力,但不具备CB-2能力。它采用了用于Opus 4.8的相同ASL-3保护措施。AI研发门槛未被突破。

在Gray Swan间接提示注入基准测试中,攻击者在15次尝试内的成功率从Opus 4.8的5.5%降至2.0%。Mythos 5的成功率为2.6%,而GPT-5.6 Sol为20.0%。

在通过Claude Cowork运行的浏览器环境中,攻击成功率从Opus 4.8的31.5%降至3.70%。该数据是在未应用任何安全措施的情况下统计的。启用自动模式后,在所有129个环境中达到0%的成功率。

来源:Anthropic发布文章:https://www.anthropic.com/news/claude-opus-5, Claude Opus 5系统卡:https://www.anthropic.com/claude-opus-5-system-card, Claude Opus 5新特性:https://platform.claude.com/docs/en/about-claude/models/whats-new-opus-5, TechCrunch:https://techcrunch.com/2026/07/24/anthropic-launches-opus-5/, 以及CodeRabbit独立评测:https://www.coderabbit.ai/blog/opus-5-model-review

Anthropic 发布 Claude Opus 5:前沿级智能体编程与计算机使用能力,Opus 定价不变

Asif Razzaq是Marktechpost Media Inc.的首席执行官。作为一位具有远见的企业家和工程师,Asif致力于利用人工智能的潜力造福社会。他最近的项目是推出人工智能媒体平台Marktechpost,该平台以对机器学习和深度学习新闻的深入报道而脱颖而出,既技术可靠又易于广大受众理解。该平台每月浏览量超过200万,显示出其在观众中的受欢迎程度。

Designing High-Performance GPU Kernels with TileLang: Tensor-Core GEMM, Fused Softmax, FlashAttention, and Autotuning

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:Anthropic 推出 Claude Opus 5,取代 Opus 4.8 成为 Opus 系列旗舰模型。 Aioga 将其归入「模型更新」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: marktechpost.com

来源: MarkTechPost(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-24T21:50:46.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Anthropic 推出 Claude Opus 5,取代 Opus 4.8 成为 Opus 系列旗舰模型。定价维持不变,输入每百万 token 5 美元、输出每百万 toke...

MarkTechPost(RSS)2026-07-24T21:50:46.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。