Aioga
AI资讯 / 技巧观点
返回 AI资讯

Claude Opus 5 在智能指数上以 61 分登顶,成本低于 Fable 5

The Decoder:AI News(RSS)Aioga 编辑团队2026-07-25T09:31:00.000Z热度 63

Anthropic 的 Claude Opus 5 在 Artificial Analysis 智能指数上以 61 分位居第一,领先 Fable 5(60 分)和 GPT-5....

技巧观点The Decoder:AI News(RSS)

今日 AI 情报摘要

Anthropic 的 Claude Opus 5 在 Artificial Analysis 智能指数上以 61 分位居第一,领先 Fable 5(60 分)和 GPT-5.6 Sol(59 分)。

其平均智能任务成本仅 $2.03,低于 Fable 5 的 $2.75,但幻觉率升至 50%。

中文正文 · AI 翻译

根据多个基准测试,Anthropic 的 Claude Opus 5 是目前最强大的 AI 模型,性能超过 Fable 5,同时成本更低。

Image description

Opus 5 在人工分析智能指数(Artificial Analysis Intelligence Index:https://artificialanalysis.ai/)中得分为 61,该指数结合了涵盖知识工作、编码、科学推理和事实准确性的九项测试。这使其略高于 Claude Fable 5(60)、GPT-5.6 Sol(59)、Kimi K3(57)和 Claude Opus 4.8(56)。人工分析与 Anthropic 合作,在模型公开发布前对其进行了测试。

在编码方面,Claude Opus 5 在“xhigh”模式下与 Claude Code 配合,在人工分析编码指数上并列第一,该指数衡量 AI 模型独立处理编程任务的能力,包括发现和修复漏洞。在 Terminal-Bench v2.1 测试中,该测试评估代理在真正终端环境中作为自主工程师的表现,Opus 5 在“max”模式下得分 89%,与之前的领先者 GPT-5.6 Sol 持平。

Claude Opus 5 在智能指数上以 61 分登顶,成本低于 Fable 5

在科学推理方面,Opus 5 在 Humanity's Last Exam 中得分 53%,这是一项非常困难的涵盖多个学术领域的知识测试,其成绩与 Fable 5 不相上下。在 CritPt 上,这是来自阿贡国家实验室和伊利诺伊大学香槟分校研究人员的物理基准测试,它再次与 Fable 5 持平,但落后于 GPT-5.6 Sol、GPT-5.5 Pro 和 GPT-5.6 Terra。

事实准确性仍然是薄弱环节:在 AA-Omniscience 测试中,该测试评估模型知识声明的准确性,Opus 5 比 Opus 4.8 提高了 7 分,但仍落后于 Fable 5。Opus 5 在不确定时也更容易作答,使其幻觉率上升 14 个百分点,达到 50%。

Epoch AI(https://epoch.ai/benchmarks/eci?subset-view=graph&subset-tab=Software+engineering&view=graph&tab=release-date)也对 Claude Opus 5 进行了测试。该研究机构给它的整体 Epoch 能力指数评分为 159,略低于 Fable 5 的 161。然而,仅在软件工程基准(SWE-ECI)中,Opus 5 与 Fable 5 并列 161,表现优于 GPT-5.6 Terra 和 Claude Opus 4.8。GPT-5.6 Sol 在两个类别中均领先。

Claude Opus 5 在智能指数上以 61 分登顶,成本低于 Fable 5

总体而言,这证实了前沿模型之间的竞争非常激烈。没有任何单一模型能够脱颖而出或声称拥有明显优势。这增加了AI模型最终将商品化的观点的可信度:https://the-decoder.com/microsoft-ceo-satya-nadella-says-ai-models-are-getting-commoditized/。

使用Opus 5完成平均Intelligence Index任务的成本为2.03美元,低于Claude Fable 5(fallback模式)为2.75美元的成本。它高于Opus 4.8为1.80美元以及Sonnet 5为1.53美元。然而,在“高”层和“超高”层,Opus 5的表现优于Opus 4.8和Sonnet 5,同时成本更低。Ad DEC_D_Incontent-2

Vals.ai:https://vals.ai/ 使用Vibe Code Bench(一种针对编程任务的基准)测试了Claude Opus 5在所有五个推理层的表现。成绩从“低”层的76.7%上升至“中”层的82%,再到“高”层的89.8%。在两个最高层中,表现稍有下降,“超高”层得分为88.3%,“极高”层得分为88.4%,尽管成本显著更高。Ad

Vals.ai发现,最高层往往产生更复杂的解决方案,同时更容易出现错误。“高”层生成的解决方案则更简单,更可靠地满足要求。

Claude Opus 5 在智能指数上以 61 分登顶,成本低于 Fable 5

Terminal-Bench 2.1:https://x.com/ValsAI/status/2080817015871451500 显示了类似的模式。“高”层的表现优于“极高”,因为模型在最高层的每次尝试耗时更多,在规定时间内尝试次数较少。这与Anthropic的指南一致,同时“高”层被设置为API和Claude Code的默认层。

Token定价保持为每百万输入Token 5美元,每百万输出Token 25美元。缓存写入成本为每百万Token 6.25美元,缓存寿命为五分钟,而缓存命中仅需每百万Token 0.50美元。

Opus 5在AA-Briefcase:https://artificialanalysis.ai/evaluations/aa-briefcase 基准测试中表现尤为出色,该基准评估AI模型处理典型办公任务的能力,如撰写研究报告、制作演示文稿以及基于数千个输入文件分析电子表格。性能从正确性、分析质量和演示质量进行评分,然后汇总为类似于国际象棋排名的Elo评分。

在最高推理水平下,Opus 5 的 Elo 达到 1720,比 Claude Fable 5(1574)高出整整 146 分。它的三个最高等级(max、xhigh、high)占据前三名。结合 Fable 5、Sonnet 5 和 Opus 4.8,Anthropic 现在掌握了前十名的大部分位置。

Claude Opus 5 在智能指数上以 61 分登顶,成本低于 Fable 5

每项任务的成本下降了 20%,降至 17.79 美元,而 Fable 5 为 22.30 美元。“xhigh”版本的成本为 14.26 美元,“high”仅为 10.41 美元,不到 Fable 5 的一半。两者在 Elo 排名中仍超过 Fable 5。在中等表现下,Opus 5 的 Elo 达到 1470,仅略低于 GPT-5.6 Sol(max,1505)。在低性能下,其 Elo 为 1223,略低于 GLM-5.2(max,1254)。

Claude Opus 5 在智能指数上以 61 分登顶,成本低于 Fable 5

Opus 5 最大的进步体现在分析质量上。在“max”级别,其分析质量 Elo 达到 2016,比 Fable 5 高出近 300 分。其 Rubric 通过率(跟踪模型达到预定质量标准的频率)为 58%(“max”)、57.2%(“xhigh”)和 56%(“high”)。呈现质量则是另一回事。Opus 5 的呈现 Elo 为 1628,比 GPT-5.6 Sol 在“max”级别的 1666 分低约 40 分。

更高的性能需要更多时间:“max”下,Opus 5 每项任务需要超过 36 分钟,平均完成 103 次,通过率约比 Opus 4.8 的 24 分钟和 55 次高出 50%。

保持对 AI 的了解。清晰、有用,无废话。

关注 The Decoder,获取 AI 新闻、背景故事和专家分析。

The Decoder:https://the-decoder.com/

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:Anthropic 的 Claude Opus 5 在 Artificial Analysis 智能指数上以 61 分位居第一,领先 Fable 5(60 分)和 GPT-5.6 Sol(59 分)。 Aioga 将其归入「技巧观点」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:实践类内容的价值在于是否能被复现、是否有明确边界,以及它能否转化为稳定的开发或工作流方法。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察示例是否可复现、工具版本变化、社区反馈和实际成本。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: the-decoder.com

来源: The Decoder:AI News(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-25T09:31:00.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Anthropic 的 Claude Opus 5 在 Artificial Analysis 智能指数上以 61 分位居第一,领先 Fable 5(60 分)和 GPT-5....

The Decoder:AI News(RSS)2026-07-25T09:31:00.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。