Aioga
AI资讯 / 模型更新
返回 AI资讯

Anthropic 发布 Claude Opus 5:以 Fable 5 一半的 token 价格实现接近其性能

The Decoder:AI News(RSS)Aioga 编辑团队2026-07-24T18:36:42.000Z热度 67

Anthropic 推出旗舰模型 Claude Opus 5,在智能体编程和知识工作基准测试中领先,并在 ARC-AGI-3 上取得 30.2% 的分数,是 GPT-5.6 S...

模型更新The Decoder:AI News(RSS)

今日 AI 情报摘要

Anthropic 推出旗舰模型 Claude Opus 5,在智能体编程和知识工作基准测试中领先,并在 ARC-AGI-3 上取得 30.2% 的分数,是 GPT-5.6 Sol 的近四倍。

中文正文 · AI 翻译

Anthropic的新旗舰模型Claude Opus 5在编码和知识工作方面获得了最高分,同时在使用一半的令牌费率下接近Claude Fable 5的表现。

100万令牌的上下文窗口和令牌费率保持不变:https://platform.claude.com/docs/en/about-claude/pricing。与其前身Opus 4.8一样,Opus 5每百万输入令牌收费5美元,每百万输出令牌收费25美元。新推出的快速模式提高了2.5倍的速度,但价格翻倍。广告

如果不考虑令牌效率,令牌费率并不能说明全部情况。Opus 4.7每个任务的成本比Opus 4.6高出30%到40%:https://the-decoder.com/first-token-counts-reveal-opus-4-7-costs-significantly-more-than-4-6-despite-anthropics-flat-pricing/,尽管两者的基础费率相同。最近Claude Sonnet 5也出现了类似的情况:https://the-decoder.com/claude-sonnet-5-continues-anthropics-pattern-of-hiding-price-increases-behind-unchanged-token-rates/。更新:早期独立基准测试支持Anthropic的声明:https://the-decoder.com/anthropics-claude-opus-5-costs-well-below-fable-5-while-matching-or-beating-it-across-most-benchmarks/。Opus 5成本低于Fable 5,同时在很多情况下性能更佳,也在价格和性能上超越了Opus 4.8和Sonnet 5。广告 DEC_D_Incontent-1

用户可以通过五种名为低、中、高、极高和最大努力的设置在性能和令牌使用之间进行权衡。Anthropic表示,Opus 5在每个努力级别上都比其前身更具价值。

在其提示指南中:https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-opus-5,Anthropic建议广泛使用“低”和“中”设置。公司表示,这些设置能在使用较少令牌和降低延迟的情况下提供良好结果,同时超越了早期Opus模型的相同设置。在编码和代理任务中,Anthropic仍建议从“极高”设置开始。广告

在两个基准测试中,Opus 5在最大努力设置下的得分略低于第二高努力设置,尽管成本更高。这一下降出现在Frontier-Bench v0.1和人工分析编码代理指数上。

Anthropic 发布 Claude Opus 5:以 Fable 5 一半的 token 价格实现接近其性能
Anthropic 发布 Claude Opus 5:以 Fable 5 一半的 token 价格实现接近其性能

更新:根据 FrontierCode 开发者 Cheng-Yuan Lee:https://x.com/cl571128/status/2080783750456311836,这种行为是预期的。基准测试不仅评估正确性,还评估模型是否仅对代码进行最小必要修改。在更高的努力等级下,Opus 5 即使只需要小修,也可能重构周围的代码。在一个示例中,Opus 5 在最低设置下仅修改了一个字符,而在“xhigh”设置下它重构了整个周围代码。基准测试将这种非必要的更改计为错误。Ad DEC_D_Incontent-2

Anthropic 发布 Claude Opus 5:以 Fable 5 一半的 token 价格实现接近其性能

根据 Anthropic 自己的基准测试,Opus 5 在多个评估中创下记录。在 Frontier-Bench v0.1 上,该模型在自主终端编码中达到 43.3%,远超 Fable 5(33.7%)、GPT-5.6 Sol(34.4%)和其前身 Opus 4.8(21.1%)。在知识工作基准 GDPval-AA:https://the-decoder.com/openai-says-top-ai-models-are-reaching-expert-territory-on-real-world-knowledge-work/ v2 上,Opus 5 以 1861 的 Elo 分领先,领先 Fable 5(1747)和 GPT-5.6 Sol(1736)。Ad

Opus 5 并不是无处取胜。在通过 DeepSWE v1.1 进行自主编码时,GPT-5.6 Sol 以 72.7% 居首,其次是 Fable 5(69.7%)和 Opus 5(68.8%)。在健康任务和法律基准测试中,Fable 5 和 Mythos 5 分别表现优于 Opus 5。

Anthropic 发布 Claude Opus 5:以 Fable 5 一半的 token 价格实现接近其性能

ARC-AGI-3 的结果可能是 Anthropic 基准测试中最大惊喜和异常值。该基准测试衡量没有记忆模式的新问题解决能力:https://the-decoder.com/even-the-latest-ai-models-make-three-systematic-reasoning-errors-arc-agi-3-analysis-shows/,Opus 5 得分为 30.2%。Opus 4.8 仅为 1.5%,GPT-5.6 Sol 为 7.8%。这比下一个最佳模型高出近 4 倍。该基准测试没有 Fable 5 的结果,尚不清楚这种大幅领先是否会在实际使用中体现。

Anthropic 发布 Claude Opus 5:以 Fable 5 一半的 token 价格实现接近其性能

在网络安全任务中,Opus 5 落后于 Mythos 5。Anthropic 表示,它故意没有对 Opus 5 进行网络任务训练,其前身也是如此。该模型在发现漏洞方面接近 Mythos 5,但在利用这些漏洞上表现明显较差。

Anthropic 发布 Claude Opus 5:以 Fable 5 一半的 token 价格实现接近其性能

Anthropic还表示,Opus 5在生成视觉输出和分析视觉内容(如图表和示意图)方面有了改进。

Anthropic将Opus 5描述为在自我检查和通过迭代改进工作方面能力大幅提升。在Frontier-Bench的一项任务中,Opus 5收到了一个机器零件的图纸,并且必须在FreeCAD中创建一个三维模型。难点在于,该模型故意没有直接查看图纸的方式。Opus 5通过编写自己的计算机视觉流程,从原始像素中提取几何信息,然后重建了完整的机器零件。Anthropic表示,在五次尝试后,没有其他模型能完成该任务。

Opus 5还处理了一个流行开源包管理器的实际漏洞。据Anthropic称,它找到根本原因并修复了社区补丁遗漏的边缘情况。而一个竞争模型仅修复了表面症状,然后报告漏洞已解决。

据报道,一家交易公司的工程师使用Opus 5在一次会话中为一个新交易所构建了市场数据馈送。之前的模型即使有详细计划,也无法完成该任务。

Anthropic表示,Opus 5的安全设置允许进行源代码漏洞研究,但会阻止基于二进制的漏洞扫描、渗透测试和漏洞利用生成。网络分类器触发频率比Fable 5低约85%。Fable 5的频繁干预曾受到严重批评:https://the-decoder.com/claude-fable-5-anthropic-admits-wrong-tradeoff-after-invisibly-throttling-rival-ai-researchers/。在Claude.ai、Claude Code和Claude Cowork中被阻止的请求默认回退至Opus 4.8,这与Fable 5使用的方法相同。

Anthropic称Opus 5是当前最强大的通用科学研究模型。它在所有生命科学评估中均优于Opus 4.8,尤其在有机化学(从光谱数据推导分子结构提高了10.2个百分点)和蛋白质相关任务(提高了7.7个百分点)方面表现突出。

与 Opus 5 一起发布,Anthropic 正在推出两个测试功能。Claude 平台上的“对话中工具更换”允许开发者在对话过程中更换可用工具,而不会使提示缓存失效。API 路径上的“自动回退”会将被阻止的请求自动切换到不同的模型。

保持对 AI 的了解。清晰、有用,没有废话。

关注 The Decoder 获取 AI 新闻、背景故事和专家分析。

The Decoder:https://the-decoder.com/

情报判断

Aioga 编辑摘要

Anthropic推出旗舰模型Claude Opus 5,称其在智能体编程与知识工作基准中表现领先,并以约为Claude Fable 5一半的token价格接近其性能。

背景分析

材料显示,Opus 5保持100万token上下文窗口与每百万输入5美元、输出25美元的基础价格;新增Fast Mode,速度提高2.5倍但价格翻倍,并提供五档努力程度。

Aioga 观点

Aioga判断,Opus 5的核心看点不只是标价,而是任务实际token消耗与效果的组合。材料中的早期独立测试支持其低于Fable 5成本并在多数基准接近或超过后者。

影响与后续

这可能使开发者在编码和知识工作任务中重新权衡模型选择、努力程度、延迟与预算。值得关注的是,最高努力档在两个基准上反而低于次高档,说明更多输出不必然带来更高得分。 后续应观察更多独立测试如何复核Anthropic的性能与成本说法,并重点比较不同努力档的实际token用量、延迟和任务完成质量,尤其关注编码任务中的非必要重构问题。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: the-decoder.com

来源: The Decoder:AI News(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-24T18:36:42.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Anthropic 推出旗舰模型 Claude Opus 5,在智能体编程和知识工作基准测试中领先,并在 ARC-AGI-3 上取得 30.2% 的分数,是 GPT-5.6 S...

The Decoder:AI News(RSS)2026-07-24T18:36:42.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。