Aioga
AI资讯 / 模型更新
返回 AI资讯

Anthropic 发布 Claude Sonnet 5:智能体能力与基准测试对比

MarkTechPost(RSS)Aioga 编辑团队2026-07-14T00:58:47.000Z热度 58

Anthropic 发布 Claude Sonnet 5,定位为最具智能体能力的 Sonnet 模型,支持规划、驱动浏览器和终端,并可在长任务中自主运行。Sonnet 5 在每...

模型更新MarkTechPost(RSS)

今日 AI 情报摘要

Anthropic 发布 Claude Sonnet 5,定位为最具智能体能力的 Sonnet 模型,支持规划、驱动浏览器和终端,并可在长任务中自主运行。

Sonnet 5 在每项已发布基准测试中均超越前代 Sonnet 4.6:SWE-bench Pro 达 63.2%(Sonnet 4.6 为 58.1%),OSWorld-Verified 达 81.2%(78.5%),HLE 达 57.4%(46.8%),知识工作基准 GDPval-AA v2 得分 1,618,略超 Opus 4.8 的 1,615。 API 定价方面,Sonnet 5 输入/输出价格为 $2/$10 每百万 token(8 月 31 日前促销价),之后恢复 $3/$15; Opus 4.8 为 $5/$25。 模型支持低、中、高、极高四种推理努力级别,上下文窗口为 100 万 token。 Sonnet 5 即日起作为 Free 和 Pro 计划的默认模型,并已在 Claude Code 和 Claude Platform 上线。

中文正文 · AI 翻译

Anthropic 刚发布了 Claude Sonnet 5:https://www.anthropic.com/news/claude-sonnet-5。他们称其为迄今最具自主性的 Sonnet 模型。它能够规划、驱动浏览器和终端,并在长时间任务中自主运行。

Sonnet 5 目前是免费和专业计划的默认模型。Max、Team 和 Enterprise 用户可以选择它。它也已经在 Claude Code 和 Claude 平台上线。

Sonnet 位于 Anthropic 产品线的中端。它高于价格较低的 Haiku 4.5,但低于旗舰 Opus 4.8。

Sonnet 5 是 Sonnet 4.6 的升级版本,后者于 2026 年 2 月发布。Anthropic 将此次发布定位为围绕自主可靠性,而非单一的标杆性能。

实际应用中,这意味着可以进行更长的任务链而不会丢失上下文。这意味着当工具调用失败时有更好的自我纠正能力。这意味着在 Claude Code 或 Cowork 内的长时间会话中表现更稳定。

该模型显示了不同的努力等级:低、中、高和 x高(超高)。更高的努力等级在推理上消耗更多的 token,从而提高质量和成本。

需要注意的是,Sonnet 5 使用了更新后的分词器,即在 Opus 4.7 中引入的分词器。同样的文本大约映射为 1.0 到 1.35 倍的 token。

可估算不同模型每个任务的成本,并对比已发布的基准数据。所有数据均来自 Anthropic 2026 年 6 月 30 日发布。

Anthropic 团队发布了一张基准表,对比了 Sonnet 5、Sonnet 4.6 和 Opus 4.8。Sonnet 5 在每个测试类别中都超过了其前身,并缩小了与 Opus 4.8 的差距。

在自主编码(SWE-bench Pro)测试中,Sonnet 5 得分为 63.2%。Sonnet 4.6 得分为 58.1%。Opus 4.8 仍以 69.2% 领先。

在计算机使用(OSWorld-Verified)测试中,Sonnet 5 得分 81.2%,而 Sonnet 4.6 为 78.5%。在 Terminal-Bench 2.1 中,它达到 80.4%,而 Sonnet 4.6 为 67.0%。

在 Humanity’s Last Exam 使用工具测试中,Sonnet 5 得分 57.4%,几乎与 Opus 4.8 的 57.9% 相当。

有一个方面 Sonnet 5 略胜一筹。在 GDPval-AA v2 知识工作基准测试中,它得 1,618 分,而 Opus 4.8 得 1,615 分。

Anthropic 发布 Claude Sonnet 5:智能体能力与基准测试对比
Anthropic 发布 Claude Sonnet 5:智能体能力与基准测试对比

对于开发者而言,性价比故事是最重要的部分。Sonnet 5 在每个努力等级上都严格优于 Sonnet 4.6。在低、中努力等级下,其价值最为明显。

在这些层级上,Sonnet 5 提供了以往 Sonnet 定价无法购买的质量。Opus 4.8 仍然是该范围内准确性领先的产品。

由此可以制定一个实用的路由策略。将大部分代理编码、工具使用和知识工作发送给 Sonnet 5。将 Opus 4.8 保留用于对准确性要求极高的任务。将 Haiku 4.5 用于高量、延迟敏感的调用。

早期访问合作伙伴描述了具体的工作流程。他们的报告与常见的工程工作相对应。

Sonnet 5 的入门定价有效期至 2026 年 8 月 31 日。此日期之后,标准定价为 $3/$15。标准提示缓存(以 0.1 倍输入读取缓存)以及 50% 的批量 API 折扣同样适用。按每个令牌计算,Sonnet 5 的价格低于 GPT-5.5 和 Gemini 3.1 Pro,但高于 Gemini 3.5 Flash。Anthropic 在 Sonnet 5 的发布文章中列出了 100 万令牌的上下文窗口,但没有公布其他模型的上下文数据。

API 调用与任何其他 Anthropic 模型相同。只需将模型字符串更改为 claude-sonnet-5。

早期开发者在 2026 年 6 月 30 日上线当天,在 Hacker News 和 X 上的反馈。

反应不一:对性价比表示赞赏,但对 $3/$15 的完整定价存在疑虑。以下根据公开帖子手动标注;两个 Reddit 链接是活跃线程,这里不计入。

需要与我们合作推广您的 GitHub 仓库、Hugging Face 页面、产品发布或网络研讨会等吗?请联系: https://forms.gle/wbash1wF6efRj8G58

Anthropic 发布 Claude Sonnet 5:智能体能力与基准测试对比

Asif Razzaq 是 Marktechpost Media Inc. 的首席执行官。作为一位有远见的企业家和工程师,Asif 致力于利用人工智能的潜力造福社会。他最近的工作是推出人工智能媒体平台 Marktechpost,该平台以对机器学习和深度学习新闻的深入报道而脱颖而出,内容技术扎实,同时易于广大受众理解。该平台月访问量超过 200 万次,显示出其在受众中的受欢迎程度。

Patter SDK Guide to Building a Restaurant Booking Phone Agent with Dynamic Variables, Guardrails, Latency Dashboards, and Eval Checks

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:Anthropic 发布 Claude Sonnet 5,定位为最具智能体能力的 Sonnet 模型,支持规划、驱动浏览器和终端,并可在长任务中自主运行。 Aioga 将其归入「模型更新」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: marktechpost.com

来源: MarkTechPost(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-14T00:58:47.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Anthropic 发布 Claude Sonnet 5,定位为最具智能体能力的 Sonnet 模型,支持规划、驱动浏览器和终端,并可在长任务中自主运行。Sonnet 5 在每...

MarkTechPost(RSS)2026-07-14T00:58:47.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。