Aioga
AI资讯 / 行业动态
返回 AI资讯

Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1:Terminal-Bench-Science 得分 52.6%,缓存读取降价 75%

MarkTechPost(RSS)Aioga 编辑团队2026-09-01T20:30:21.000Z热度 58

Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,两者为同一底层模型加不同安全层,Fable 5.1 全面开放,Mythos...

行业动态MarkTechPost(RSS)

今日 AI 情报摘要

Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,两者为同一底层模型加不同安全层,Fable 5.1 全面开放,Mythos 5.1 仅限

Project Glasswing 内经过审核的美国组织。

中文正文 · AI 翻译

Anthropic 在 2026 年 6 月发布 Fable 5 系列三个月后,发布了 Claude Fable 5.1 和 Claude Mythos 5.1。这两者是相同的基础模型,但有不同的安全保护层。Fable 5.1 可作为 claude-fable-5-1 普遍使用;Mythos 5.1 限制在经过审查的机构内部使用。两者都具备 100 万令牌的上下文窗口和最大 12.8 万输出令牌,始终启用自适应思考。主要能力指标在 Terminal-Bench-Science 0.1 上为 52.6%,相比 Fable 5 的 24.7% 和 Opus 5 的 29.0%。主要商业指标是缓存读取费用减少 75%,从每百万令牌 1.00 美元降至 0.25 美元,Anthropic 测量得出在典型工作负载中成本约降低 25%,在自主任务中最高可降至 45%。基础输入和输出定价保持不变,为每百万令牌 10 美元和 50 美元。

是的,Claude Fable 5.1:https://www.anthropic.com/claude-fable-and-mythos-5-1 在 Claude API、Amazon Bedrock、AWS 上的 Claude 平台、谷歌云和 Microsoft Foundry 上可作为 claude-fable-5-1 普遍使用。Claude Mythos 5.1 不可用,它仅限于 Project Glasswing 内经过审查的美国机构使用:https://anthropic.com/glasswing。

在 Terminal-Bench-Science 0.1 上,这是一个自主科研基准测试,Fable 5.1 得分为 52.6%,相比 Opus 5 的 29.0%,Fable 5 的 24.7% 和 GPT-5.6 Sol 的 22.4%。Anthropic 报告每个模型的标准误差为 3.5 至 4.5 分,因此应注意分数差距,而不仅仅是排名。

在 Terminal-Bench 4.0 上,Fable 5.1 达到 55.8%,Mythos 5.1 达到 60.9%。两个相同模型之间的差距是安全干预的成本,这是一个异常诚实的披露。其他方面:CursorBench 3.2.0 为 73.4%,Humanity’s Last Exam 在无工具下为 60.9%,有工具为 65.0%,AutomationBench 为 31.4%,OSWorld 2.0 严格为 41.7%,GDPval-AA v2 为 1853。

基础输入和输出定价保持不变。缓存读取减少 75%,从每百万令牌 1.00 美元降至 0.25 美元,相对于其他每个 Claude 模型 0.1 倍基准输入,仅为 0.025 倍。Anthropic 测量得出,在典型工作负载中成本约降低 25%,在上下文密集型自主任务中最高可降至约 45%。批量处理为每百万令牌 5 美元和 25 美元。

附加更改:每条消息的工作量、以轮次为范围的系统消息,以及 thinking.display: "updates" 都处于标头下的测试阶段。内容来源不可选择,所有输出都有统计文本水印,文件具有 C2PA 证书。

Anthropic 还记录了真实的回归。并行工具调用的变化更大,因此代理循环可能每轮只发出一次调用,而 Fable 5 则批处理了多个调用。模型讲述得更少,低工作量下更常从记忆中回答,并且偏好整个文件重写而非局部编辑。

网络安全防护现在允许发现漏洞,但不允许开发利用,减少了 Claude Code 每次会话约 60% 的干预。生物学安全防护在 benign 请求上触发频率降低 85%。渗透测试、漏洞生成和基于二进制的漏洞扫描仍会重定向到 Opus。

在研究方面,Mythos 5.1 在 12 个靶点上设计蛋白质结合剂的命中率约为 50%,而正常水平为 10% 到 15%;Fable 5.1 构建了金星高程图:https://zenodo.org/records/22164484,分辨率为 2 到 3 公里;自定义 GPU 内核将七个开源基因组学模型的速度提升了最多 2.5 倍。

需要与我们合作以推广您的 GitHub 仓库或 Hugging Face 页面或产品发布或网络研讨会等?请联系:https://forms.gle/wbash1wF6efRj8G58

Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1:Terminal-Bench-Science 得分 52.6%,缓存读取降价 75%

Asif Razzaq 是 Marktechpost Media Inc. 的首席执行官。作为一名具有远见的企业家和工程师,Asif 致力于利用人工智能的潜力造福社会。他最近的努力是推出人工智能媒体平台 Marktechpost,该平台以对机器学习和深度学习新闻的深入报道而脱颖而出,这些报道既具有技术性又易于广泛读者理解。该平台每月浏览量超过 200 万,说明其在观众中非常受欢迎。

Researchers from Princeton, Ant Group and Stanford Introduce AQuA
Keenable AI Open-Sources NEEDLE: A Live Search Benchmark That Rebuilds Its Query Set Every Hour

情报判断

Aioga 编辑摘要

Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1,两者采用相同底层模型和不同安全层。Fable 5.1 全面开放,Mythos 5.1 仅向 Project Glasswing 内经过审核的美国组织提供。

背景分析

两款模型均支持 100 万 token 上下文和 12.8 万 token 最大输出。Fable 5.1 在 Terminal-Bench-Science 0.1 得分 52.6%;缓存读取价格由每百万 token 1 美元降至 0.25 美元,基础输入输出价格不变。

Aioga 观点

Aioga 判断:此次更新同时呈现能力、成本与安全限制,但基准结果存在每个模型 3.5 至 4.5 分的标准误差,因此更适合观察整体差距,不宜仅凭排名断言模型优劣。

影响与后续

可能影响:缓存读取降价可能降低部分典型及上下文密集型任务的使用成本,但不代表所有负载都能获得相同降幅。并行工具调用更不稳定、偏好整文件重写等回归,需要在实际流程中验证。 后续观察:需要关注测试环境中的缓存命中、工具调用方式和编辑行为,并核对测试结果是否接近来源所述成本变化;同时应持续观察测试版功能、安全干预及受限模型开放范围的后续调整。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: marktechpost.com

来源: MarkTechPost(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-01T20:30:21.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,两者为同一底层模型加不同安全层,Fable 5.1 全面开放,Mythos...

MarkTechPost(RSS)2026-09-01T20:30:21.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。