Aioga
AI资讯 / 行业动态
返回 AI资讯

Anthropic 发布 Claude Platform 降本指南:提示词缓存、清理反模式与校准 effort

Claude:Blog(网页)Aioga 编辑团队2026-09-07T16:00:00.000Z热度 72

Anthropic 官方博客介绍用三项手段降低 Claude Platform 成本而不牺牲性能:提高提示词缓存命中率、清除旧模型遗留的提示词反模式、按任务校准 effort。

行业动态Claude:Blog(网页)

今日 AI 情报摘要

Anthropic 官方博客介绍用三项手段降低 Claude Platform 成本而不牺牲性能:提高提示词缓存命中率、清除旧模型遗留的提示词反模式、按任务校准 effort。

中文正文 · AI 翻译

调优提示缓存、指令和工作量可以在不牺牲应用性能的情况下降低Claude的成本。

Anthropic 发布 Claude Platform 降本指南:提示词缓存、清理反模式与校准 effort

性能和成本通常被视为权衡:为了花费更少,你需要接受更差的结果。实际上,我们发现,许多使用Claude平台的应用程序可以通过三种方法在不放弃性能的情况下削减成本:最大化提示缓存命中率、在升级到前沿Claude模型时去除提示中的反模式,以及根据任务校准工作量。我们已将这些指南放入claude-api技能:https://github.com/anthropics/skills/tree/main/skills/claude-api。在本文中,我们展示了如何使用claude-api技能的Claude Code在保持或提高性能的同时,经常找到降低成本的方法。

在Claude生成响应之前,它首先会将你的提示处理成内部工作状态。这个步骤称为prefill,是处理输入的昂贵部分。提示缓存保存该状态(键值缓存,KV缓存):当请求以相同前缀开始时,Claude会读取缓存而不是重新计算。缓存读取的费用仅为完整输入价格的一小部分:https://platform.claude.com/docs/en/about-claude/pricing。

为了确保提示缓存的有效使用,有几个实际注意事项。首先,提示缓存是针对特定模型固定的。其次,提示缓存读取必须在提示前缀上完全一致。最后,提示缓存的生存时间有限:https://platform.claude.com/docs/en/build-with-claude/prompt-caching#ttl-support (TTL)。

考虑到这些要点,有一些实际技巧:

我们积累了一些关于提示缓存管理的经验教训:https://claude.com/blog/lessons-from-building-claude-code-prompt-caching-is-everything

Anthropic 发布 Claude Platform 降本指南:提示词缓存、清理反模式与校准 effort

仔细监控你的提示缓存命中率。Claude控制台:https://platform.claude.com/docs/en/build-with-claude/cache-diagnostics 和缓存诊断API:https://platform.claude.com/docs/en/build-with-claude/cache-diagnostics 提供提示缓存诊断,包括提示缓存未命中的原因(图1)以及两个请求确切分歧的位置。

Anthropic 发布 Claude Platform 降本指南:提示词缓存、清理反模式与校准 effort

提示可以累积修补模型弱点的指令。这些指令可能会相对于最新的 Claude 模型功能发生偏移:https://x.com/trq212/status/2080710971228918066。以下是常见的提示“反模式”,它们会削弱前沿 Claude 模型的性能,并可能无意中增加成本:

我们已经在 claude-api 技能中更新了一个新命令,用于注意这些反模式。在 Claude Code 中,对你的提示、技能或工具描述运行 /claude-api prompt-audit。审核会涵盖工作目录中的所有内容,包括调用 Claude API 的应用代码以及 Claude Code 的配置(例如 CLAUDE.md:http://claude.md 或技能)。

例如,我们测试了从 Opus 4.8 到 Opus 5 的模型迁移,在一个客户支持基准测试上开始。我们从一个干净的提示开始,然后逐个植入反模式(一个已弃用的思考设置、一对矛盾的退款规则、一个手动草稿本、“验证两次”、“尽量全面”,以及一项必须的六步程序),共给出六个遗留提示。

我们分别在 Opus 4.8、仅更改模型 ID 的 Opus 5,以及对 Opus 5 每个提示运行一次 /claude-api prompt-audit 后进行测试(图 3 显示了六个提示的平均值)。

Anthropic 发布 Claude Platform 降本指南:提示词缓存、清理反模式与校准 effort

图 3 | 从 Opus 4.8 迁移到 Opus 5 过程中提示反模式的影响。

在 Opus 5 中,验证仪式(“验证两次”)在每次退款时重复订单查询,使用了不必要的 token。强调增强器(“尽量全面”)导致数十次不必要的知识库搜索。

运行 /claude-api prompt-audit 删除了反模式,平均降低成本 14.6%,准确率提升 5.3%。成本下降是因为额外的工具调用和重复推理被消除。准确率上升有三方面原因:已弃用的思考设置导致 API 拒绝了所有路由请求;矛盾的退款规则导致 Opus 5 扣留了本应退还的四笔退款,同时要求客户确认;手动草稿本与 Opus 5 内置思考冲突:在三个工单中,它把工具调用写在推理中,但从未执行它。

Effort:https://platform.claude.com/docs/en/build-with-claude/effort 告诉 Claude “努力程度”。在低努力时,Claude 通常会更快得出结论。在高努力情况下,Claude 会进行深入思考、验证并探索其他选项后才回答。

在单个模型上,不同努力等级的成本与性能可能会有所不同。例如,在 FrontierCode Diamond(最难的 50 个任务)上,Claude Fable 5 在低努力时得分为 11.5%,每个任务的花费为 5.35 美元。在最大努力下,Fable 5 的得分为 30.9%,每个任务的花费为 19.00 美元;调整努力程度会使得分提高约 2.7 倍(+19 分),成本约增加 3.5 倍(图 4)。

在 Claude Fable 5.1 上,《人类最后的考试》(未使用工具)显示出陡峭的曲线,但最后一步增益递减。低努力时得分约为 53%,每题成本约 0.30 美元;最大努力时得分约 61%,每题成本约 2.23 美元;最后一步提升到最大努力仅增加约半分,而成本增加约 46%。这一增益落在基准测试的运行噪声范围内,因此你花费更多却没有可测量的提升。

Anthropic 发布 Claude Platform 降本指南:提示词缓存、清理反模式与校准 effort

努力可能在任一方向上校准不当:

有一些有用的方法来校准努力:

Anthropic 发布 Claude Platform 降本指南:提示词缓存、清理反模式与校准 effort

这种校准通常涉及在不同模型和努力等级上运行评估。在 Claude Code 中,/claude-api hillclimb 可为你执行此搜索:它会将评估拆分为训练集和测试集,提出配置更改,并读取失败的训练示例以修复发现的问题。

我们在客户支持基准上运行了它,从 Opus 4.8 的默认(高)努力开始。山爬算法首先尝试了低努力的 Opus 5,应用提示审核移除强制工具调用流程、草稿步骤和矛盾规则。这使 Opus 4.8 的基线训练准确率达到 98.9%,每个工单成本降至 2.6 美分。

然后,它降低到低努力的 Sonnet 5,成本进一步下降至每个工单 1 美分,但准确率下降至 88.9%。通过读取失败的训练工单,Claude 在提示中增加了路由规则和退款上限交叉参考,使 Sonnet 5 的准确率回到 98.9%,成本保持不变。

在 14 张搜索中未见的保留工单上,最终配置得分为 90.5%,而原始设置得分为 78.6%,成本约为原来的五分之一。

提示缓存、指令和工作量是降低成本的常用手段。我们的文档:https://platform.claude.com/docs/en/about-claude/models/optimizing-for-cost-and-intelligence#cut-spend-without-losing-quality 涵盖了更多内容。要对使用 Claude API 的应用代码进行全面的成本审计,我们新增了 /claude-api cost-optimize:它可以分析你的花费去向,应用成本降低措施,并且如果你提供评估,还能显示节省与性能之间的权衡。

cost-optimize 会首先找出你的令牌消耗情况:可以通过你的组织使用情况和成本报告:https://platform.claude.com/docs/en/manage-claude/usage-cost-api(如果你有 Claude 管理员 API 密钥),或从每个 API 响应的 usage 对象获取(如果你的应用记录了它),如果以上都不可用,则通过读取你的请求构建代码并进行估算。

然后它会对可用的节省措施进行排序,从提示缓存开始,优化每个请求携带的内容(包括提示审计)、限制输出以及批处理:https://platform.claude.com/docs/en/build-with-claude/batch-processing 未监督工作。如果你提供了评估,它还会进一步计算不同工作量和模型选择下的成本和性能。

我们在四个公开基准上运行了此工具,从 Sonnet 5 作为基线开始(图 7):

当你已经迁移到前沿 Claude 模型并希望检查现有提示时,请从 /claude-api prompt-audit 开始。它会扫描工作目录中的提示、技能和工具描述。这可以是调用 Claude API 的应用程序代码,也可以是 Claude Code 的配置(CLAUDE.md、skills)。它会去除常见的反模式,这些反模式会阻碍前沿模型的发挥。

当你的应用使用 Claude API 并且希望进行成本审计时,请使用 /claude-api cost-optimize。它会分析令牌使用情况,然后测试各种手段:它会应用提示审计,同时还检查通过提示缓存、批处理未监督工作或限制输出等方式降低成本的可能性。如果你提供评估,它会衡量工作量和模型选择的权衡。

最后,使用 /claude-api hillclimb 对成本和性能进行迭代搜索。给定一个评估后,Claude 会将其分为训练集和测试集,然后提出旨在降低成本同时保持基线性能的应用更新。Claude 会读取失败的训练案例来指导搜索,最终配置会在保留的测试集上进行评分。

探索更多关于使用 Claude 构建团队的产品新闻和最佳实践。

产品更新、使用方法、社区亮点及更多内容,每月发送到您的邮箱。

情报判断

Aioga 编辑摘要

Anthropic 发布 Claude Platform 降本指南,并将相关指导纳入 claude-api 技能。文章提出三种方法:提高提示词缓存命中率、升级前沿模型时清除提示词反模式,以及按任务校准 effort。

背景分析

文章称,提示词缓存可复用相同前缀形成的内部工作状态,缓存读取按完整输入价格的一部分计费;缓存依赖特定模型、前缀字节完全一致及有限的生存时间,并可通过诊断工具查看未命中原因。

Aioga 观点

Aioga 判断:该指南的重点不是单纯压缩输入,而是把缓存管理、提示词维护和任务级 effort 配置结合起来,在来源所述场景中寻求降低成本并保持或改善性能。

影响与后续

可能影响:使用 Claude Platform 的团队需要关注缓存命中率、模型切换后的提示词适配和任务所需 effort;成本下降并不代表所有应用都能获得相同结果,仍需要结合诊断信息评估。 后续观察:应关注 claude-api 技能中具体指导的完善情况,以及 Claude Platform 用户在不同模型、提示词结构和任务设置下的缓存命中率与成本表现。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: claude.com

来源: Claude:Blog(网页)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-07T16:00:00.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Anthropic 官方博客介绍用三项手段降低 Claude Platform 成本而不牺牲性能:提高提示词缓存命中率、清除旧模型遗留的提示词反模式、按任务校准 effort。

Claude:Blog(网页)2026-09-07T16:00:00.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。