Aioga
AI资讯 / 行业动态
返回 AI资讯

Anthropic 发布电商 Agent 架构与生产实践指南,并开源 commerce-agents 参考实现

Claude:Blog(网页)Aioga 编辑团队2026-09-01T16:00:00.000Z热度 72

Anthropic 发布电商 Agent 构建指南,基于与零售、旅游、电信等团队的落地经验,核心架构是单个 Claude 在标准 Agent 循环中配合技能与工具,而非按领域拆...

行业动态Claude:Blog(网页)

今日 AI 情报摘要

Anthropic 发布电商 Agent 构建指南,基于与零售、旅游、电信等团队的落地经验,核心架构是单个 Claude 在标准 Agent 循环中配合技能与工具,而非按领域拆分子智能体,并开源了

anthropics/commerce-agents 参考实现,含购物与商家 Agent。

中文正文 · AI 翻译

使买卖更容易的代理的架构、延迟与成本技术以及评估实践。

Anthropic 发布电商 Agent 架构与生产实践指南,并开源 commerce-agents 参考实现

在过去的一年中,我们与整个商业行业的团队——零售商、市场、旅游、娱乐和电信提供商——合作,使用Claude构建商业代理。

这些代理已投入生产,企业客户在使用它们时看到了更大的购物车和更高效的卖家操作。它们也共享一个简单的架构:Claude在一个代理循环中,配备了一组技能、工具和强大的评估套件。

本篇文章面向构建这些(或其他面向消费者)代理的工程师和工程领导者。第1部分涵盖架构,这是你只需决定一次的。第2部分涵盖延迟和成本。第3部分涵盖生产:内存、安全、评估以及在组织内扩展工作。

我们将商业代理定义为简化在线目录中买卖的代理。

有些代理面向消费者:它们搜索、比较、替代并组装订单。这可能是零售购物车、旅行行程、移动套餐变更或演出座位预订。有些代理面向企业:它们回答有关销售的问题、执行促销和活动、管理库存和定价。

Anthropic 发布电商 Agent 架构与生产实践指南,并开源 commerce-agents 参考实现

核心架构是标准代理循环中的模型:https://www.anthropic.com/engineering/building-effective-agents:围绕目标进行推理、探索上下文、通过工具采取行动、通过技能学习流程、提出澄清问题并观察结果,直到目标完成。

前面没有意图路由器来划分对话,也没有一组特定领域的代理在其后。

商业代理必须涵盖多个类别和意图的广泛能力,这使得为每个领域创建一个子代理很诱人。

实际上,这被证明是次优的,因为商业对话是一个跨多个意图和轮次紧密耦合的会话,并且需要相当多的共享上下文。

在子代理架构中,协调器持有购物车或阶段性变更、用户偏好和对话历史记录。

每次交接给子代理都是一个状态丢失的操作,这通常会影响子代理的响应质量,进而影响整体响应质量。除此之外,每次交接可能会消耗几倍的令牌并增加数秒延迟。

这些领域也很少能完全分离。退货流程可能需要订单历史记录、当前购物车和产品目录,这意味着每个领域一个子代理的方法要么在各处重复访问这些数据,要么在任务中途进行交接。

随着模型变得更聪明,它们也能处理更长的上下文、更多技能和更多工具,因此现有放置规则背后的限制会随着每一代模型而放宽。

相反,代理技能:https://platform.claude.com/docs/en/agents-and-tools/agent-skills/overview 提供了类似的按领域模块化和上下文控制,而没有交接的成本,因为技能指令加载到已经保存全部历史记录的主代理中。

在我们对多个企业部署的比较中,具备技能的单一代理在质量上始终优于所有任务使用单一提示的设计和子代理设计,并且通常每个任务的成本和延迟都更低。

子代理确实有其作用的场合是,当协调器可以将其作为工具调用,用于狭窄或自包含的任务,这类任务将受益于其自身独立的上下文窗口。

一个常见的生产示例是深度研究子代理,其中子代理搜索和阅读文档、编写和运行代码、遍历数据模型,并可能遇到死胡同。所有工作都发生在一个或多个子代理内部,只有一个简明的答案返回给协调器。

另一种例外情况是领域已经有其专门构建的代理。如果你的药房或金融服务体验运行一个独立代理,该代理具有自己的合规界面,那么正确的做法可能是交接,让该代理接管任务,并通过自己的循环直接与用户交互,直到任务完成。

区别在于对话的所有权。交接使领域代理成为用户的对应方,而委托则保持协调器,将领域代理在单一回合中进出调用,并在每次交换中降低效果。

在决定将一组指令放入系统提示还是技能时,主要因素是代理需要它的频率。加载技能会消耗一个模型回合,因此代理在大多数回合中需要的任何内容通常都放在系统提示中。

然而,这取决于你的流量分布以及评估显示的代理行为。一个好的起点是,任何与三分之一或更多流量相关的内容,无论是在上线前预期还是在生产中观察到,都放在系统提示中,其余内容则放在技能中。

如果技能可以从你已有的信号预测,例如用户访问的页面,我们建议在第一次模型调用之前从程序框架注入,而跳过加载技能的额外回合。

关键指令,如安全和法律规则、品牌约束以及关键用户信息(如过敏信息),始终放在系统提示中。

对于商业代理而言,这意味着产品搜索放在提示中,因为几乎每个会话都会用到它,而技能则承担长尾功能。

在我们的参考实现中:https://github.com/anthropics/commerce-agents,购物代理的提示包含基础、购物车和结账语义,以及展示规则,以下技能涵盖其余部分:搜索发现、购买研究、规划目标、客户服务和记忆个性化。

商家代理的划分方式相同,其技能包括性能洞察(performance-insights)、目录列表(catalog-listings)、库存操作(inventory-operations)、定价促销(pricing-promotions)和营销活动(marketing-campaigns),每个技能对应一个运营领域。

我们关于为代理编写有效工具的文章:https://www.anthropic.com/engineering/writing-tools-for-agents 涵盖了工具设计的一般内容。在商业中,有两个要点最为重要:

在核心系统和逻辑之上构建代理工具。

一家商业公司已经拥有搜索和排序、购物车、偏好和档案存储、库存系统、促销和活动引擎、销售分析等,每个系统都经过多年调优,并获取模型永远无法看到的信号。

代理的工具应调用这些系统,而不是重新实现它们,工具边界是它们逻辑结束且模型判断开始的地方。

例如,当代理调用 search_products 时,结果应该已经排好序;它的工作是决定哪些结果符合用户的目标,展示多少,以及如何展示它们。

返回模型用于推理的字段,丢弃其余字段。每个搜索行的图片 URL 通常是罪魁祸首。

根据需要,在工具内部重塑原始响应,包括在数据不明确时追加下一步。

这在错误场景中尤为相关,因为模型受益于指令而不是错误代码。例如,添加一个错误指令“查询可用性时包含产品 ID”,而不是通用的 403。

大多数商务代理的响应是 UI 组件而不是文本,无论是产品轮播、行程、座位图还是图表。这意味着代理必须输出一个 schema 而不是文本。

团队有时会通过提示模型输出自定义标签并在客户端解析它们来开始。这种方法在界面扩展时会失效,因为:

经验证可行的模式是将每个 UI 组件制作成一个工具。模型调用 present_products、present_itinerary 或 present_plan_comparison 并传递类型化参数;你的服务器验证并丰富调用,然后发出事件;你的客户端进行渲染。

由于组件是工具调用,它们已经以原生格式存在于 messages 数组中,因此在重新加载旧对话时无需重新解析。示例展示工具契约如下,参考仓库链接:https://github.com/anthropics/commerce-agents

Anthropic 发布电商 Agent 架构与生产实践指南,并开源 commerce-agents 参考实现

权衡点在于流式粒度。工具调用的每个顶级参数在服务器端缓存以进行验证,因此即使开启流式处理,展示工具的子组件也会分步骤到达。这会影响感知延迟。

要获得令牌级流式处理,在工具定义中设置 eager_input_streaming: true,这会跳过缓冲,从而也没有服务器端 schema 保证。

在我们的评估中,Claude Sonnet 类及以上模型的 schema 违规非常罕见,但为了应对偶尔出现的情况,请在调用中加入重试机制。

演示工具还为代理提供了屏幕内容的记录。当客户说“第一个酒店”或“左边第三个”时,布局信息在消息数组中,即最后一次演示调用的参数中。

为了使其工作,这些参数必须反映渲染后的布局,因此请按照UI的结构来组织它们,将其作为有序的行和轮播,而不是客户端重新排列的平面列表。

延迟在商业中很重要,而面向消费者的界面最不容忍。然而,在代理界面上,我们持续观察到能够提升保留率、参与度和购物车规模等指标的关键是结果的质量。

相比边际延迟的改善,答案是否相关以及任务是否真正完成,对这些指标更为关键。

因此从两个方面处理延迟。通过良好的工程实践来最小化端到端延迟,同时降低感知延迟(因为用户看到代理工作时,会将其视为进度)。

每个用户都有延迟预算,下列技术可以在不增加智能消耗的情况下,使代理保持在预算内。

任务完成延迟是模型轮次中“最后一个token的时间加上工具处理时间”的总和。这给了你三个可操作的杠杆:减少轮次、加快工具速度和加快token生成速度。这些杠杆有时会相互竞争,所以需要最小化的是总和,而不是单独的某一项。

查询复杂性会增加轮次,通常不在你的控制范围内。模型智能和相关上下文能帮助代理用更少轮次完成任务。我们在这方面的一些关键经验包括:

Anthropic 发布电商 Agent 架构与生产实践指南,并开源 commerce-agents 参考实现

感知延迟是用户感觉到屏幕做出响应所需的时间。在面向消费者的使用场景中尤其关键,因为任何交易摩擦都会影响结账率和收入。有两种技术可以缩短它而无需修改模型:

Anthropic 发布电商 Agent 架构与生产实践指南,并开源 commerce-agents 参考实现

提示缓存是您降低成本的最大候选,而商业流量非常适合使用它。缓存的输入令牌读取成本只有新读取的十分之一,而尽管缓存写入大约带来1.25倍的额外开销,一个缓存前缀在第二次使用时就能收回成本。在面对客户的应用中,如果访问量很大,您有一个独特的机会,使用最便宜的默认5分钟缓存过期时间达到非常高的缓存命中率。

我们看到的最好的商业部署缓存命中率在90%–99%之间,这也是从一开始就应该设计的范围。我们的经验显示,在大约10万令牌时,缓存令牌读取也快约1.5到2倍,且随着令牌数量增加,速度几乎线性增长。

缓存是基于前缀的。一个请求从缓存中读取,直到第一个与之前的请求不同的字节为止,因此重要的不仅是上下文中有什么,还包括它的顺序。将一个请求分成三个段,按变化频率排序:

Anthropic 发布电商 Agent 架构与生产实践指南,并开源 commerce-agents 参考实现

这里有两个实现细节需要记住。首先,技能应作为工具结果加载,而不是附加到系统提示中。技能主体随后位于对话前缀中,并与其一起缓存。

其次,在每一轮中向前滚动你的断点:一个请求允许有限数量的断点,因此将最新的断点移动到每一轮用户回合的末尾。每一轮随后从缓存读取累积的历史记录,包括长的工具结果,如搜索响应。

模型大小和努力设置:https://claude.com/blog/claude-model-and-effort-level-in-claude-code 是相同的权衡——智能与延迟和成本之间的权衡——您应该通过测量来选择两者:

衡量每个完成任务的成本,而不是每次模型调用的成本,因为一个更便宜的模型如果需要更多轮次,或者失败率更高,并不意味着更便宜。当结果接近且成本符合每任务经济性和延迟要求时,选择智能。质量是驱动采用和用户留存的关键,并且在模型变得更好的未来6个月内为构建留出空间。

最后,我们讨论让代理顺利通过生产的因素:内存、安全性、评估,以及在组织中扩展工作。

你与客户的关系和互动很重要。记忆让代理能够从上一次对话结束的地方继续,而不是从零开始。三月份提到坚果过敏的购物者在六月不应该再重复这一信息,而每周一检查同三个活动的商家也不需要每次都列出它们。长期记忆,即应该在多次会话中保持的事实,是你需要构建的系统,它有三个部分:事实如何存储、如何写入以及如何读取。

情报判断

Aioga 编辑摘要

Anthropic 发布面向电商智能体开发者的指南及参考实现,内容覆盖架构、延迟与成本、内存、安全、评估和组织扩展,并讨论购物端与商家端两类应用。

背景分析

文章称,Anthropic 过去一年与零售、市场平台、旅行、娱乐和电信团队合作构建基于 Claude 的电商智能体;部分企业客户在使用后观察到购物车变大和卖家运营效率提升。

Aioga 观点

Aioga 判断:这份指南的重点是以单一智能体循环配合技能、工具和评估体系,避免在前端设置意图路由及在后端拆分多个领域智能体,体现了对架构简化和生产治理的重视。

影响与后续

可能影响:开发团队可能参考其单智能体架构、工具化界面组件、提示词缓存和安全规则设计,但文中所述客户表现不足以证明这些方法在不同业务环境中都能产生相同结果。 后续观察:需要关注开源参考实现 anthropics/commerce-agents 的具体设计、评估方法与安全约束,以及相关实践在不同在线目录和业务流程中的适用范围。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: claude.com

来源: Claude:Blog(网页)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-01T16:00:00.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Anthropic 发布电商 Agent 构建指南,基于与零售、旅游、电信等团队的落地经验,核心架构是单个 Claude 在标准 Agent 循环中配合技能与工具,而非按领域拆...

Claude:Blog(网页)2026-09-01T16:00:00.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。