Aioga
AI资讯 / 技巧观点
返回 AI资讯

如何用 LangSmith 评估语音智能体

LangChain:Blog(RSS)Aioga 编辑团队2026-08-04T17:15:48.000Z热度 64

LangChain 官方博客介绍如何用 LangSmith 评估语音智能体,覆盖执行、结果与来电者体验三个层面。评估手段包括 LangSmith traces、代码评估器、LL...

技巧观点LangChain:Blog(RSS)

今日 AI 情报摘要

LangChain 官方博客介绍如何用 LangSmith 评估语音智能体,覆盖执行、结果与来电者体验三个层面。

评估手段包括 LangSmith traces、代码评估器、LLM judges 和人工审查,帮助开发者系统化验证语音智能体的实际表现。

中文正文 · AI 翻译

构建语音代理很困难,因为一个好的代理必须在对话时感觉自然,能够解决用户的问题,并实现其设计的业务目标。

一次通话可能包括代理方的长时间停顿,听起来很尴尬,但仍能解决用户的问题。或者,代理可能完全按照指示操作,却因为缺乏回答用户请求所需的上下文而让客户失望。

这两种情景都显示了改进的空间。评估帮助团队识别这些弱点,并衡量更改是否真正提高了代理的表现。

这就是为什么我们建议从三个维度评估语音代理的原因:

这些维度是相关的,但不可互换。要进行良好评估,仅有文本记录是不够的。在 LangSmith 中,你可以追踪完整的交互、通过多名评估者打分、检查录音和工具使用活动,并比较不同时间的变化。

执行力衡量代理是否遵循其设计。

执行力涵盖最终响应以及代理生成响应的过程。一名语音代理可能最终给出了正确答案,同时调用了不必要的工具、跳过了必要的确认,或访问了不应使用的信息。对于单次调用,这可能没问题,但在多次交互中,这些错误可能导致不良的用户体验。

一些执行要求可以通过简单规则进行评估。对于一个预约调度代理,你可以检查是否:

当正确行为可以明确定义时,这些检查效果很好。它们还快速且成本低,因为不需要额外调用模型。

在 LangSmith 中,这就是代码评估器特别有用的地方:https://docs.langchain.com/langsmith/evaluation-types#code-evaluators。你可以跟踪调用,然后根据跟踪检查确定性规则。

其他要求依赖于意义而非具体值。LLM 评审可以评估代理是否:

当任务范围窄、评判标准明确时,LLM 评审效果最佳。一个广泛的问题如“这个回答是否好?”会产生噪声结果。具体的评分标准更易重复操作:

在 LangSmith 中,这就是 LLM 裁判可以根据精确的评估标准对对话进行评分的地方:https://docs.langchain.com/langsmith/evaluation-types#llm-as-a-judge。例如,你可以评分代理是否在继续之前询问了缺失的时区,或是否正确处理了涉及政策敏感的请求。

LLM 裁判之所以有效,是因为狭窄的评估任务比生成原始回复更容易,尤其是在裁判收到明确的评分标准和完整的追踪记录时。

假设一个日程安排代理被指示收集日期和时间、检查可用性并预约。当它完成所有三步,但工作流程从未告知它确认呼叫者的时区,因此预约被安排在错误的时间。在这种情况下,代理准确地遵循了指示,但仍未满足用户需求。这种区别将指令遵循与结果有效性区分开来,对于评估语音代理是否有效至关重要。

LLM 裁判可以帮助判断互动是否达到了预期的目标:

这些评估指向了适当的干预措施。失败可能需要更新知识库、添加工具、澄清指令,或为开发者未预料到的场景定义行为。

例如,在 LangSmith 中,你可以对一次日程安排对话进行评分,以判断用户在拨打代理电话预约后是否完成了预约。

生产中的呼叫也可以间接揭示失败。呼叫者可能会说:“我之前打过电话,但预约定错时间了。” 这一信号可以揭示原始对话中未显而易见的结果失败。

尽可能地,应衡量下游结果,而不仅仅从对话中推断成功。日程安排代理应根据预约记录进行评估,支持代理应根据解决情况和票据重新开启数据进行评估,转接代理应根据呼叫者是否到达正确的目的地进行评估。

有用的结果指标可能包括预约成功率、解决率、升级率、转接成功率、问题重新开启率、转化率或放弃率。正确的指标取决于工作流程。

在 LangSmith 中,您可以将这些业务信号连接回原始追踪,并根据实际结果对对话进行评分。这使得更容易判断新的提示是否改善了对话流程,同时也提升了实际的业务成果。

语音代理代表您的企业与客户进行交流。来电者不仅体验代理所说的话,还会感受到它的响应速度、发音清晰度以及在对话中的自然程度。一个正确有效的代理仍然可能是一个糟糕的语音代理。

延迟是语音交互中最显著的特征之一。主要的用户感知指标通常是回合结束延迟:从来电者回合结束到代理开始响应的时间。

典型的语音处理流程包括语音活动检测、语音转文本、模型推理、工具调用和文本转语音。分别测量每个组件有助于识别延迟来自转录、推理、外部系统还是音频生成。

相同的尴尬停顿可能有不同的原因。模型可能运行缓慢,工具可能被阻塞,或者语音生成可能要等到整个响应生成完毕才开始。LangSmith 追踪可以帮助识别哪个组件导致了延迟,而不是将延迟视为一个单一的黑箱数字。

自然性不仅包括生成的语音是否听起来自然。它可以包括:

这些属性可以由支持音频的模型评分。仅依赖文字记录的评判者可以评估措辞是否清晰或友好,但无法可靠判断代理的语音是否清晰或友好。关于语音表达的评价需要访问音频。

在 LangSmith 中,这正是具备音频感知能力的 LLM 评审者(audio-aware LLM judges)发挥用处的地方:https://docs.langchain.com/langsmith/evaluation-types#llm-as-a-judge。例如,您可以评分代理的发音是否易懂,是否打断过于频繁,或语速是否对支持电话来说感觉自然。

对话结构可以揭示可用性问题。有用的信号包括:

这些信号需要上下文。当请求模糊时,提出澄清性问题可以被视为良好行为。问题在于不必要的澄清、重复澄清,或未使用呼叫者已提供的信息。

同样,打断并不自动意味着不好。呼叫者希望能够打断语音代理。更有意义的问题是代理是否停止了讲话、保留了相关上下文,并做出了恰当的回应。

在LangSmith中,你也可以将这些转化为实际的评估工具。例如,你可以评分通话中是否出现了重复澄清循环、过长的停顿,或打断后恢复失败的情况。

没有单一的评估方法适用于所有维度。请选择基于所需证据的方法:

方法 最适合 示例 代码评估器 明确、确定性、可机器验证的行为 工具顺序、必需参数、延迟阈值 LLM评审 狭义语义标准 呼叫者的请求是否得到解决 音频感知LLM评审 录音中存在的属性 发音、语速、重叠讲话 业务系统检查 现实世界结果 重新开启的工单、完成的转接、参加的会议

人工审核对于模糊和高风险行为仍然很重要。审核者可以判断书面政策是否清晰,自动评估工具是否正确应用,以及异常对话是否属于合理例外。

人工标签还可以帮助校准LLM评审。如果审核者经常与评估器意见不一致,说明其评分标准或提示可能需要调整。如果审核者之间互相意见不一致,说明评估标准本身可能定义不够明确。

在LangSmith中,人工审核通过注释队列得到支持:https://docs.langchain.com/langsmith/annotation-queues:使用它们来验证评估器、优化评分标准,并改进下一版本基于追踪的工作流。

在LangSmith中,你可以将代表性对话转化为数据集,并为每种场景定义预期行为。一个有用的数据集可能包括:

然后,你可以通过实验来比较提示、模型、工具或工作流的变化在同一数据集上的表现。

由于执行、结果和体验保持分离,实验可以显示出一个新的提示词在提高指令遵循度的同时降低解决率。它可能表明工作流程的变化增加了成功预订的数量,同时引入了更多的政策违规,或者更快的模型降低了延迟,但处理中断的可靠性较差。这些权衡在单一的综合质量评分中消失。

生产评估还可以揭示单个通话审查可能遗漏的模式。评估者可以将结构化反馈附加到跟踪记录上,包括意图、解决状态、失败原因、情绪或对话摩擦指标。这些标签使得有可能在许多对话中识别常见意图、反复出现的失败和未满足的客户需求。

一个实用的工作流程看起来是这样的:

使用 LangSmith,您可以在不同框架和平台上始终如一地对语音代理进行评分,因此即使底层堆栈发生变化,也能比较其行为。

语音代理同时是一个软件系统、一个目标导向的工作流程和一种客户体验。要了解代理是否真正有效,而不仅仅是知道通话完成了,需要对三者进行评估。

我们的代理工程平台 LangSmith 帮助开发者调试每一个代理决策,评估更改,并一键部署。

情报判断

Aioga 编辑摘要

LangChain 官方博客提出,语音智能体应从执行过程、任务结果和来电者体验三个维度接受评估,并结合 LangSmith traces、代码评估器、LLM judges、录音检查与人工审查开展验证。

背景分析

语音智能体即使最终解决问题,也可能出现停顿过长、调用不必要工具或遗漏必要确认等情况;反之,严格遵循指令也可能因缺少所需上下文而无法满足用户请求,因此仅看对话文本并不足够。

Aioga 观点

Aioga 判断,这套框架的核心价值在于把“是否按设计执行”“是否完成预期结果”和“交流体验是否自然”分开衡量,避免团队用单一结果掩盖执行路径或体验层面的缺陷。

影响与后续

值得关注的是,多维评估可能帮助开发团队定位不同类型的问题,并通过比较变更前后的表现判断改动是否有效。完整交互轨迹、工具活动和录音也可能为问题复查提供更多依据。 可先为语音智能体分别定义执行、结果和来电者体验的检查项,再用规则或代码评估明确要求,并结合 LLM judges 与人工审查处理难以规则化的部分,持续比较调整前后的表现。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: langchain.com

来源: LangChain:Blog(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-08-04T17:15:48.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

LangChain 官方博客介绍如何用 LangSmith 评估语音智能体,覆盖执行、结果与来电者体验三个层面。评估手段包括 LangSmith traces、代码评估器、LL...

LangChain:Blog(RSS)2026-08-04T17:15:48.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。