Aioga
AI资讯 / 行业动态
返回 AI资讯

LangSmith 在医疗 AI 中的常见用例:构建可靠性层

LangChain:Blog(RSS)Aioga 编辑团队2026-09-22T17:08:51.000Z热度 58

LangSmith 可帮助医疗 AI 团队把临床审查转化为可复用的评估器、数据集和发布门禁,从而让 AI 在生产环境中更安全地运行。

行业动态LangChain:Blog(RSS)

今日 AI 情报摘要

LangSmith 可帮助医疗 AI 团队把临床审查转化为可复用的评估器、数据集和发布门禁,从而让 AI 在生产环境中更安全地运行。

中文正文 · AI 翻译

在医疗保健中,判断一个 AI 系统是否运行正确的最佳人选是那些其设计目的是为了保护其时间的人。临床医生可以快速判断生成的记录是否正确标注了症状,或者患者是否被推荐了最合适的护理等级。但他们无法无限期地在成千上万个病例中执行这种审核。在大规模情况下,专家验证成为限制因素。

医疗团队以不同方式应对这一挑战,但许多团队共享一个原则:将临床审查视为基础设施,而非经常性的运营成本。本文博客介绍了两个以不同方式构建 AI 医疗产品的组织如何在评估实践上趋同。通过使用 LangSmith:https://docs.langchain.com/langsmith/observability,他们将专家输入转化为持久资产,例如标注数据集、校准评估器和自动发布门。目标不是消除人工判断,而是使其价值可以复利增长。

医疗 AI 代理在各种工作流程中运行,例如患者护理决策和就诊记录。

Included Health 构建了 Dot,这是一个由 LangGraph:https://docs.langchain.com/oss/python/langgraph/overview 和 Deep Agents:https://docs.langchain.com/oss/python/deepagents/overview 提供支持的 AI 指导。它可以解读模糊的会员需求,回答保险和计费相关问题,将人引导至合适的护理,并检测紧急情况。关于扫描是否涵盖的问题可能在数次交互后显示,会员实际上需要与初级保健医生交谈。评估 Dot 意味着既要检查其准确性,也要确认它是否利用会员的完整背景来推荐安全、适当的下一步措施。

Abridge 将患者和临床医生的对话转换为临床记录。在获得患者同意的情况下,医生会记录就诊内容,而 Abridge 则将对话转换为一份记录,成为纵向健康记录的一部分,并支持计费。在这种情况下,归属至关重要。如果将患者的观察呈现为医生的结论,症状可能成为可计费的诊断。幻觉则带来了不同的风险:从未开过的药物或剂量可能进入记录。一份值得信赖的记录必须保留是谁说了什么,捕捉临床上重要的内容,并且不引入对话中没有支持的内容。

这些系统以不同方式出错,但两支团队都使用 LangSmith 来应对相同的约束:准确性由工程团队之外的人来确定,而该人的时间往往是系统中最稀缺的资源。

这使得专家审查既不可或缺,又可能成为瓶颈。正如 Abridge 团队所说:“信任是逐滴赢得,却一桶桶失去。”目标是让每一次专家判断在未来的测试、发布和迭代中可重复使用。

在临床判断被纳入自动评估之前,团队必须首先明确定义专家究竟在评估什么。三个属性使得这种判断难以规模化推广。

真实情况很少是单一的。临床记录没有一个标准的唯一形式。内容的归属因专业、就诊情况和临床医生而异,合理的专家可能会有不同意见。参考记录很有用,但将单一参考作为唯一正确答案可能会惩罚有效的变异,同时仍可能漏掉临床上重要的错误。

正确的不作为也很重要。医疗团队必须评估系统的行为是否正确,以及它是否识别出何时不该采取行动。例如,Included Health 的审查员会检查紧急防护措施在适当时触发,并在良性情况下保持不活跃。例如,Abridge 会测试其代理是否保持在自身界限内,并选择临床医生预期的工具。

审查员的专业知识是规格的一部分。Abridge 会事先确定评估是否需要具有执照的主治医生或特定专家。一个评审员的好坏取决于用来校准的判断质量。

这些都不使临床判断无法自动化。它只是定义了负责任地进行自动化的要求:对有效差异的容忍、关注未发生的情况,以及每个标签背后的正确专业知识。

一旦团队定义了需要保留的判断,他们就可以开始将专业知识转化为基础设施。Abridge 将临床医生的输入转换为带标签的数据集和经过校准的评审员,这些评审员在个人审查结束后仍继续工作。

Abridge 从临床医生和用户反馈中已知的失败模式开始。团队按普遍性和严重性对这些模式进行排名,将其分组为准确性、合规性、风格和完整性等类别,并为每个类别构建一个独立的评审员。评估者不是产生一个通用的质量分数,而是针对笔记可能出错的具体方式进行测试。

时间节省来自于自动化处理他们提供判断后的步骤。之前,临床医生编写注释指南并标注病例,然后有人手动调整评审员提示,直到其分数与这些标签匹配。现在,Abridge 将相同的指南和示例输入到自动提示优化框架中,从而生成评审员。

由于没有单一参考可以涵盖所有有效笔记,Abridge 结合了两种具有互补优势的方法:

两者共同在广度和精准度之间达到平衡:一种方法提供覆盖所有病例的可扩展性,另一种方法捕捉临床审查所需的专业细微差别。

优化后的评审员仍必须通过临床医生注释进行验证。LangSmith 的 Align Evaluator:https://docs.langchain.com/langsmith/improve-judge-evaluator-feedback 为团队提供了一个界面,用于比较两者并调查分歧。Abridge 还单独要求注释者解释他们的决定,即使输出是正确的。这些解释有助于解决不一致并确认标签反映了认真审查。

最终结果是一个可以检查、重新校准和重复使用的评估系统。通过将个人判断转化为持久的评审员,团队将稀缺的临床专业知识保留用于最有价值的病例。生产审查提供新的病例和反馈,使这些标准保持最新。

经过校准的评审者会应用团队已经捕捉到的判断。生产审查提供下一轮判断,揭示系统在真实对话中的表现,并生成用于修正的证据。

Included Health 展示了这些新证据如何进入循环。对话进入 LangSmith 注释队列:https://docs.langchain.com/langsmith/annotation-queues,由临床评审员评估 Dot 是否将成员引导至正确的护理环境,其紧急防护措施是否运作得当,以及该案例是否需要后续处理。

这些决策变成结构化标签,导出到 Included Health 的数据仓库,数据科学团队使用这些数据构建运营仪表板。它们也反馈到控制 Dot 导航成员的技能定义中。每次审查使用一次,却被三次利用。

结果是一个强大的反馈循环。临床判断变成数据,数据指导产品变更,这些变更在下次发布前根据相同标准进行测试。每次审查都对当前案例和系统的未来行为有所贡献。

在发布时,这个反馈循环会带来回报。团队不必从头评估每个候选变更,而可以用已捕获的证据进行测试。

在 Abridge,模型变更通过逐步更现实的阶段进行:离线评估、对历史就诊记录的回测、有限的 A/B 测试、全面发布以及持续的生产监控。每个阶段都增加不同类型的证据。

A/B 测试是此过程中最不寻常的步骤。一些 Abridge 的合作伙伴同意成为静默发布中首批 10% 到 15% 的客户。这让 Abridge 能观察自动化评审无法提供的信号:临床医生是否修改生成的记录,他们如何评分,以及他们提供了什么定性反馈。离线评估确定变更是否准备好进行有限曝光;生产行为决定是否扩大发布。该过程将 Abridge 的发布周期从一两个月缩短到数天。

Included Health 将相同的原则应用于架构变更。将 Dot 的 supergraph 移动到 Deep Agents 影响了四个产品团队,这些团队都对破坏性变更保持警惕。团队运行了现有的多回合模拟测试套件,确认性能保持稳定,并在不到两周的时间内完成了迁移,没有出现显著的回归。

在这两种情况下,发布信心都是累积的。团队不必在每次变更时重新建立信任,而可以基于他们已经收集的证据继续构建。

只有当系统在真正用户中表现可靠时,更快的发布周期才有意义。Included Health 从三个维度测量性能:采用率、引导质量和安全性。

每个指标回答不同的问题:成员会使用该产品吗?它能将他们引导到合适的护理吗?它能识别需要紧急关注的情况吗?将这些指标综合来看,可以为团队提供生产可靠性的更完整图景。

在 Dot 发布后,Included Health 报告聊天参与度提升了 75%。在经过评分的对话中,临床医生对 Dot 的护理建议的认可率仍保持在团队设定的 95% 目标以上,临床审核显示 Dot 能识别超过 99% 的高风险情况。

在 Abridge,带标签的就诊记录用于校准针对未来版本的评审;在 Included Health,临床标签的有效性超越了生成它们的对话。这些文档仍需复审和重新校准,但其背后的专家判断不再仅用于单一决策。

使临床判断可重复使用的相同文档——就诊记录痕迹、对话历史和临床标注——也可能包含受保护的健康信息。一旦团队开始存储和重用这些信息,安全性和部署架构就成为评估设计的一部分。

Abridge 将自托管、访问控制和可审计性视为其评估基础设施的要求。他们还会在使用对话数据进行学习之前,移除其中的身份信息。这些不是在评估管道构建完成后再添加的控制措施,而是决定了最初哪些数据可以进入管道的设计因素。

LangSmith 支持托管云:https://docs.langchain.com/langsmith/cloud、自带云:https://docs.langchain.com/langsmith/byoc 和自托管:https://docs.langchain.com/langsmith/self-hosted 部署。团队必须决定评估数据将存储在哪里,谁可以访问,适用哪些审计和保留控制,以及如何处理包含 PHI 的追踪记录。

信任在医疗 AI 中建立得很慢。它随着每一次正确处理的交互、每一个安全防护以及每一次在到达用户之前被发现的回归而增长。然而,一次逃过这些检查的变更就可能将其摧毁。

医疗团队通过确保每一次细致的审查在审查完成后仍能持续有效,从而快速推进工作。

欲了解完整的客户故事,请观看《使用 LangGraph 构建临床 AI 代理:Abridge 的高风险医疗评估堆栈》:https://www.youtube.com/watch?v=mxweSHetuN8&t=356s,并阅读《Included Health 如何使用 Deep Agents 和 LangGraph 构建医疗导航的联合代理》:https://www.langchain.com/blog/how-included-health-built-federated-agents-for-healthcare-navigation-with-deep-agents-and-langgraph。

LangSmith,我们的代理工程平台,帮助开发者调试每一个代理决策、评估变更,并一键部署。

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:LangSmith 可帮助医疗 AI 团队把临床审查转化为可复用的评估器、数据集和发布门禁,从而让 AI 在生产环境中更安全地运行。 Aioga 将其归入「行业动态」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:公司与行业类动态需要放在竞争格局、商业化路径、资本信号和监管环境中观察,单条公告不能代表最终结果。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文件、合作落地、收入或用户信号、竞品动作和监管后续。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: langchain.com

来源: LangChain:Blog(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-22T17:08:51.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

LangSmith 可帮助医疗 AI 团队把临床审查转化为可复用的评估器、数据集和发布门禁,从而让 AI 在生产环境中更安全地运行。

LangChain:Blog(RSS)2026-09-22T17:08:51.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。