Aioga
AI资讯 / 行业动态
返回 AI资讯

RAG 系统效果为何取决于嵌入模型:ByteByteGo 图解检索机制与选型要点

ByteByteGo(RSS)Aioga 编辑团队2026-09-02T15:31:12.000Z热度 58

ByteByteGo 发文解析 RAG 系统中嵌入模型的关键作用,指出语言模型再强也无法弥补错误检索,因为嵌入模型决定了哪些文本进入上下文。文章图解了索引与检索两个阶段的工作流...

行业动态ByteByteGo(RSS)

今日 AI 情报摘要

ByteByteGo 发文解析 RAG 系统中嵌入模型的关键作用,指出语言模型再强也无法弥补错误检索,因为嵌入模型决定了哪些文本进入上下文。

文章图解了索引与检索两个阶段的工作流程,列举了语义相似但答非所问的多种失败模式,包括否定句、版本差异和数字标识等,并说明更换嵌入模型需要全量重建向量、索引和权限,成本高昂,类似蓝绿部署。

中文正文 · AI 翻译

GlobalFoundries 的首席信息官对此有一个直接的看法:在底层数据实时且受到治理之前,你无法拥有 AI 代理。

因此,他首先重建了那一层——一个平台在三个大洲的晶圆厂之间传输数据,身份、权限和审计轨迹只处理一次,而不是每个项目都单独处理。随后,AI 代理也随之在 IT、采购和其他业务职能中部署。

加入我们,参加 9 月 10 日的活动,了解他是如何做到的,并现场提问。

保留您的座位:https://go.bytebytego.com/Redpanda_090226

RAG,即检索增强生成技术,正在帮助许多公司构建符合其特定需求的聊天机器人。然而,任何 RAG 系统的成功都取决于所使用的嵌入模型(负责将词语转换为数字的模型)的质量。

比如某个产品的文档规定,年度订阅只能在 30 天内退款。使用 RAG 构建的聊天机器人应根据这一支持文档回答客户问题。然而,当客户询问 45 天前购买的订阅是否可以退款时,聊天机器人却自信地回答“可以”。

为什么聊天机器人会在这个看似简单的问题上出错?

答案在于嵌入模型的行为,它有点像 AI 的翻译器。这个模型控制着答案搜索过程,与生成实际答案的语言模型不同。无论语言模型多么优秀,如果嵌入模型没有正确工作,都无法给出正确答案。

在本文中,我们将探讨嵌入模型在 RAG 设置中的工作原理,以及为什么它是系统中如此关键的一部分。我们将涵盖以下内容:

为什么RAG系统在回答之前会进行搜索

嵌入如何使按语义搜索成为可能

为什么相关信息不总是正确信息

为什么更好的语言模型无法弥补检索不佳的问题

是什么使嵌入模型适合 RAG 系统

如何在不盲目信任基准分数的情况下比较嵌入模型

在商业 API 和本地运行模型之间进行选择

为什么以后更换嵌入模型会变得昂贵

玛特里俄什卡嵌入如何提供对向量大小的更多控制

通用语言模型的知识取决于它在训练期间学习的内容。你不能指望这样的模型了解某个公司的私有文档、政策或内部源代码。它甚至不会知道公司在模型训练之后可能发布的最新信息。从技术上讲,每次信息发生变化时重新训练语言模型都是相当昂贵的。

这就是RAG(检索增强生成)发挥作用的地方。它将生成语言的能力与从存储知识池中查找相关信息分开。语言模型负责理解和写作部分,而外部知识集合则包含应在回答中使用的实际信息。

RAG的工作分为两个不同的阶段:索引和检索。

在索引阶段,系统准备文档:

它收集来自各种来源的文档(文件、网站、数据库等)。

它将文本划分为称为“块”的较小段落。

它将每个块发送到嵌入模型中。

它将生成的向量与原始文本和元数据一起存储。

元数据可能包含文档标题、发布日期、语言、版本等信息。

在检索阶段,系统按照以下步骤操作:

它将问题通过相同的嵌入模型发送。

它搜索与问题向量接近的文档向量。

它检索少量块。例如,最好的5块或类似数量。

它对这些块进行筛选和重新排序,并将它们放入语言模型的提示中。

最后,语言模型使用提供的提示撰写答案。

从这一切中得到的主要结论是,RAG 并不会将整个文档集合放入模型的提示中。这是因为这样会超过模型的上下文限制,并填充无关的信息。它也会增加成本和延迟。由 RAG 的嵌入模型主导的检索阶段,起到了选择步骤的作用,将成千上万的段落减少到语言模型可以检查的一小部分。

嵌入基本上只是表示一段文本的一列数字。一个实际的嵌入可能包含如 384、768、1024 或几千个数字。

这些单独的数字没有简单的标签来描述它们的含义。你不能看着某个值就说这意味着“订阅”,而另一个意味着“退款”。整体含义是分布在整个向量中的。可以把向量想象成数学空间中一个点的坐标。嵌入模型经过训练,将含义相关的文本放置在这个数学向量空间中彼此接近的位置。

这就是系统能够将像“yearly plan”“年计划”这样的术语与“annual subscription”“年度订阅”联系起来的方式。它也可以将复杂短语如“get my money back”“拿回我的钱”与“receive a refund”“收到退款”联系起来。相比之下,当问题和文档使用不同的词汇来解释同一概念时,关键字搜索会遇到困难。但是嵌入模型尝试比较文本中的概念,而不仅仅是词汇。背后的常用技术有余弦相似度、点积和欧几里得距离。简而言之,嵌入模型的目标是生成一个数学分数,表示两个向量彼此的接近程度。

嵌入模型通常返回前 k 个结果。这称为 top-k 检索。例如,如果 k 是 5,则检索返回排名前 5 的块。

嵌入模型还支持查询和文档形式不同的非对称检索。查询可能是一个简短的问题,而匹配的文档是一段较长的解释性内容。例如,查询可能是:“年订阅在 6 周后可以退款吗?”答案段落是这样的陈述:“年度订阅可在 30 天内退款。”

一个训练用来比较相似句子的嵌入模型,可能不如一个训练用来将问题与相关段落连接的模型表现得好。总而言之,嵌入模型定义了RAG系统认为相似的内容。

嵌入模型被训练来识别语义相似性。但RAG系统需要更严格的东西。它需要找到可能包含回答特定问题所需信息的段落。问题在于,一个段落可能与问题相关,但并没有明确回答问题。

例如,一个客户问退款需要多长时间,可能会收到一个解释谁有资格退款的段落。两条信息都涉及退款,但只有一条谈及实际处理时间。请参见下图,显示语义搜索空间的概念。

在这种情况下,可能出现多种失败模式:

主题相似,问题不同:查询问“批准的退款需要多长时间到帐?”检索到的段落说:“购买可以在30天内退款。”该段落与退款相关,但没有回答时间问题。

相同词语,不同实体:查询问“如何更改账单地址”。检索到的段落解释了如何更改账户的电子邮件地址。两者都在谈账户详情的更改,但它们指的是完全不同的字段。

否定:考虑这两个段落:“管理员可以删除归档项目”和“管理员不能删除归档项目”。大部分词语是相同的。这意味着它们的嵌入可能很接近。但如你所见,它们的含义完全相反。

版本和日期:知识库可能包含旧政策及其替代版本。文本几乎相同,除了日期、限制或价格。嵌入无法自动判断哪份文档是权威的。可能需要通过元数据过滤器或版本管理规则明确排除过时内容。

数值标识符:两句话“年订阅可以在30天内退款”和“年订阅可以在60天内退款”在语义上非常相似。但其中一个数字不同,这决定了最终答案。

领域特定含义:通用模型可能会误解专业词汇。例如,“capture”在日常语言中有一个意思,而在支付处理中有一个特定意思。类似地,单词“port”可以指网络、硬件或在不同平台间迁移软件。用于一般网页文本的最佳模型可能不是法律合同、医疗报告、财务文件或源代码的最佳模型。

多部分问题:客户可能会提出多部分问题。例如,可能有这样一个问题:“我可以取消订阅吗,退款需要多长时间?”回答这个问题至少需要两段内容。一段可能解释取消资格,另一段可能解释处理时间。检索到的仅包含一个主题的模型可能会生成不完整的答案。

在RAG系统中,语言模型只看到用户的问题和选定的段落。它不会看到存储在向量数据库中的每个文档。

例如,如果年度退款政策文档没有被检索到,语言模型就不会知道缺失的信息。更强大的语言模型可能会识别检索到的信息中不包含答案。这是有用的,因为它至少可以选择不提供无效信息。然而,这种检索失败的场景也可能产生几种结果:

模型根据其通用训练知识作答。

它错误地应用了相关的段落。

它表示可用的信息不足。

它错误地组合了冲突的段落。

诸如“仅从提供的文档中回答”的提示可以减少无依据的答案。但它无法让正确的文档神奇地出现。

这就是为什么在RAG系统开发过程中测试和调试非常关键。开发人员需要在更改提示或更换语言模型之前检查检索到的块。在生成阶段解决检索问题需要花费更多时间。

选择嵌入模型时最重要的关注点应是检索性能。模型应非常擅长将简短问题与可能包含答案的长句子关联起来。

以下特征很重要:

情报判断

Aioga 编辑摘要

ByteByteGo 指出,RAG 系统的效果取决于嵌入模型质量。嵌入模型负责将文本转换为数值表示并控制答案检索过程;如果检索结果错误,即使语言模型能力较强,也无法据此给出正确答案。

背景分析

文章以订阅退款问答为例:文档规定年度订阅仅可在购买后 30 天内退款,但面对购买 45 天后能否退款的问题,聊天机器人仍回答“可以”。正文将这一错误归因于嵌入模型未能正确完成检索。

Aioga 观点

Aioga 判断:嵌入模型并非 RAG 流程中的附属组件,而是决定语言模型能够看到哪些依据的关键环节。模型选型时,值得关注其对否定句、版本差异和数字标识等内容的区分表现。

影响与后续

可能影响:更换嵌入模型可能需要全量重建向量、索引和权限,实施成本需要在选型阶段提前评估。语言模型表现较强不代表检索结果可靠,也不足以弥补错误上下文带来的回答偏差。 后续观察:建议持续关注不同嵌入模型在否定表达、版本信息和数字标识场景中的检索结果,并核查模型更换时向量、索引与权限重建的实际成本及部署安排。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: blog.bytebytego.com

来源: ByteByteGo(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-02T15:31:12.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

ByteByteGo 发文解析 RAG 系统中嵌入模型的关键作用,指出语言模型再强也无法弥补错误检索,因为嵌入模型决定了哪些文本进入上下文。文章图解了索引与检索两个阶段的工作流...

ByteByteGo(RSS)2026-09-02T15:31:12.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。