Aioga
AI资讯 / AI资讯
返回 AI资讯

NVIDIA Nemotron 3 Embed Ranks #1 Overall on RTEB, Advancing Agentic Retrieval

Hugging Face:Blog(RSS)Aioga 编辑团队2026-07-16T16:01:21.000Z热度

NVIDIA Nemotron 3 Embed Ranks #1 Overall on RTEB, Advancing Agentic Retrieval。该动态由 Huggi...

AI资讯Hugging Face:Blog(RSS)

今日 AI 情报摘要

NVIDIA Nemotron 3 Embed Ranks #1 Overall on RTEB, Advancing Agentic Retrieval。

该动态由 Hugging Face:Blog(RSS) 发布,Aioga 已同步发布时间、来源和原文入口,并将继续跟踪官方更新与行业反馈。

中文正文 · AI 翻译

评估:检索质量、代理效率与部署权衡:#evaluation-检索质量-代理效率与部署权衡 RTEB 在检索基准中的领先与强劲收益:#rteb-领导力与跨检索基准的强劲提升 为什么更好的检索对代理至关重要:#why-更好的检索对代理至关重要 在Blackwell上用NVFP4扩展检索:#scaling-retrieval-with-nvfp4-on-blackwell 第0天 表现NIM:#day-0-performant-nim我们如何构建Nemotron 3嵌入模型:#how-we-built-the-nemotron-3-embed-models 缩减至1B:#scaling-down-to-1b 企业合作伙伴评估:#enterprise-partner-evaluations 入门:#getting-started 检索在多步代理工作流中至关重要,因为检索不良可能导致代理获取无关上下文、重新查询、浪费令牌预算,并将噪声带入后续推理步骤。

NVIDIA Nemotron 3 Embed Ranks #1 Overall on RTEB, Advancing Agentic Retrieval
NVIDIA Nemotron 3 Embed Ranks #1 Overall on RTEB, Advancing Agentic Retrieval
NVIDIA Nemotron 3 Embed Ranks #1 Overall on RTEB, Advancing Agentic Retrieval
NVIDIA Nemotron 3 Embed Ranks #1 Overall on RTEB, Advancing Agentic Retrieval

今天,我们发布了NVIDIA Nemotron 3 Embed:https://huggingface.co/collections/nvidia/nemotron-3-embed,这是一套开放且商业化的嵌入模型集合,旨在提升检索质量,同时为开发者提供生产规模RAG、代理检索、代码检索和代理内存的实用部署选项。

该收藏包含三种开放模型,实现了准确率-效率曲线上的最先进检索,其中以 8B 型号(位居 RTEB 排行榜第一)和高效 1B 版本为首,专为生产规模部署而设计:

表1。Nemotron 3 嵌入模型可用性与部署矩阵。

:https://cdn-uploads.huggingface.co/production/uploads/697fa5ae089a7f9330c5078f/I-QbjjUGW9tmE2mcDaW2f.png

图1。RTEB 多语言排行榜:https://mteb-leaderboard.hf.space/benchmark/RTEB%28beta%29 截图(2026年7月15日),显示 Nemotron-3-Embed-8B-BF16 排名为 #1。

除了RTEB结果外,Nemotron 3 Embed还引入了适用于企业检索部署的生产级功能集:

我们从三个维度评估Nemotron 3 Embed:检索质量、下游代理效率和部署权衡。8B型号确立了模型系列的质量上限,而1B型BF16和NVFP4变体则将同样以回收为重点的设计带入了低成本、高通量的部署环境。

我们首先在 RTEB 上评估了这些模型:https://huggingface.co/blog/rteb,其中 Nemotron-3-Embed-8B-BF16 排名第一。我们还在 ViDoRe V3:https://huggingface.co/blog/QuentinJG/introducing-vidore-v3 文本,以及 MMTEB:https://arxiv.org/abs/2502.13595 检索和 LongEmbed:https://github.com/dwzhu-pku/longembed 使用平均 NDCG@10 测试了这些模型。

:https://cdn-uploads.huggingface.co/production/uploads/697fa5ae089a7f9330c5078f/_4Rzuu2UMDD1DeHs-TOhP.png

图 2. 使用平均 NDCG@10 对 RTEB、ViDoRe V3 文本、MMTEB 检索和 LongEmbed 的检索准确性进行比较,将 Nemotron 3 Embed 模型与先前的 Nemotron 基线进行比较。

为了在具有代理性的设置中评估检索,我们使用一个搜索代理:https://huggingface.co/blog/nvidia/nemo-retriever-agentic-retrieval,由 Nemotron 3 Ultra 驱动:https://github.com/NVIDIA-NeMo/Nemotron/tree/main/usage-cookbook/Nemotron-3-Ultra,并改变检索系统使用的嵌入模型。更好的检索可以更早返回相关证据,帮助代理避免重复搜索、不必要的推理步骤和额外的上下文检查。我们在 ViDoRe V3、BRIGHT:https://brightbenchmark.github.io/ 和 BrowseComp-Plus:https://huggingface.co/spaces/Tevatron/BrowseComp-Plus 中比较了平均检索准确性与每次查询的估计下游代理令牌成本。

:https://cdn-uploads.huggingface.co/production/uploads/697fa5ae089a7f9330c5078f/v45KGVKGsO_ZS8WW-KUgU.png

图 3. 在 ViDoRe V3、BRIGHT 和 BrowseComp-Plus 中,每次查询的下游代理令牌成本与平均检索准确性比较。

评估说明:搜索代理使用 Nemotron 3 Ultra。下游令牌成本根据 Nemotron 3 Ultra 输入/输出令牌数量,使用 GPT-5.5 定价公式估算。

图 3 显示,更强的检索可以降低下游代理令牌成本。更准确的检索器更早返回相关证据,有助于代理以更少的重复搜索和推理步骤完成任务。在这些评估中,Nemotron 3 Embed 模型改善了代理检索前沿,其中 8B 模型在 ViDoRe V3、BRIGHT 和 BrowseComp-Plus 中提供了最高的平均检索准确性和最低的估计下游令牌成本。

对于高吞吐量的部署,团队通常会选择较小的嵌入模型以满足延迟和成本目标。Nemotron-3-Embed-1B-NVFP4 旨在通过在 NVIDIA Blackwell 架构上使用原生 NVFP4 加速来缩小服务效率与检索质量之间的差距:https://www.nvidia.com/en-us/data-center/technologies/blackwell-architecture/。该模型将线性层的权重和激活量量化为 NVFP4 以实现高效推理,并使用量化感知蒸馏(Quantization-Aware Distillation, QAD)来帮助恢复长输入序列的精度。

:https://cdn-uploads.huggingface.co/production/uploads/697fa5ae089a7f9330c5078f/R1QHlEFRytVBJcvt8lL9i.png

图 4. ViDoRe V3 检索精度与服务效率比较,将 Nemotron-3-Embed-1B-NVFP4 与选定的小型开源嵌入基线进行比较,包括 Qwen3-Embedding-0.6B 和 EmbeddingGemma-300M。

对于生产级别的检索系统,服务栈还需要在真实请求负载下保持效率,覆盖不同的输入序列长度和硬件目标。为了使 Nemotron 3 Embed 在企业规模下高效运行,我们还发布了针对 1B 模型优化的 NVIDIA NIM 微服务。如图 5 所示,基于 Rust 的 Nemotron 3 Embed NIM 在 NVIDIA GB200 和 RTX PRO 6000 GPU 上,在 ISL 为 256 和 1024 时,其表现与 vLLM 检查点相当或更优。

:https://cdn-uploads.huggingface.co/production/uploads/697fa5ae089a7f9330c5078f/ZFfiQHKsv2surfaCBUCkR.png

图 5. Nemotron 3 Embed NIM 的服务性能与 NVIDIA GB200 和 RTX PRO 6000 GPU 上的 vLLM 检查点比较。

Nemotron-3-Embed-8B-BF16 通过将 Ministral-3-8B-Instruct-2512:https://huggingface.co/mistralai/Ministral-3-8B-Instruct-2512 的因果解码器转换为用于全序列检索的双向编码器,从而适配其主干结构。该模型使用网络来源和合成文本对的混合进行对比预训练,然后在精心策划的多语言检索数据集上进行微调,涵盖法律、金融、医疗、商业和教育等领域。该 8B 模型作为旗舰嵌入模型,同时来自同一开发线的早期 8B 教师检查点被用来蒸馏高效的 1B 变体。

1B 模型不是从零开始训练的小型检索器。我们首先将双向适配方案应用于 Ministral-3-3B-Instruct-2512:https://huggingface.co/mistralai/Ministral-3-3B-Instruct-2512 主干网络,以建立 3B 检索器基础,然后通过两轮结构化剪枝和蒸馏进行压缩。

首先,使用 NVIDIA ModelOpt:https://github.com/NVIDIA/Model-Optimizer 的 mcore_minitron 神经架构搜索引擎,将 3B 父模型压缩到 2B 中间版体积。NAS 管线在严格的参数预算下搜索隐藏层宽度、FFN 大小、注意力头数和深度,以识别适用于检索工作负载的高效架构。

得到的 2B 中间模型随后通过 8B 教师检查点进行蒸馏,以恢复排序准确性。我们在多语言、同领域的检索数据混合上使用余弦距离损失与均方误差损失的组合,使学生模型的嵌入与教师模型对齐。

:https://cdn-uploads.huggingface.co/production/uploads/697fa5ae089a7f9330c5078f/U6hbjPbLo70KwwtbAs2np.png

图 6. 剪枝和蒸馏管线将检索器从 3B 基础压缩到最终 1B 生产模型。

这一相同流程,即先 ModelOpt 结构化剪枝,然后 8B 教师蒸馏,在第二次重复时,将 2B 中间模型压缩到最终 1.14B 嵌入模型。最终训练使用渐进的两阶段上下文缩放计划:

下表总结了 Nemotron 3 Embed 模型的核心技术规格和部署目标:

表 2. Nemotron 3 Embed 模型的架构规格及核心推理配置。

企业 ISV、原生 AI 公司、数据平台公司和存储提供商已在代理检索、代理记忆、代码检索和生产推理工作流中评估 Nemotron 3 Embed。

NVIDIA Nemotron 3 Embed 以开放权重和开源训练方案发布,使组织能够完全控制检索模型在生产 AI 应用中的定制和部署方式。

开发者可以使用最适合其工作流的部署选项开始使用:

对于需要领域适配或减少占用的工作负载,我们还开源了 NVIDIA NeMo AutoModel:https://github.com/nvidia-nemo/automodel 训练示例:

例如,在 NV Docs:https://huggingface.co/datasets/nvidia/Retrieval-Synthetic-NVDocs-v1 评测中,对 Nemotron-3-Embed-1B-BF16 进行微调,使 NDCG@10 从 56.7% 提升到 63.3%(+11.6%),Recall@5 从 56.1% 提升到 62.8%(+11.9%)。

无论你是在构建企业搜索、生产 RAG、智能体记忆、代码检索,还是自治 AI 系统,NVIDIA Nemotron 3 Embed 都提供灵活的部署选项——从 Hugging Face 上的开源模型,到全托管的 AI 云平台和 NVIDIA NIM 微服务。

探索这些模型,在你偏好的平台上部署,并告诉我们你正在构建什么。

深度研究智能体的公平与解耦评测

恭喜获得 LMEB 的 SOTA!🎉

合并在 https://github.com/embeddings-benchmark/results/pull/617 的结果显示出卓越的 LMEB 性能:https://github.com/embeddings-benchmark/results/pull/617

Nemotron-3-Embed-8B-BF16:64.4,新的整体 SOTA。Nemotron-3-Embed-1B-BF16:61.5,在约 1B 规模上刷新 SOTA。

LMEB 排行榜:https://mteb-leaderboard.hf.space/benchmark/LMEB 似乎正在等待同步。

现在已上线!感谢你在那里评测我们的模型!

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:NVIDIA 发布开源嵌入模型系列 Nemotron 3 Embed,包含三个模型。 Aioga 将其归入「AI资讯」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: huggingface.co

来源: Hugging Face:Blog(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-16T16:01:21.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

NVIDIA Nemotron 3 Embed Ranks #1 Overall on RTEB, Advancing Agentic Retrieval。该动态由 Huggi...

Hugging Face:Blog(RSS)2026-07-16T16:01:21.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。