Aioga
AI资讯 / 模型更新
返回 AI资讯

NVIDIA 发布 Nemotron 3 Embed 系列,8B 版本在 RTEB 基准上排名第一

MarkTechPost(RSS)Aioga 编辑团队2026-07-17T07:53:02.000Z热度 70

NVIDIA 发布 Nemotron 3 Embed 系列,包含三个开源 checkpoint,其中 8B-BF16 版本在 RTEB 基准上以 78.46 的平均 NDCG@...

模型更新MarkTechPost(RSS)

今日 AI 情报摘要

NVIDIA 发布 Nemotron 3 Embed 系列,包含三个开源 checkpoint,其中 8B-BF16 版本在 RTEB 基准上以 78.46 的平均 NDCG@10 排名第一。

1B-NVFP4 版本在 Blackwell 上吞吐量比 BF16 高 2 倍,精度保留 99.5%,所有模型最大序列长度 32,768 tokens。

中文正文 · AI 翻译

嵌入模型决定了代理能看到哪些段落。NVIDIA 发布了 Nemotron 3 Embed 模型:https://huggingface.co/collections/nvidia/nemotron-3-embed 用于在该层工作。它针对生产规模的 RAG、智能检索、代码检索和代理记忆。

模型集合包括三个开放检查点。Nemotron-3-Embed-8B-BF16 是优先考虑准确性的选项。Nemotron-3-Embed-1B-BF16 将相同设计压缩到更小的规模。Nemotron-3-Embed-1B-NVFP4 是经过 Blackwell 优化的 4 位路径。

这三者都是使用双向注意力掩码训练的 Transformer 编码器。最终嵌入来自对 token 级表示的平均池化。所有检查点的最大序列长度为 32,768 个 token。

每个模型在 34 种语言中进行了评估。三者均遵循 OpenMDW 许可证协议,第 1.1 版 (OpenMDW-1.1)。值得注意的是,基础模型为 Mistral 模型。8B 版本基于 Ministral-3-8B-Instruct-2512 构建。两个 1B 变体使用 Ministral-3-3B-Instruct-2512。

Nemotron-3-Embed-8B-BF16 在 RTEB 上总体排名第 1:https://mteb-leaderboard.hf.space/benchmark/RTEB(beta) (截止至 2026 年 7 月 17 日),即检索嵌入基准。评估覆盖其 16 个公开任务。下列每个数值均为 NDCG@10 的平均值,模型序列长度为 4096。

值得注意的两个差距。1B 在 RTEB 上比上一代基线 llama-nemotron-embed-vl-1b-v2 提升 10.4 分。另一方面,NVFP4 与其 BF16 父模型相比损失 0.38 RTEB 分,相当于保持率 99.5%。

这些 1B 分数来自压缩流程,而非更小规模的训练。父模型为 nemotron-3-embed-3b,经两轮迭代修剪和蒸馏得到。

首先,3B 父模型使用 NVIDIA ModelOpt mcore_minitron 神经架构搜索 (NAS) 修剪至 2B。搜索涵盖隐藏层宽度、FFN 大小、注意力头数和深度,然后从前 10 名 Pareto 前沿中选择最佳候选。50k 的域内校准语料对这些候选进行评分。

接下来,从微调后的 8B 嵌入教师模型蒸馏得到 2B 模型。蒸馏结合了余弦距离损失 (COS) 和均方误差损失 (MSE)。数据混合为多语言和域内数据。最后,同样的流程重复,生成 1.14B 检查点。

压缩然后继续进入服务格式。量化只影响线性层的权重和激活,目标数据类型为 NVFP4。研究团队使用了 nvidia-modelopt v0.45.0。随后进行了量化感知蒸馏(QAD),主要用于恢复长输入的准确性。

校准使用了 512 个样本:256 个查询和 256 个来自 abisee/cnn_dailymail 的段落。QAD 训练使用了 20k 个样本。

研究团队报告称,Blackwell 上的 NVFP4 提供的吞吐量比 BF16 高出最多 2 倍。它保留了 BF16 检索准确率的 99%。NVFP4 卡还支持动态嵌入大小。你可以将 2048 维向量从开头切到 1024 或 512 维度,之后进行重新归一化。

在操作代码之前,先观察路径运行。它会展示前缀添加、双向编码、平均池化、L2 归一化和点积评分。评分来自每个卡发布的预期输出。

正如该演示所示,检查点不共享运行时路径。

除了检查点外,NVIDIA 研究团队发布了针对 1B 模型的优化 NIM 微服务。基于 Rust 的 NIM 在 GB200 和 RTX PRO 6000 上与 vLLM 检查点匹配或表现更佳。NVIDIA 测试了输入序列长度为 256 和 1024。另有 NVIDIA NeMo AutoModel 配方涵盖微调和蒸馏。

考虑到这些路径,前缀先行。查询使用 query:,文档使用 passage:. 嵌入向量经过 L2 归一化,因此点积等于余弦相似度。

encode_query 和 encode_document 会读取保存的提示。因此你无需手动添加前缀。对于服务端,/v2/embed 会根据 input_type 应用前缀:

需要与我们合作推广你的 GitHub 仓库、Hugging Face 页面、产品发布或网络研讨会等?请与我们联系:https://forms.gle/wbash1wF6efRj8G58

NVIDIA 发布 Nemotron 3 Embed 系列,8B 版本在 RTEB 基准上排名第一

Asif Razzaq 是 Marktechpost Media Inc. 的首席执行官。作为一位有远见的企业家和工程师,Asif 致力于利用人工智能的潜力造福社会。他最近的努力是推出人工智能媒体平台 Marktechpost,该平台因其对机器学习和深度学习新闻的深入报道而脱颖而出,既技术上可靠,又易于广大受众理解。该平台每月浏览量超过 200 万次,显示了其在观众中的受欢迎程度。

Patter SDK Guide to Building a Restaurant Booking Phone Agent with Dynamic Variables, Guardrails, Latency Dashboards, and Eval Checks

情报判断

Aioga 编辑摘要

NVIDIA 发布 Nemotron 3 Embed 开源模型系列,共含三个 checkpoint。材料称,8B-BF16 在 RTEB 的16项公开任务上以平均 NDCG@10 78.46 排名第一;所有版本最大序列长度均为 32,768 tokens。

背景分析

该系列面向生产级 RAG、智能体检索、代码检索与智能体记忆,采用双向注意力掩码的 Transformer 编码器,并对 token 表示进行平均池化。三个模型覆盖 34 种语言,使用 OpenMDW-1.1 许可。

Aioga 观点

Aioga 判断,此次更新的重点并非只有榜单成绩,还包括 8B 精度优先、1B 较小体量与 NVFP4 面向 Blackwell 优化的分层选择。值得关注的是,公开成绩基于长度 4096 的评测,不能直接等同于 32,768 tokens 下的实际效果。

影响与后续

Aioga 判断,该系列可能为检索系统提供精度、模型体量与部署吞吐量之间的不同选择。材料称,1B-NVFP4 在 Blackwell 上吞吐量为 BF16 的 2 倍,并保留 99.5% 精度,但这一结果不应外推到其他硬件或业务负载。 值得关注的是后续独立复测,包括不同语言、代码与长文档检索场景,以及 32,768 tokens 输入下的质量、延迟和资源占用。同时应核对 OpenMDW-1.1 的具体使用条件,并验证 NVFP4 在目标 Blackwell 环境中的实际收益。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: marktechpost.com

来源: MarkTechPost(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-17T07:53:02.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

NVIDIA 发布 Nemotron 3 Embed 系列,包含三个开源 checkpoint,其中 8B-BF16 版本在 RTEB 基准上以 78.46 的平均 NDCG@...

MarkTechPost(RSS)2026-07-17T07:53:02.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。