Aioga
AI资讯 / 技巧观点
返回 AI资讯

NVIDIA 副总裁详解如何构建开源模型:架构选择与开源策略

ByteByteGo(RSS)Aioga 编辑团队2026-07-27T15:01:46.000Z热度 59

NVIDIA 应用深度学习研究副总裁 Bryan Catanzaro 介绍了团队构建公司开源模型的方法、架构设计背后的逻辑以及大量开源的原因。

技巧观点ByteByteGo(RSS)

今日 AI 情报摘要

NVIDIA 应用深度学习研究副总裁 Bryan Catanzaro 介绍了团队构建公司开源模型的方法、架构设计背后的逻辑以及大量开源的原因。

中文正文 · AI 翻译

使用 Render 的轻量级 SDK 定义任务,并将它们链接成长期运行的分布式工作流。按需启动你的代理和批处理作业。Render Workflows 负责排队、编排和重试。

使用代码 BYTE 获取 50 美元积分:https://go.bytebytego.com/Render_072726

你可能知道 NVIDIA 销售 GPU。但你是否知道,它也是全球最大的开放 AI 模型发布者?其模型在 Hugging Face 上下载量名列前茅,而且阵容远不止聊天机器人:还有推理模型、世界模型、人形机器人模型、自动驾驶汽车模型,甚至药物发现、量子计算和全球预测模型。

这引出了两个问题。一家以硬件闻名的公司,如何在如此多的领域构建出如此强大的模型?以及为什么要免费提供这些模型,而这些模型却运行在 NVIDIA 销售的 GPU 上?

为了理解这两个问题,我们采访了 NVIDIA 应用深度学习研究副总裁 Bryan Catanzaro:https://www.linkedin.com/in/bryancatanzaro/。他向我们介绍了他的团队如何构建公司的开放模型:https://www.nvidia.com/en-us/glossary/open-models/,模型架构的背后原理,以及为什么 NVIDIA 开源了如此多的内容。感谢 Bryan 花时间如此详细地分享团队的工作。

NVIDIA 建立了哪些开放模型,以及它们的功能

NVIDIA 如何让其模型既快速又强大

一个基础如何让小团队构建许多模型

开放的真正含义,以及为什么发布数据和权重同样重要

为什么 NVIDIA 全部免费提供,以及团队在公开发布中学到的经验

NVIDIA 的开放模型位于 AI 的两个端点。一端是处理符号的模型,也就是在屏幕上工作的语言、代码和推理。另一端是处理物理世界的模型,即机器人和自动驾驶车辆(AV)必须感知周围环境并采取行动的模型。大部分阵容都处于这两者之间的某个位置。

观察生态系统的最简单方式是按每个模型家族的用途进行分组。

推理模型是大型语言模型,它们经过训练,可以在给出最终答案之前生成中间的标记。这使它们能够思考诸如数学和编码等任务。如今你看到的大多数前沿模型都是由推理模型驱动的,如 Claude Opus、GLM-5.2、Kimi K2.7。

NVIDIA 的推理模型系列被称为 Nemotron。首个 Nemotron 模型在2023年推出。2024年,NVIDIA 发布了下一代模型,拥有3400亿个参数,随后在2025年推出了更快的混合设计。当前一代 Nemotron 3 于2025年底至2026年推出,提供三个规格:小型 Nano 模型用于快速、简单的任务,中型 Super 模型用于更难的规划和推理,大型 Ultra 模型用于需要最复杂推理的任务。

语言模型擅长预测下一个标记,但它们并不理解物理世界。它们无法告诉你衬衫袖子如何折叠,也无法描述水杯倾倒时的样子。机器人或自动驾驶汽车需要这种理解,但从文本中是无法获得的。

这就是世界模型提供的功能。它不是预测下一个词,而是理解世界,并根据当前世界状态和一个动作预测下一个状态。它可以生成真实的、符合物理规律的视频,推理运动及因果关系,并生成机器人学习所需的动作数据。

世界模型非常有用,因为你可以用它们为那些在现实世界中捕捉缓慢、昂贵或危险的情况创建训练数据。

NVIDIA 的首席执行官黄仁勋称之为“物理 AI 的 ChatGPT 时刻”。NVIDIA 面向物理 AI 的前沿开放模型是 Cosmos,于2025年1月在 CES 发布,并于2026年统一为单一全能模型 Cosmos 3:https://www.nvidia.com/en-us/glossary/omni-model/,它可以生成场景、对场景进行推理并预测接下来会发生什么。Cosmos 3 还引入了世界动作模型:https://www.nvidia.com/en-us/glossary/world-action-model/,将预训练的视频骨干直接转化为机器人策略。还有一个40亿参数的 Edge 版本,小到可以在机器人上运行并实时控制它。

一个世界模型可以预测下一个场景,但机器人必须采取行动。它必须将摄像头看到的内容实时转化为电机的运动,用于那些无人事先编写脚本的任务。

这就是机器人基础模型的工作,经常被称为视觉-语言-动作模型。这些模型的输入通常是摄像头图像和指令,而模型输出的是动作。

NVIDIA 面向类人机器人的开放基础模型系列是 Isaac GR00T。NVIDIA 在 2024 年公布了该项目,并在 2025 年初发布了首个开放类人基础模型 GR00T N1,此后不断迭代到 GR00T 1.7。

GR00T 模型使用 Cosmos 作为推理骨干,为机器人提供感知、推理和操作移动的共享基础:能够在操作物体的同时移动。这使机器人的决策更接近人类,并帮助机器人将复杂动作分解为结构化、逐步的计划,开发者可以针对特定任务进行专业化。1.7 版本还包含适合生产的商业许可,允许开发者将模型部署到实际应用中。

这一系列还在继续。Alpamayo 是面向基于推理的自动驾驶的开放模型家族。像 GR00T 一样,它使用 Cosmos 作为推理骨干,因此驱动机器人的相同物理-AI 基础也能让汽车应对它从未训练过的路况。它还展示了每个决策背后的因果链,开发者可以进行检查和扩展。BioNeMo 将开放模型引入生物学和药物发现领域,BioNeMo 代理工具包让开发者能够为生命科学工作构建自主代理。Ising 为量子计算机的构建者、操作员和开发者提供了 AI 工具,以将设备扩展到容错水平。Earth-2 是一个开放模型、库和框架的家族,使专业级的天气和气候 AI 可供任何人使用。在此基础上,NVIDIA 还提供用于生产的开放模型:过滤不安全内容的安全模型、语音模型以及图像视觉模型。

综合来看,这个强大的生态系统改变了社区推进和构建的方式。文章的其余部分将探讨 NVIDIA 如何构建这些模型,团队如何能够快速前进,以及他们学到了什么。

构建一个既快速又强大的模型通常是一项挑战。强大的模型通常更大,这使它们训练和回答问题的速度更慢。NVIDIA 的解决方案是同时追求前沿性和速度。Bryan 如此描述:“最快的模型就是最聪明的模型。”

虽然这听起来像是一句口号,但它实际上有深刻的见解。更快的模型可以在相同时间内处理更多数据进行训练。它可以在更多环境中进行后续训练。一旦部署,它可以在面对难题时以相同成本思考更久。因此,速度转化为能力,并在每个阶段不断累积。

基于这一策略,NVIDIA 在设计模型时侧重于效率和速度。以下设计选择使这些模型既快速又强大。前两个使模型更快、更高效。最后一个使其更强大。

大多数知名模型几乎完全基于 Transformer 的注意力机制。注意力机制允许每个输入的标记查看所有其他标记,这对于捕捉关系非常强大,但代价高。其成本随着输入长度的平方增长,因此输入长度翻倍,工作量大约增加四倍。模型在运行时必须将每个之前的标记保存在内存中。对非常长的输入,这会变得缓慢且昂贵。

另一类主要模型是状态空间模型,而 Mamba 是其最知名的例子。Mamba 层不是将每个标记与其他标记进行比较,而是一次读取序列并将所见的一切压缩到固定大小的内存中。这使得它的成本较低:成本随着长度线性增长,内存无论输入多长都保持不变。其权衡是固定大小的内存无法保留所有细节,因此 Mamba 在回忆埋藏得很深的具体事实时较弱。

Mamba 层高效,而注意力层更有效。将它们结合在一起可以兼得两者的优势。混合架构用 Mamba 层代替 Transformer 中的大部分注意力层,并保留少量完整注意力块。

NVIDIA的模型依赖于相同的混合模式。大部分层是Mamba,这使处理长输入的成本保持较低,也正是它让百万标记的上下文窗口成为可行而不仅仅是理论上可行。一些注意力层被插入其中,以恢复Mamba舍弃的精确回忆能力,使模型仍然能够从上下文中的任何位置检索到精确细节。

在混合设计的基础上,模型还使用了专家混合层(MoE)。一个MoE层由许多小型专家层组成,并将每个标记路由到其中的少数几个层。因此,模型并不是对每个标记运行所有参数,而是只激活其参数的一小部分。这使我们能够以低标记成本使用大的总容量,从而保持模型运行速度快。

按Bryan的描述,Mamba构建了整个序列的全局视图。注意力机制总是可以回溯并找到精确的事实。结合起来,它们比单独使用任何一个都更智能。NVIDIA在2024年发布了这一混合成果,其他实验室,包括Qwen和Kimi团队,也随后走向了相同方向。

第二个选择是NVIDIA两大业务的交汇点。其更大的模型使用一种名为NVFP4的4位数格式进行预训练,这意味着大部分训练计算每个数值只使用四位。位数少意味着内存占用少、数据传输少,因此运算更快且功耗更低。

需要注意的是,四位意味着精度非常低。大多数团队会用较高精度训练,之后再缩小模型,这会损失准确性。NVIDIA从第一步就使用4位训练,因为它知道下一代GPU Blackwell将配备快速4位硬件。模型与芯片是为彼此设计的。

副总裁描述了背后的思维方式。摩尔定律已经不再能在每一代轻松带来收益,所以进展必须来自于模型与硬件的共同设计。团队之所以尝试4位预训练,是因为他们相信这一结果是可能的。他的话是,发明出惊人事物的第一步就是相信你能做到。

在做出这些效率选择之后,模型在后训练阶段获得其能力。

后训练配方本身是大多数其他团队所趋同的。它从监督微调开始,模型从经过精心挑选的优秀答案示例中学习,掌握所期望的格式和行为。然后,它转向强化学习,模型在真实任务中练习,并因达成正确结果而获得奖励。它不是从示例中学习,而是从自己的尝试中学习。

已证明扩大这一强化学习阶段可以显著提高模型的能力。在这里,NVIDIA 对效率的关注再次得到回报。由于其模型运行成本较低,它可以以较低成本扩展强化学习,让模型在多种环境中并行练习,并从超过一百万次的试验中学习。

这正是副总裁指出更好模型的真正瓶颈所在。不是数据,也不是计算资源。而是这些训练环境的多样性。模型在越多样的情况下练习,就变得越有能力,因为这正是它获得实际问题解决经验的地方。

到目前为止,我们已经了解了构建模型的设计决策,以及训练单个前沿模型所涉及的内容。但他们是如何构建如此多的模型,并如此迅速地持续改进它们的呢?

在一个领域构建强大的模型是困难的。在语言、视频、机器人、车辆和生物学等多个领域构建模型需要巨大的工程和计算资源。NVIDIA 的方法是确定一个可复用的基础,先构建一次,然后在不同的项目中重复使用。

副总裁将这一方法追溯到 CUDA,这是使 NVIDIA GPU 可编程的软件层。“U”代表统一,他称这是最重要的字母。其理念是构建一个基础,并在其上运行所有内容,而不是维护多个独立的堆栈。

同样的本能也塑造了这些模型。上一节介绍的混合架构不会为每个模型重新构建。相同的骨干网络在所有三种 Nemotron 尺寸中都能扩展。整个组件也会在不同项目间共享。Cosmos Reason,这是一个用于推理物理世界的模型,被重新作为 NVIDIA Isaac GR00T 基础模型的推理核心使用,因此机器人团队不必从零开始构建这一部分。另一种方式是十个平行项目各自重复发明相同的部分,这会使人员和计算资源过于分散。据 Bryan 说,NVIDIA 试图尽可能“懒惰”,因为这是在有限资源下获得最大效益的方式。

团队效率高、迭代快的另一个原因是文化。NVIDIA 大多不是自上而下的公司;它是一个志愿者组成的公司,团队可以选择自己的工作方向,统一是通过邀请而非控制实现的。协作文化认为,如果团队相互合作并完成更多工作,他们将获得比单独行动更多的资源。当每个人都共享这种信念时,一个小团队也能产生大量成果。

你可能听说过很多关于开放模型的事情。几个 AI 实验室发布了功能强大的模型。你可以下载权重并使用它们。但那并不是真正的开放模型。这里是 NVIDIA 方法与其他实验室显著区别的地方。正如 Bryan 所说,Nemotron 不仅仅是一个模型。它还包括数据、工具、训练配方,以及论文中公开的思想。最终的权重只是最后一步。

实际上,这意味着 NVIDIA 会发布训练数据集、训练后数据集、强化学习环境,以及重现工作所需的配方。团队不仅可以运行模型,还能看到它是如何构建的,并训练自己的版本。

对于机器人和自动驾驶汽车也是如此,开发者可以使用开源模拟和学习框架,以及数据集来训练和评估模型性能,然后再部署。

以这种规模发布数据是不寻常的。对一家公司来说,这是一件令人害怕的事情。但 NVIDIA 仍然会这样做,甚至还分享了巧妙的构建模块,比如统计上真实但完全隐私的合成“人格”数据,这样模型可以学习世界知识而无需记住真实的人。

你可以从社区对它所做的事情中看到这一点。NVIDIA 的开放数据和模型催生了大量的社区微调和衍生作品。其中一个机器人数据集成为 Hugging Face 上下载量最高的数据集之一。其 Nemotron 模型的许多变体每个都有数百万次下载,而 Nemotron 系列最近总下载量超过了 1 亿。仅凭权重,你无法构建出这样的成果。

你可能认为发布开放模型听起来很棒。但是,为什么一家销售 GPU 的公司会免费提供在这些 GPU 上运行的 AI?

Bryan 分享了两个原因。第一个是 NVIDIA 需要深入理解 AI 才能为其构建合适的硬件。为了设计未来的芯片,你必须知道 AI 的发展方向。真正了解的最好方式是自己构建模型并将其展示给真实用户。保持模型私有很容易自欺,因此公开发布能保持工作的透明度,使 NVIDIA 的研究人员与他们从中学习的更广泛社区保持联系。开放模型如此热门,其真正的价值在于让开发者能够以极低的成本对这些模型进行后续训练。

第二个原因涉及商业。每当 AI 发展,NVIDIA 也随之增长。其目标是支持生态系统,而不是与构建在其上的公司竞争。每一个采用开放模型并构建自己 AI 的团队都可能成为未来的计算客户。因此,公司宁愿把模型交给生态系统,让全球对 AI 的需求推动其业务发展。

还有一个附带好处:安全。开放技术往往更安全,因为更多人可以检查它并发现问题,就像开放的互联网受到所有用户的强化一样。

公开发布如此多的模型可以提供封闭实验室永远无法面对的教训。Bryan 分享了几个宝贵的经验。

在这个发展如此迅速的领域,每一个模型在发布前就已经过时。因此,没有单一的发布是关键。获得信任的是一个稳定、持续的计划。当社区相信一个模型系列将长期存在时,他们会关注每一次新发布,而不会把它当作一次性的事件。

一次干净的发布是许多小事情都做对的结果,从许可到文档再到可直接运行的示例。副总裁承认,这是不引人注目的部分。倾听社区反馈并优化第一次运行体验,才会把一次下载转化为持久使用。

NVIDIA 放弃了自家的原生许可证,转而使用 OpenMDW,这是 Linux 基金会针对开放 AI 专门制定的社区许可证。使用一个共享的、专为目的设计的许可证可以减少摩擦,并表明这些模型是为了自由使用的。

接下来的方向是更早地开放。NVIDIA 不打算私下构建模型再在完成后发布,而是希望更早地引入合作伙伴,因为它计划无论如何都会开放所有内容。目标是让合作伙伴在模型仍在构建时就参与塑造模型。为实现这一点,NVIDIA 组建了 Nemotron 和 Cosmos 联盟。

最显著的是这种信念:这是长期承诺,而不是一个阶段性行为。副总裁提到了 CUDA,它花了十多年时间,世界其他地方才明白它的重要性。NVIDIA 坚持下去,它成为了公司的基础。

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:NVIDIA 应用深度学习研究副总裁 Bryan Catanzaro 介绍了团队构建公司开源模型的方法、架构设计背后的逻辑以及大量开源的原因。 Aioga 将其归入「技巧观点」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: blog.bytebytego.com

来源: ByteByteGo(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-27T15:01:46.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

NVIDIA 应用深度学习研究副总裁 Bryan Catanzaro 介绍了团队构建公司开源模型的方法、架构设计背后的逻辑以及大量开源的原因。

ByteByteGo(RSS)2026-07-27T15:01:46.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。