Aioga
AI资讯 / 模型更新
返回 AI资讯

NVIDIA 发布 Cosmos 3 Edge:4B 参数开源世界模型,为机器人及边缘 AI 提供实时推理与动作生成

Hugging Face:Blog(RSS)Aioga 编辑团队2026-07-20T15:58:51.000Z热度 70

NVIDIA 在 Hugging Face 上开源了 Cosmos 3 Edge,一个 40 亿参数的世界模型,旨在帮助机器人和视觉 AI 智能体在边缘设备上理解环境、实时推理...

模型更新Hugging Face:Blog(RSS)

今日 AI 情报摘要

NVIDIA 在 Hugging Face 上开源了 Cosmos 3 Edge,一个 40 亿参数的世界模型,旨在帮助机器人和视觉 AI 智能体在边缘设备上理解环境、实时推理并生成动作。

中文正文 · AI 翻译

什么是世界建模?:#what-is-world-modeling 两个变换器塔,一个共享表示:#two-transformer-towers-one-shared-representation 动作的通用表示:#a-common-representation-for-action 策略模式:#policy-mode 后训练样本以提高性能:#post-trained-samples-for-improved-performance 试用 Cosmos 3 Edge:#try-cosmos-3-edge 真实世界广阔,而要在其中操作,物理AI系统需要理解场景如何变化,预测下一步可能发生的情况,并确定某个动作将如何影响世界。

NVIDIA 发布 Cosmos 3 Edge:4B 参数开源世界模型,为机器人及边缘 AI 提供实时推理与动作生成
NVIDIA 发布 Cosmos 3 Edge:4B 参数开源世界模型,为机器人及边缘 AI 提供实时推理与动作生成
NVIDIA 发布 Cosmos 3 Edge:4B 参数开源世界模型,为机器人及边缘 AI 提供实时推理与动作生成
NVIDIA 发布 Cosmos 3 Edge:4B 参数开源世界模型,为机器人及边缘 AI 提供实时推理与动作生成

机器在工厂、仓库、医院等边缘环境中运行。为了理解并在这些环境中执行操作,它们需要能够在受限内存系统上提供数据中心级性能的模型。

今天,我们在 Hugging Face 的 Cosmos 3 仓库上发布了 NVIDIA Cosmos 3 Edge。它是一个具有40亿参数的开放世界模型,帮助机器人和视觉AI代理理解周围环境、实时推理,并在边缘设备上生成机器人动作。

下载模型:https://huggingface.co/nvidia/Cosmos3-Edge:https://huggingface.co/nvidia/Cosmos3-Edge

该模型在 NVIDIA 边缘计算设备上提供内存高效、高吞吐量的推理,包括 NVIDIA RTX PRO GPU、NVIDIA DGX、NVIDIA GeForce RTX™ GPU、NVIDIA Jetson(包括新发布的 Jetson T2000 和 T3000 模块)。

设计为紧凑的开放模型,可作为小型视觉语言模型(VLM)使用,具有一流的吞吐量和精度,并支持实时推理。

作为后训练的世界动作模型(WAM),Cosmos 3 Edge 在机器人控制分辨率(640×360 观测)下运行,提供实时推理,并在 NVIDIA Jetson Thor 上每次推理生成32个动作,同时实现15 Hz的实时控制。

在相似规模(40亿参数)模型中,Cosmos 3 Edge 在 VANTAGE-Bench 的视觉分析中排名第一,并在机器人策略学习方面达到最先进水平,为智能基础设施和机器人技术设定了最新标准。

世界模型学习环境随时间的变化。它表示对象、运动、空间关系以及动作的效果。

考虑一个机器人去拿一个物体。识别物体只是第一步。机器人还必须理解物体的位置,它的抓取器如何移动,接触时可能发生的情况,以及哪种动作最可能成功完成任务。

世界模型帮助机器人推理这些关系。它可以预测一个动作的视觉结果,推断引起变化的动作,或者生成一个动作以产生期望的结果。

Cosmos 3 Edge 将这些能力整合到一个设备上的模型中。它的共享表示使物理 AI 系统能够理解当前世界状态,模拟可能的未来,并将这些未来与动作关联起来。

Cosmos 3 结合了两个变压器塔:

这两个塔保持独立的归一化层和多层感知器。它们共享多模态注意力层,用于跨语言、视频、音频和动作对信息进行对齐。

这种设计允许模型在生成输出之前先推理场景。根据任务不同,Cosmos 3 可以从自回归塔生成推理标记,或者从扩散塔生成去噪的视频和动作标记。

注意力模式也适应于每种类型的信息。语言使用因果注意力,每个标记关注前面的标记。扩散标记更广泛地关注可用上下文,支持一致的预测和生成。

这些组件共同赋予模型一个关于正在发生的事情、接下来可能发生的事情,以及一个动作如何影响结果的通用表示。

:https://cdn-uploads.huggingface.co/production/uploads/6a45813c717ace23b8c3b562/EXkYn60a1TSwkBXaoKmNh.png

物理系统以不同方式描述动作。一辆车可能通过自我姿势和移动来表示动作。相机使用相机运动。机器人手臂使用其末端执行器的位姿,而手或抓手还需要表示抓握状态。

Cosmos 3 将这些不同的体现映射到一个通用的动作表示中。

动作被编码为紧凑的几何向量,捕捉:

这在控制和世界的视觉结构之间创建了直接的联系。模型可以将像素的变化与物理运动、空间关系和控制输入相关联。

因此,生成的视频不仅仅是视觉预测。它可以表示世界在响应某个动作时预期会如何变化。这为开发者提供了以运动、控制以及因果关系为基础的训练数据。

作为一种策略,Cosmos 3 会预测一个动作及其预期的视觉后果。

模型可以生成系统应该采取的动作,并模拟接下来可能发生的情况。这将世界建模直接与机器人策略训练和评估连接起来。

输入当前状态,输出动作及视觉后果。

这些模式使得一个模型能够学习因果、效果和策略。动作可以双向流经模型,使得 Cosmos 3 Edge 可以预测动作的效果或从效果推断出动作。

提示:拿起香蕉并放到盘子里。

我们还发布了 Cosmos 3 Edge Policy(DROID):一种针对搬运任务在 DROID 数据集上进行后训练的机器人操作策略,并附带后训练脚本。

开发者可以使用少量的 H100 或 NVIDIA DGX Station 集群,高效地微调 Cosmos 3 Edge 以适应目标工作负载,然后部署到 NVIDIA 边缘和加速计算平台。

除了基础模型,我们还发布了参考的后训练检查点和训练方案,帮助开发者调整和优化 Cosmos 3,以适应自己的应用场景。

Cosmos 3 是一个开放世界基础模型平台。随着模型使用高质量、特定领域的数据进行后训练,其在专业应用中的准确性会持续提升。Cosmos 作为使用开放框架构建领域适应世界模型的起点。后训练使开发者能够在保持输出质量的同时提升模型性能。为了展示这一工作流程,我们还发布了 Cosmos 3 超级四步蒸馏检查点以及后训练脚本,为 64B 模型提供更快的参考实现,帮助开发者将 Cosmos 适配到自己的领域并获得更好的下游性能。

Cosmos 3 超级 4 步骤(文本到图像 & 图像到视频):这些是分布匹配蒸馏的检查点和脚本,将扩散过程从 35–50 步降到仅 4 步,在保持图像和视频质量及保真度的同时,实现最高 25 倍的推理加速。

这些示例作为参考实现,供开发者在此基础上构建。使用开放训练脚本,您可以对 Cosmos 3 Edge 进行后训练以定制机器人策略,或蒸馏 Cosmos 3 Super 以实现针对您的应用的快速图像和视频生成。

Cosmos 3 Edge 通过共享的世界表示连接理解、预测、模拟和行动。开发者可以将其部署在更靠近传感器的设备上。该模型可以用作推理器或动作生成器。

使用开放 Cosmos 框架自定义和专业化模型。

查看 Cosmos 3:https://huggingface.co/collections/nvidia/cosmos3:https://huggingface.co/collections/nvidia/cosmos3

我们将继续推进 Cosmos 3 在物理 AI 领域的发展,未来将在互动世界生成、驾驶场景模拟和机器人策略方面进行改进。

我们还在投资于更快的推理和在更广泛硬件上的更高效的后训练,从而减少构建下游模型所需的时间和计算量。

这包括使用开放推理和优化框架(如 vLLM)优化 Cosmos 3 检查点,同时更多优化和开发工具即将推出。

情报判断

Aioga 编辑摘要

NVIDIA 在 Hugging Face 发布 Cosmos 3 Edge。这是一款四十亿参数的开放世界模型,面向机器人和视觉 AI 智能体,可在边缘设备上理解环境、实时推理并生成机器人动作。

背景分析

公开材料称,物理 AI 系统需要理解场景变化、预判后续状态并评估动作影响。工厂、仓库和医院等边缘场景又受内存限制,因此需要兼顾推理性能与资源效率的模型。

Aioga 观点

Aioga 判断,Cosmos 3 Edge 的关注点不只在参数规模,而在将视觉理解、世界建模和动作生成置于边缘计算环境。其实际价值仍需结合具体硬件、任务和独立测试评估。

影响与后续

材料称,该模型支持多类 NVIDIA 边缘计算设备,并在 Jetson Thor 上以六百四十乘三百六十观察分辨率运行,每次推理生成三十二个动作,实现十五赫兹实时控制。 值得关注后续是否出现可复现的部署报告与独立基准验证,包括不同设备上的内存占用、吞吐表现、任务准确性,以及机器人策略学习在真实场景中的稳定性。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: huggingface.co

来源: Hugging Face:Blog(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-20T15:58:51.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

NVIDIA 在 Hugging Face 上开源了 Cosmos 3 Edge,一个 40 亿参数的世界模型,旨在帮助机器人和视觉 AI 智能体在边缘设备上理解环境、实时推理...

Hugging Face:Blog(RSS)2026-07-20T15:58:51.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。