Aioga
AI资讯 / 模型更新
返回 AI资讯

NVIDIA Cosmos 3:开放世界模型如何推动物理 AI 前沿

NVIDIA Blog(RSS)Aioga 编辑团队2026-08-06T13:00:00.000Z热度 71

NVIDIA 发布 Cosmos 3,一个基于混合 Transformer 架构的开放物理 AI 基础全模态模型,整合视觉推理、世界生成与动作预测。

模型更新NVIDIA Blog(RSS)

今日 AI 情报摘要

NVIDIA 发布 Cosmos 3,一个基于混合 Transformer 架构的开放物理 AI 基础全模态模型,整合视觉推理、世界生成与动作预测。

中文正文 · AI 翻译

编辑注:本文是《进入全宇宙》(Into the Omniverse)系列的一部分:https://www.nvidia.com/en-us/omniverse/news/,该系列关注开发者、3D 从业者和企业如何利用最新的 OpenUSD 技术:https://www.nvidia.com/en-us/omniverse/usd/ 和 NVIDIA Omniverse:https://www.nvidia.com/en-us/omniverse/ 改造他们的工作流程。

今年七月,NVIDIA 与 200 多家公司和组织共同签署了《开放权重与美国人工智能领导力》信函:https://images.nvidia.com/pdf/Open-Weights-and-American-AI-Leadership.pdf,该公开信认为,人工智能的领导力衡量标准不应基于某个单一的前沿模型,而应看一个开放生态能否覆盖各个行业。

开放模型:https://www.nvidia.com/en-us/glossary/open-models/,任何人都可以下载、检查、修改并在自己的基础设施上运行,这是实现这一目标的关键。在物理人工智能(Physical AI):https://www.nvidia.com/en-us/glossary/generative-physical-ai/ 中,这一点尤为重要,因为每一次部署都涉及专业化问题。

物理人工智能必须理解和预测后果,而不仅仅是表象。

为了实现这一点,世界模型:https://www.nvidia.com/en-us/glossary/world-models/ 学习物理环境的行为、接下来可能发生的情况以及哪些后续动作是合理的。它们可以生成物理基础的世界和动作数据,模拟未来状态,并为团队提供一个基础,使其可以针对机器人、自动驾驶车辆或视觉 AI 系统进行专业化。

开放世界模型已经被用于生成训练数据、测试策略并专业化物理 AI 系统。NVIDIA Cosmos 3:https://www.nvidia.com/en-us/ai/cosmos/ 将这些能力整合到一个开放模型家族中,在基准测试中取得领先成绩,并在机器人、自动驾驶车辆和视觉 AI 领域得到广泛采用。

NVIDIA Omniverse:https://www.nvidia.com/en-us/omniverse/ 库是 NVIDIA Agent Toolkit 的一部分,提供构建可模拟世界的预构建功能,物理 AI 团队可以利用这些功能在真实部署之前对系统进行训练、测试和验证。

物理 AI 背后的数据难以收集,并且成本高昂,尤其是在所需规模下。罕见事件和长尾情景尤其难以安全且重复地再现。

通过从大规模多模态场景中学习物理关系获取更有用的数据。

更多样化的环境,涵盖天气、光照、物体和轨迹的变化。

提供一个更好的基础,以便为特定机器人、车辆、传感器配置、任务或操作环境进行构建和适应。

通用模型没有见过团队的特定机器人、传感器或操作环境。弥合这一差距需要访问模型权重、允许适配的许可和后训练所需的工具。

NVIDIA Cosmos 世界基础模型在 Linux 基金会的 OpenMDW 1.1 许可下可用,使团队能够在自己的数据和硬件上进行后训练。专业化是开放性成为实际技术需求的地方。

对模型进行专业化只是工作流程的一部分。团队还需要环境来生成数据、运行仿真和测试行为。

Omniverse 库帮助开发者构建可用于仿真的环境,而 OpenUSD:https://www.nvidia.com/en-us/glossary/openusd/ 提供了用于在数字孪生:https://www.nvidia.com/en-us/glossary/digital-twin/、仿真和合成数据生成:https://www.nvidia.com/en-us/glossary/synthetic-data-generation/ 工作流中组合、重用和交换复杂 3D 数据的开放框架。Omniverse 与 OpenUSD 一起减少了每次资产、传感器配置或环境条件变化时可能积累的重复工作。

NVIDIA Cosmos 3 —— 前沿开放物理 AI 基础全模型:https://www.nvidia.com/en-us/glossary/omni-model/,基于混合变换器架构:https://www.nvidia.com/en-us/glossary/mixture-of-transformers/ —— 结合了视觉推理、世界生成和动作预测,让开发者使用同一个模型系列理解场景、生成合成数据、模拟未来状态并构建专业化的世界动作模型:https://www.nvidia.com/en-us/glossary/world-action-model/。

开发者可以将Cosmos 3用作视觉语言模型:https://www.nvidia.com/en-us/glossary/vision-language-models/,作为基于物理的世界模拟器,预测未来世界状态并生成大规模合成数据,或者作为世界动作模型的骨干,而不必为每个能力组装和维护独立模型。

该系列包括用于高精度世界建模的 Cosmos 3 Super(64B)、用于高效推理和后期训练的 Cosmos 3 Nano(16B)以及用于设备内视觉推理和机器人策略部署的 Cosmos 3 Edge:https://huggingface.co/nvidia/Cosmos3-Edge (4B)。Cosmos 3 Edge 轻量化,可运行于边缘 GPU,支持部署于 NVIDIA RTX GPU、NVIDIA DGX 系统和 NVIDIA Jetson,包括 Jetson Thor 平台。

在基准评估中,Cosmos 3 在人工分析方面排名第一:https://artificialanalysis.ai/image/leaderboard/text-to-image/open-weights,用于开放权重文本到图像和图像到视频生成,在 PAI-Bench 上排名第一:https://huggingface.co/spaces/shi-labs/physical-ai-bench-leaderboard,用于世界生成和图像到视频类别物理智商:https://physical-iq.github.io/。对于机器人策略,它在 RoboLab 上排名第一:https://research.nvidia.com/labs/srl/projects/robolab/leaderboard.html。 Cosmos 3 Super也是VANTAGE-Bench上排名最高的视觉理解开放模型:https://huggingface.co/spaces/clemson-computing/VANTAGE-Bench-Leaderboard。

除了 Cosmos 外,NVIDIA 的物理 AI 堆栈还包括用于机器人技术的 Isaac GR00T:https://developer.nvidia.com/isaac/gr00t,用于自动驾驶车辆的 Alpamayo:https://www.nvidia.com/en-us/solutions/autonomous-vehicles/alpamayo/ 以及用于视觉 AI 的 Metropolis:https://www.nvidia.com/en-us/autonomous-machines/intelligent-video-analytics-platform/。

在各行各业,开发者正在基于 NVIDIA Cosmos 构建物理 AI 应用:Doosan Robotics、LG Electronics、Samsung Electronics 和 Skild AI 在机器人领域;理想汽车、小米和 Afari 在自动驾驶汽车领域;以及 Centific:https://www.centific.com/blog/centific-brings-last-mile-physical-ai-to-production-with-nvidia-cosmos-3、Fogsphere:https://fogsphere.com/fogsphere-announces-cosmos-3-support/、Linker Vision:https://www.linkervision.com/post/linker-vision-unveils-application-driven-ai-grid-for-agentic-video-reasoning-at-scale、Milestone Systems:https://www.milestonesys.com/resources/content/articles/milestone-hafnia-nvidia-cosmos-3/ 和 Yuan:https://www.yuan.com.tw/news/preview-news?id=336&t=d74eb353274d4fd78e460600ae11a561 在视觉 AI 代理方面:https://www.nvidia.com/en-us/use-cases/video-analytics-ai-agents/,推动工业 AI 和智能空间应用的发展。

NVIDIA Cosmos 联盟:https://nvidianews.nvidia.com/news/nvidia-launches-cosmos-3-the-open-frontier-foundation-model-for-physical-ai 通过汇聚世界模型构建者、AI 开发者和物理 AI 领导者,贡献模型、研究和评估方法,从而推进这一工作。NVIDIA 最近将该联盟扩展到日本:https://nvidianews.nvidia.com/news/japans-robotics-and-manufacturing-leaders-build-on-nvidia-cosmos-to-advance-physical-ai-frontier,在那里,机器人和制造业领导者计划加入并开发用于工厂、物流、农业、建筑、医疗和交通的开放世界模型。

这些实现和合作正共同将开放世界模型确立为适用于机器人、自动驾驶汽车和视觉 AI 系统的物理 AI 可适应基础。

通过探索以下资源,了解更多关于世界模型、OpenUSD 和物理 AI 开发的信息:

探索开放的 Cosmos 3 模型集合:https://huggingface.co/collections/nvidia/cosmos3 以及 Hugging Face 数据集:https://huggingface.co/nvidia 和 GitHub:https://github.com/nvidia-cosmos。

阅读 Cosmos 3 技术报告:https://research.nvidia.com/labs/cosmos-lab/cosmos3/technical-report.pdf 以获取完整的架构细节和评估信息。

阅读 Cosmos 3 技术博客:https://developer.nvidia.com/blog/。

收听 Cosmos Labs 的直播:https://www.addevent.com/calendar/ss55fmjpm04t。

了解 NVIDIA Cosmos 联盟:https://nvidianews.nvidia.com/news/nvidia-launches-cosmos-3-the-open-frontier-foundation-model-for-physical-ai.

NVIDIA GTC Berlin Registration Is Now Open
For Robotaxis, Safety Must Be Built In, Not Bolted On
NVIDIA Research Unlocks Advanced Grasping, Smarter Autonomous Driving and Agent Training at Scale
NVIDIA Enables the Next Era Of Physical AI Research With Agent Skills For Autonomous Vehicles, Robotics And Vision AI
Mercedes-Benz Unveils New S-Class Built on NVIDIA DRIVE AV, Which Enables an L4-Ready Architecture

情报判断

Aioga 编辑摘要

NVIDIA 发布 Cosmos 3,将视觉推理、世界生成和动作预测整合进开放物理 AI 模型家族。材料称,该系列可生成训练数据、模拟未来状态,并支持机器人、自动驾驶与视觉 AI 系统的专门化。

背景分析

物理 AI 不仅要识别外观,还要理解和预测行动后果。世界模型通过学习物理环境的运行方式、后续可能状态及合理动作,为训练、策略测试和部署前验证提供基础;相关数据通常难以大规模采集。

Aioga 观点

Aioga 判断,Cosmos 3 的重点不是单一生成能力,而是把推理、生成和动作预测纳入同一开放模型家族。开放权重允许团队下载、检查、修改并在自有基础设施运行,可能降低专门化工作的进入门槛。

影响与后续

对机器人、自动驾驶和视觉 AI 团队而言,开放世界模型可能扩展合成训练数据、策略测试和长尾场景复现方式。值得关注的是,材料仅称其取得领先基准结果并获得行业采用,未提供具体指标或部署规模。 Aioga 判断,后续应重点核验 Cosmos 3 的公开权重、许可条件、基准测试方法及各应用领域的实际案例,同时观察其与 Omniverse 仿真能力结合后,能否支持部署前训练、测试和验证流程。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: blogs.nvidia.com

来源: NVIDIA Blog(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-08-06T13:00:00.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

NVIDIA 发布 Cosmos 3,一个基于混合 Transformer 架构的开放物理 AI 基础全模态模型,整合视觉推理、世界生成与动作预测。

NVIDIA Blog(RSS)2026-08-06T13:00:00.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。