Aioga
AI资讯 / 模型更新
返回 AI资讯

NVIDIA 发布 Alpamayo 2 Super:面向 Robotaxi 与自动驾驶的 34B 开源视觉-语言-动作模型

MarkTechPost(RSS)Aioga 编辑团队2026-08-05T08:25:11.000Z热度 79

NVIDIA 发布 Alpamayo 2 Super,一款 34B 参数的视觉-语言-动作(VLA)模型,专为自动驾驶长尾事件设计,权重采用 Linux 基金会 OpenMDW...

模型更新MarkTechPost(RSS)

今日 AI 情报摘要

NVIDIA 发布 Alpamayo 2 Super,一款 34B 参数的视觉-语言-动作(VLA)模型,专为自动驾驶长尾事件设计,权重采用 Linux 基金会 OpenMDW-1.1 许可,代码为

Apache 2.0,发布首日即可商用。

中文正文 · AI 翻译

NVIDIA 发布了 Alpamayo 2 Super:https://huggingface.co/nvidia/Alpamayo2-Super,一款 34B 参数的视觉语言动作(VLA)模式:https://blogs.nvidia.com/blog/alpamayo-2-super-open-model-now-available/l,采用开放商业许可,适用于自动驾驶。设计目标是长尾事件:传统检测与预测堆栈处理不佳的罕见多代理情形。该模型将基于NVIDIA Cosmos 3 Super Reasoner构建、经过强化学习后期训练的32B VLM骨干,与基于扩散的2.3B动作解码器配对。从一次全环绕摄像机视频的扫描中,它发出一个有计划的轨迹、对该轨迹的因果解释以及一个元动作。

是的,而且从第一天起就是商业用途。权重根据 OpenMDW-1.1 发布,这是 Linux 基金会对开放模型发行版的宽松许可;源代码为Apache 2.0。该许可证涵盖微调、衍生模型和商业再分发。NVIDIA 正在将 OpenMDW 应用于整个 Alpamayo 系列,因此早期为研发推出的版本现在可以在无需额外许可的情况下商业部署。

输入是多机位RGB视频、文本和带有时间戳的自我动态历史。经过验证的公共笔记本配置文件使用六个摄像头和四个历史帧。自我运动是三维平移加上一个3×3旋转矩阵,多时间步。

轨迹API返回64个航点,间隔0.1至6.4秒,间隔0.1秒。每个航点携带自我框架XYZ和一个3×3旋转矩阵。

训练数据大约是115,000小时的多机位驾驶视频,包含自我运动和轨迹标注。它包含约3,700,000条因果链(CoC)痕迹——结构化、因果关联的驱动决策解释。图像训练数据超过十亿张。

在LingoQA:https://github.com/wayveai/LingoQA,Alpamayo 2 Super 在 Lingo-Judge 中得分为79.2,在近40个评估模型中排名第一。在NVIDIA的测试中,它领先Qwen2.5-VL 72B17.0个百分点,Gemini 2.5 Pro领先15.1个百分点,GPT-4o领先23.2个百分点。

规划工作还需要关注另外两个数字。在 PhysicalAI-AV-NuRec:https://huggingface.co/datasets/nvidia/PhysicalAI-Autonomous-Vehicles-NuRec 数据集的 910 个场景上,使用 AlpaSim:https://github.com/NVlabs/alpasim 进行闭环评估时,AlpaSim 得分为 1.50 ± 0.13。在 PhysicalAI-AV:https://huggingface.co/datasets/nvidia/PhysicalAI-Autonomous-Vehicles 数据集的 937 个具有挑战性的样本上进行开环评估时,6.4 秒时的 minADE₆ 为 0.911 米。

对于每个驾驶场景,模型会产生一条轨迹、一条说明决策的 CoC 轨迹、一项元动作(如让行或变道)、推理自动标签,以及带有二维定位的视觉问答。

这种组合使得该版本在操作上非常有趣。开发者可以将模型所观察的内容与其选择的动作联系起来。CoC 轨迹可以与 NVIDIA Halos:https://www.nvidia.com/en-us/ai-trust-center/halos/autonomous-vehicles/ 的安全验证工作流程集成,并支持符合 ISO/PAS 8800 标准的 AI 安全。

NVIDIA 表示,当模型作为专有车队数据的自动标注工具使用时,可将标注周期从数月缩短至数天。

需要与我们合作以推广您的 GitHub 仓库或 Hugging Face 页面或产品发布或网络研讨会等吗?请联系我们: https://forms.gle/wbash1wF6efRj8G58

NVIDIA 发布 Alpamayo 2 Super:面向 Robotaxi 与自动驾驶的 34B 开源视觉-语言-动作模型

Asif Razzaq 是 Marktechpost Media Inc. 的首席执行官。作为一位有远见的企业家和工程师,Asif 致力于利用人工智能的潜力造福社会。他最近的项目是推出人工智能媒体平台 Marktechpost,该平台以对机器学习和深度学习新闻的深入报道而著称,技术上严谨且易于广泛受众理解。该平台每月浏览量超过 200 万次,显示了其在受众中的受欢迎程度。

Pixel-Native RAG: A Practical Guide to Visual Document Indexing
Building an Advanced AI Skill Security Auditing Pipeline with NVIDIA SkillSpector, LangGraph, YARA Rules, SARIF, and CI Policy Gates

[免费指南] 保护 AI 代理、MCP 服务器和大语言模型应用程序:https://pxllnk.co/lxn88m

情报判断

Aioga 编辑摘要

NVIDIA 发布34B参数的 Alpamayo 2 Super 视觉-语言-动作模型,面向自动驾驶长尾事件,权重采用 OpenMDW-1.1 许可,代码采用 Apache 2.0,并支持首日商业使用。

背景分析

该模型由32B视觉语言模型骨干与2.3B扩散式动作解码器组成,可处理多摄像头视频、文本和自车运动历史,并输出轨迹、因果解释及元动作。

Aioga 观点

Aioga 判断,开放许可与轨迹、解释联合输出,可能降低研究者和企业评估自动驾驶长尾场景的门槛;但材料未说明其已通过真实道路监管或量产验证。

影响与后续

值得关注的是,NVIDIA披露模型在 LingoQA、AlpaSim 和开放环评测中取得具体成绩,但这些结果来自指定基准与测试样本,不能直接等同于实际道路安全表现。 后续应核验模型在不同传感器配置、真实道路和极端长尾场景中的表现,并关注 OpenMDW-1.1 商业条款、数据合规及安全责任如何落地。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: marktechpost.com

来源: MarkTechPost(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-08-05T08:25:11.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

NVIDIA 发布 Alpamayo 2 Super,一款 34B 参数的视觉-语言-动作(VLA)模型,专为自动驾驶长尾事件设计,权重采用 Linux 基金会 OpenMDW...

MarkTechPost(RSS)2026-08-05T08:25:11.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。