Aioga
AI资讯 / 产品更新
返回 AI资讯

NVIDIA 发布 DeepStream 9.1,新增 13 项智能体技能与多视角 3D 追踪

MarkTechPost(RSS)Aioga 编辑团队2026-07-18T19:16:22.000Z热度 56

NVIDIA 发布 DeepStream 9.1,新增 13 项 agentic skills,支持通过自然语言描述构建多摄像头视觉管线。核心技能 MV3DT 将多摄像头检测投...

产品更新MarkTechPost(RSS)

今日 AI 情报摘要

NVIDIA 发布 DeepStream 9.1,新增 13 项 agentic skills,支持通过自然语言描述构建多摄像头视觉管线。

核心技能 MV3DT 将多摄像头检测投影至统一 3D 坐标系,为跨视角目标分配全局一致的 ID; AMC 技能可自动估算摄像头内外参,替代手动棋盘格标定。

中文正文 · AI 翻译

NVIDIA 刚刚发布了 DeepStream 9.1:https://github.com/NVIDIA/DeepStream。此次更新针对视频分析中的一个长期存在的问题。传统上,要在多台摄像机之间跟踪同一个物体,通常需要手动摄像机校准和复杂的计算。DeepStream 9.1 通过两个新增功能解决了这一问题:多视角 3D 跟踪(MV3DT)和自动魔法校准(AutoMagicCalib,AMC)。这两者都作为编程代理的智能技能提供。因此,开发者可以更快地从概念阶段进入运行中的处理管线。

要理解此次更新,先从基础平台开始。DeepStream 是 NVIDIA 提供的用于 AI 视频和图像理解的流分析工具包。它提供了一个基于 GStreamer 的框架,用于在 NVIDIA GPU 上进行多流、多模型推理。处理管线结合了硬件加速的解码和编码、TensorRT 推理、物体跟踪以及消息中间件集成。

在此基础上,9.1 版本增加了五个显著的新功能:

在这些新增功能中,MV3DT 是主要技能,所以需要了解它的工作原理。核心上,MV3DT 将来自多台校准摄像机的检测结果投射到一个共享的 3D 坐标系中。然后,它将不同摄像机视角下对同一物体的观测进行关联。最后,为每个物体分配一个全局一致的对象 ID。

具体来说,数据流分四个阶段运行。对于检测,每个摄像机流运行一个对象检测器。MV3DT 开箱即用支持三种模型:

接下来,对于单目 3D 感知,每台摄像机使用存储在 YAML 校准文件中的 3×4 投影矩阵。该矩阵将二维边界框反投影到假设地面平面的三维世界坐标中。然后,在多视角关联阶段,追踪器通过 MQTT(消息队列遥测传输)共享 tracklet。MQTT 是一种轻量级的发布/订阅消息协议。当两台摄像机观察到同一人时,它会根据三维世界空间中的接近程度匹配 tracklet。

关联完成后,结果以三种形式输出。屏幕显示(OSD)呈现一个带有二维和三维边界框的网格图。俯视图(BEV)渲染一个自上而下的轨迹地图。Kafka 消息传递提供每帧的 protobuf 元数据,包括传感器 ID、对象 ID 以及三维边界框。

MV3DT依赖于校准摄像头,这传统上意味着使用棋盘格和停机时间。相反,AMC通过分析现有视频文件或流中的跟踪对象来校准网络。它会估计每个摄像头的内参(焦距、主点、镜头畸变),还会估计外参(旋转、平移、世界位置)。

在底层,该流程运行五个阶段。这些阶段是每个摄像头的轨迹提取、单视图矫正、多视图小轨迹匹配、束调整和可选的VGGT精炼。VGGT(视觉几何基础转换器)在物体运动有限时提供帮助。AMC作为微服务运行,提供REST API和网页界面。用户只需提供布局图像和几个对齐点。

在定义了MV3DT和AMC之后,交付机制就是技能本身。无需编辑配置文件,你只需用自然语言描述意图。这些技能可与Claude Code、Codex、Cursor及类似代理协作。设置过程简短:

启动代理后,通过单个提示即可运行参考应用:

从这里,MV3DT技能会验证先决条件,拉取容器,并安装Kafka和Mosquitto代理服务。它还会下载模型权重,生成流水线配置,并启动跟踪。值得注意的是,如果校准文件缺失,它会自动触发AMC技能。

作为背景,下表显示了各版本之间的变化。

基于这些能力,功能对应到具体部署:

要查看机制,下面的嵌入式演示展示了一个人在三个摄像头视野间行走的动画。切换查看单摄像头二维跟踪和MV3DT三维融合,即可观察物体ID保持一致。

需要与我们合作来推广您的GitHub仓库或Hugging Face页面或产品发布或网络研讨会等吗?请与我们联系:https://forms.gle/wbash1wF6efRj8G58

NVIDIA 发布 DeepStream 9.1,新增 13 项智能体技能与多视角 3D 追踪

Asif Razzaq 是 Marktechpost Media Inc. 的首席执行官。作为一个有远见的企业家和工程师,Asif 致力于利用人工智能的潜力为社会带来积极影响。他最近的努力是推出人工智能媒体平台 Marktechpost,该平台以对机器学习和深度学习新闻的深入报道而著称,这些报道既技术上可靠,又易于广大受众理解。该平台每月浏览量超过 200 万次,显示了其在观众中的受欢迎程度。

Perplexity AI Releases WANDR
10 Open-Source No-Code Platforms for Building LLM Apps, RAG Systems, and AI Agents
Kimi K3 vs DeepSeek V4 Pro vs GLM-5.2
Fine-Tuning Qwen3 with LoRA Using NVIDIA NeMo AutoModel

构建一个自主事件场地运营商 [完整代码]:https://pxllnk.co/twdn5

谢谢!我们的团队会尽快与您联系

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:NVIDIA 发布 DeepStream 9.1,新增 13 项 agentic skills,支持通过自然语言描述构建多摄像头视觉管线。 Aioga 将其归入「产品更新」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:产品与工具类动态的价值取决于它是否解决明确场景、能否进入工作流,以及交付、价格和数据安全是否可接受。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察产品是否开放使用、用户反馈、定价、集成能力和后续版本更新。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: marktechpost.com

来源: MarkTechPost(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-18T19:16:22.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

NVIDIA 发布 DeepStream 9.1,新增 13 项 agentic skills,支持通过自然语言描述构建多摄像头视觉管线。核心技能 MV3DT 将多摄像头检测投...

MarkTechPost(RSS)2026-07-18T19:16:22.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。