腾讯 Robotics X 实验室与福田实验室联合发布第二代具身 VLM 基座模型 Hy-Embodied-VLM-1.0。

该模型仅采用 A3B 规模,在 37 个评测任务中综合平均得分 65.6,整体性能接近上一代 A32B 旗舰模型。
模型已开源。
腾讯 Robotics X 实验室与福田实验室联合发布第二代具身 VLM 基座模型 Hy-Embodied-VLM-1.0。该模型仅采用 A3B 规模,在 37 个评测任务中综...
腾讯 Robotics X 实验室与福田实验室联合发布第二代具身 VLM 基座模型 Hy-Embodied-VLM-1.0。
该模型仅采用 A3B 规模,在 37 个评测任务中综合平均得分 65.6,整体性能接近上一代 A32B 旗舰模型。 模型已开源。
腾讯 Robotics X 实验室与福田实验室联合发布第二代具身 VLM 基座模型 Hy-Embodied-VLM-1.0。

该模型仅采用 A3B 规模,在 37 个评测任务中综合平均得分 65.6,整体性能接近上一代 A32B 旗舰模型。
模型已开源。
IT之家:https://www.ithome.com/ 7 月 17 日消息,腾讯 Robotics X 实验室、福田实验室联合腾讯混元打造的第二代具身 VLM 基座模型 Hy-Embodied-VLM-1.0 昨日正式发布。

官方表示,在覆盖 37 个评测任务的具身能力评测体系中,Hy-Embodied-VLM-1.0 在物理状态理解、动作 — 变化推理、时序与自适应推理三大维度分别取得 68.6、64.1 和 57.4 分,综合平均得分达到 65.6, 仅采用 A3B 规模,模型整体性能已接近上一代 A32B 旗舰模型 ,并显著优于同等规模的 Qwen3.6-A3B、Cosmos 3-8B、Embodied-R1 通用与具身模型。
据介绍,这一模型从物理空间状态理解、动作-变化理解、时序和自适应推理三个层次构建模型能力维度,增强了场景感知、行动分析规划、导航等面向具身 Agent 的多模态理解能力。
模型能够识别物体、属性、深度与空间关系,理解机器人视角、功能部件、可操作区域及环境可供性,形成与当前任务相关的物理世界状态表征。进一步地,模型可结合人机交互语义、目标对象与任务约束,完成下一步动作选择、目标与轨迹定位,并判断空间前置条件、动作可执行性及其局部物理影响。
面向长时程任务,模型还具备多步规划、视觉语言导航、历史与空间记忆、失败诊断、反事实分析和动态重规划能力,可依据目标、执行进度与环境反馈持续修正决策,实现从场景理解、局部因果推理到长期自适应执行的完整能力覆盖。

https://github.com/Tencent-Hunyuan/HY-Embodied :https://github.com/Tencent-Hunyuan/HY-Embodied
https://huggingface.co/tencent/Hy-Embodied-VLM-1.0 :https://huggingface.co/tencent/Hy-Embodied-VLM-1.0
Aioga 编辑摘要:腾讯 Robotics X 实验室与福田实验室联合发布第二代具身 VLM 基座模型 Hy-Embodied-VLM-1.0。 Aioga 将其归入「模型更新」方向,重点关注它对真实使用和行业竞争的影响。
背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。
Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。
影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。
本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。
抓取通道: RSS · 原始域名: ithome.com
来源: IT之家(RSS)
原文链接: 打开原始来源
Aioga 归档: 查看情报页
Content record: source-page · Updated: 2026-07-17T07:22:18.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。