Aioga
AI资讯 / 论文研究
返回 AI资讯

小米发布Xiaomi-Robotics-U0:380亿参数多模态自回归模型统一具身合成

HuggingFace Daily Papers(社区热门论文)Aioga 编辑团队2026-07-13T14:57:58.000Z热度 76

小米推出Xiaomi-Robotics-U0,一个380亿参数的多模态自回归模型,用于统一具身合成。该模型将具身生成视为基础图像与视频生成的延伸,联合优化文生图、图像编辑、具身...

论文研究HuggingFace Daily Papers(社区热门论文)

今日 AI 情报摘要

小米推出Xiaomi-Robotics-U0,一个380亿参数的多模态自回归模型,用于统一具身合成。

该模型将具身生成视为基础图像与视频生成的延伸,联合优化文生图、图像编辑、具身场景生成、具身迁移及具身视频生成。 它是首个支持跨多种机器人形态的高质量多视角场景生成模型,并引入结构化可控具身迁移。 该模型在单步与序列生成任务上达到SOTA,在具身场景生成与迁移的人类评估中超越GPT-Image-2.0,在World Arena具身视频生成排名第一,并将pi_0.5在真实世界操控任务上的分布外成功率从36.9%提升至63.2%。 代码与检查点已开源。

中文正文 · AI 翻译

arXivLabs 是一个框架,允许合作者直接在我们的网站上开发和分享新的 arXiv 功能。

有一个可以为 arXiv 社区增加价值的项目想法吗?了解更多关于 arXivLabs 的信息:https://info.arxiv.org/labs/index.html。

Simons Foundation
Simons Foundation International

情报判断

Aioga 编辑摘要

材料摘要称,小米推出380亿参数多模态自回归模型Xiaomi-Robotics-U0,将图像、视频与多类具身生成任务纳入联合优化,并已开源代码与检查点。

背景分析

该模型把具身生成视为基础图像和视频生成的延伸,覆盖文生图、图像编辑、具身场景生成、具身迁移与具身视频生成。正文摘录仅介绍arXivLabs,未提供论文技术细节。

Aioga 观点

Aioga判断,其主要编辑价值在于尝试以单一自回归模型统一多种具身合成任务,并强调跨机器人形态和结构化控制;但现有材料中的性能结论主要来自摘要,仍需论文实验细节支撑。

影响与后续

若摘要所述结果可复现,该方法可能降低不同机器人形态间场景与视频数据生成的割裂程度,并为真实世界操控的分布外泛化提供辅助;目前不能据此推断其已具备通用机器人控制能力。 值得关注论文对训练数据、评测协议、基线设置、人类评估流程及真实世界任务的披露,并核验World Arena排名、与GPT-Image-2.0的比较,以及36.9%至63.2%的提升能否独立复现。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: arxiv.org

来源: HuggingFace Daily Papers(社区热门论文)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-13T14:57:58.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

小米推出Xiaomi-Robotics-U0,一个380亿参数的多模态自回归模型,用于统一具身合成。该模型将具身生成视为基础图像与视频生成的延伸,联合优化文生图、图像编辑、具身...

HuggingFace Daily Papers(社区热门论文)2026-07-13T14:57:58.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。