Aioga
AI资讯 / 论文研究
返回 AI资讯

小米发布机器人AI模型Xiaomi-Robotics-1:更多训练数据比更大模型更有效

The Decoder:AI News(RSS)Aioga 编辑团队2026-07-21T08:56:51.000Z热度 42

小米发布机器人AI模型Xiaomi-Robotics-1,其性能随训练数据量提升而增长。团队使用便携手持夹持器替代实体机器人采集了超10万小时运动数据,并用AI模型在两周内完成...

论文研究The Decoder:AI News(RSS)

今日 AI 情报摘要

小米发布机器人AI模型Xiaomi-Robotics-1,其性能随训练数据量提升而增长。

团队使用便携手持夹持器替代实体机器人采集了超10万小时运动数据,并用AI模型在两周内完成全部标注。 测试显示,增加训练数据带来的性能提升远超扩大模型规模,在陌生环境中成功率从约25%升至75%,并在标准机器人AI基准测试中取得最佳成绩。

中文正文 · AI 翻译

小米发布了一个用于机器人的人工智能模型,其扩展模式与大型语言模型相同。随着训练数据的增加,其性能会提升。为了构建该数据集,小米在很大程度上避免使用实体机器人。

Image description

机器人 AI 面临一个语言模型没有的数据问题:大型语言模型可以在互联网上的海量公开数据上进行训练,而关于机器人运动的有用数据却很稀缺。机器人通常需要从零开始学习如何抓取、搬运和放置物品。标准方法是让人远程指导实体机器人完成每一个动作。这个过程既慢又昂贵,而且通常会在相同环境的相同任务中产生重复数据。

这就是 Xiaomi-Robotics-1 试图弥补的差距:https://github.com/XiaomiRobotics/Xiaomi-Robotics-1。该模型被设计为在不熟悉的环境中遵循口头或书面指令,并能通过少量额外训练适应新任务。

为了绕过数据瓶颈,小米在数据收集过程中基本上放弃了真实机器人。相反,团队使用了带有摄像头的便携手持抓手,人只需拿起并手动操作。这种设置可以在厨房、办公室、商店、工厂车间和户外空间记录操作任务,而无需机器人在场。最终获得了超过 10 万小时的运动记录。

Overview of the pretraining dataset showing camera footage from households, offices, industrial sites, restaurants, commercial spaces, and outdoor settings, with key figures: 100K hours, 1.7K scenarios, 2.4M episodes, and 260+ tasks, plus word clouds for objects and verbs.

如此大的数据集又带来了另一个问题,因为每段记录都需要模型可以学习的描述。完全手工标注不可行,因此小米使用了另一种 AI 模型来将每段运动记录转换为文本描述。团队表示,他们约在两周内完成了整个数据集的标注。

随后,小米将这些训练迁移至实体机器人,包括轮式模型和双臂系统。模型仍需考虑手持抓手与机器人手臂之间的差异。

Three-part overview of post-training data showing in-house robot recordings, renderings of a mobile manipulator and dual-arm robot, open-source robot data, and UMI data with instruction labels.

测试表明,较大的模型提升了性能,但更多的训练数据带来的增益远大于更多的计算资源。研究人员表示,机器人 AI 的进展主要依赖于收集更大、更丰富的数据集。

这一发现与研究人员在三月初对视觉数据的展示一致:https://the-decoder.com/llm-text-data-is-drying-up-but-meta-points-to-unlabeled-video-as-the-next-massive-training-frontier/。对于语言模型来说,长期以来的规则是模型规模和数据量应大致以相同的速度增长:https://arxiv.org/abs/2203.15556,以在固定计算预算下实现最佳利用。当模型必须处理图像而不仅仅是文本时,这种平衡会发生变化。在这种情况下,增加数据的帮助远大于增加模型规模。

Two line charts showing Validation Action Error (MSE) over training steps, with the left chart scaling by data volume from 12.5 to 100 percent and the right chart scaling by model size from 2B to 10B parameters.

在与物理机器人进行的测试中也出现了相同的模式。随着小米增加训练数据量,模型在陌生环境中的成功率从约25%上升至75%。研究人员表示,他们尚未达到数据增加不再提升性能的程度。

Two bar charts showing success rates in percent for shoe storage, bag packing, table organization, and sofa tidying tasks, broken down by pretraining data percentage and by model size.

小米表示,小米机器人1号在标准机器人AI基准测试中取得了迄今为止的最佳成绩。在一次演示中,据称机器人无需人工帮助就完成了整理行李的任务。该任务耗时超过十分钟,并要求机器人在整个房间内移动。

当基础模型能够快速适应新任务时,它最为有用。小米在四项任务上测试了小米机器人1号,包括包装手机、将衣物放入洗衣机、将纸张送入打印机以及将物品装入箱子。

在每项任务的训练数据少于十小时的情况下,模型达到了平均75%的成功率。来自Physical Intelligence的竞争模型在同一测试中仅达到40%。小米表示,其模型在处理纸张等柔软、易变形的材料以及需要在房间内移动的任务时表现特别出色。

RoboCasa365 leaderboard table showing Xiaomi-Robotics-1 in first place with 57.4 points, ahead of ABot-M0.6 at 46.6 and ABot-M0.5 at 40.3.

机器人数据仍然是机器人研究的主要关注点,各团队正在追求非常不同的解决方案。五月份关于世界行动模型的调查:https://the-decoder.com/world-action-models-give-robots-the-ability-to-simulate-consequences-before-they-move/ 回顾了约100项研究,发现遥操作数据精确但成本高,并且仅限于少数环境。小米的手持抓取器旨在解决这些限制。

英伟达、卡内基梅隆大学和加州大学伯克利分校利用 ENPIRE 项目让 AI 编码代理自主教授八台机器人如何抓取物体:https://the-decoder.com/nvidia-research-shows-robots-that-train-themselves-through-ai-coding-agents/。英伟达还希望通过生成合成训练数据,将机器人学的数据问题转化为计算问题:https://the-decoder.com/gtc-2026-nvidia-wants-to-swap-robotics-data-problem-for-a-compute-problem/。

中国的 BAAI 研究院则走了相反的路线。其 Orca 世界模型通过 125,000 小时的视频学习,无需任何动作标签:https://the-decoder.com/chinas-orca-world-model-matches-specialized-robotics-systems-without-ever-seeing-a-single-action-label/,并且在五个操作任务中仍然能够匹配专业的 pi0.5 模型。小米实现了标签自动化并大规模应用,而 Orca 则尝试完全消除标签。

Physical Intelligence 在这两种情况下都作为参考点。该公司在四月份因为 pi0.7 而受到批评:https://the-decoder.com/physical-intelligence-shows-robot-model-with-llm-like-generalization-flaws-included/,有人认为该模型可能是在回忆相似的训练数据,而不是实现真正的泛化。小米发现更多数据比更多计算更重要,这使得这个问题更难解决。

这项工作也符合小米的更广泛计划。当公司在三月推出 MiMo-V2 模型时:https://the-decoder.com/xiaomi-launches-three-mimo-ai-models-to-power-agents-robots-and-voice/,表示这些代理最终可以控制机器人。

小米计划在 GitHub:https://github.com/XiaomiRobotics/Xiaomi-Robotics-1 和 Hugging Face:https://huggingface.co/XiaomiRobotics 上发布模型和代码。同一团队最近发布了 Xiaomi-Robotics-0 开源版本,重点是快速、实时操作。

保持对 AI 的关注。清晰、有用,无花哨。

关注 The Decoder 获取 AI 新闻、背景故事和专家分析。

The Decoder:https://the-decoder.com/

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:小米发布机器人AI模型Xiaomi-Robotics-1,其性能随训练数据量提升而增长。 Aioga 将其归入「论文研究」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: the-decoder.com

来源: The Decoder:AI News(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-21T08:56:51.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

小米发布机器人AI模型Xiaomi-Robotics-1,其性能随训练数据量提升而增长。团队使用便携手持夹持器替代实体机器人采集了超10万小时运动数据,并用AI模型在两周内完成...

The Decoder:AI News(RSS)2026-07-21T08:56:51.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。