{"@context":"https://schema.org","@type":"NewsArticle","generatedAt":"2026-07-23T07:21:26.498Z","headline":"小米发布Xiaomi-Robotics-U0：380亿参数多模态自回归模型统一具身合成","description":"小米推出Xiaomi-Robotics-U0，一个380亿参数的多模态自回归模型，用于统一具身合成。该模型将具身生成视为基础图像与视频生成的延伸，联合优化文生图、图像编辑、具身场景生成、具身迁移及具身视频生成。它是首个支持跨多种机器人形态的高质量多视角场景生成模型，并引入结构化可控具身迁移。该模型在单步与序列生成任务上达到SOTA，在具身场景生成与迁移的人类评估中超越GPT-Image-2.0，在World Arena具身视频生成排名第一，并将pi_0.5在真实世界操控任务上的分布外成功率从36.9%提升至63.2%。代码与检查点已开源。","url":"https://www.aioga.com/news/cmrkswubg00wabi5qrgj8jc2l/","mainEntityOfPage":"https://www.aioga.com/news/cmrkswubg00wabi5qrgj8jc2l/","datePublished":"2026-07-13T14:57:58.000Z","dateModified":"2026-07-13T14:57:58.000Z","inLanguage":"zh-CN","publisher":{"@type":"NewsMediaOrganization","name":"Aioga","url":"https://www.aioga.com"},"citation":["https://arxiv.org/abs/2607.11643","https://aihot.virxact.com/items/cmrkswubg00wabi5qrgj8jc2l"],"canonicalUrl":"https://www.aioga.com/news/cmrkswubg00wabi5qrgj8jc2l/","directAnswer":{"@type":"Answer","text":"材料摘要称，小米推出380亿参数多模态自回归模型Xiaomi-Robotics-U0，将图像、视频与多类具身生成任务纳入联合优化，并已开源代码与检查点。","url":"https://www.aioga.com/news/cmrkswubg00wabi5qrgj8jc2l/","dateCreated":"2026-07-13T14:57:58.000Z","author":{"@type":"Organization","@id":"https://www.aioga.com/authors/aioga-editorial/#editorial-team","name":"Aioga Editorial Team","url":"https://www.aioga.com/authors/aioga-editorial/"}},"evidence":[{"@type":"CreativeWork","name":"arXiv source article","url":"https://arxiv.org/abs/2607.11643","datePublished":"2026-07-13T14:57:58.000Z","provider":{"@type":"Organization","name":"arXiv","url":"https://arxiv.org/abs/2607.11643"}},{"@type":"CreativeWork","name":"AIHot archive record","url":"https://aihot.virxact.com/items/cmrkswubg00wabi5qrgj8jc2l","datePublished":"2026-07-13T14:57:58.000Z","provider":{"@type":"Organization","name":"AIHot","url":"https://aihot.virxact.com/items/cmrkswubg00wabi5qrgj8jc2l"}}],"aggregationSource":"HuggingFace Daily Papers（社区热门论文）","originalPublisher":{"name":"arXiv","url":"https://arxiv.org/abs/2607.11643"},"article":{"id":"cmrkswubg00wabi5qrgj8jc2l","slug":"cmrkswubg00wabi5qrgj8jc2l","url":"https://www.aioga.com/news/cmrkswubg00wabi5qrgj8jc2l/","title":"小米发布Xiaomi-Robotics-U0：380亿参数多模态自回归模型统一具身合成","title_en":"Xiaomi-Robotics-U0： Unified Embodied Synthesis with World Foundation Model","summary":"小米推出Xiaomi-Robotics-U0，一个380亿参数的多模态自回归模型，用于统一具身合成。该模型将具身生成视为基础图像与视频生成的延伸，联合优化文生图、图像编辑、具身场景生成、具身迁移及具身视频生成。它是首个支持跨多种机器人形态的高质量多视角场景生成模型，并引入结构化可控具身迁移。该模型在单步与序列生成任务上达到SOTA，在具身场景生成与迁移的人类评估中超越GPT-Image-2.0，在World Arena具身视频生成排名第一，并将pi_0.5在真实世界操控任务上的分布外成功率从36.9%提升至63.2%。代码与检查点已开源。","source":"HuggingFace Daily Papers（社区热门论文）","sourceUrl":"https://arxiv.org/abs/2607.11643","aiHotUrl":"https://aihot.virxact.com/items/cmrkswubg00wabi5qrgj8jc2l","publishedAt":"2026-07-13T14:57:58.000Z","category":"论文研究","score":76,"selected":true,"articleBody":["arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.","Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs ：https://info.arxiv.org/labs/index.html."],"articleImages":[{"sourceUrl":"https://arxiv.org/static/base/1.0.1/images/funders/simons-foundation.png","alt":"Simons Foundation","afterParagraph":1,"url":"/media/articles/cmrkswubg00wabi5qrgj8jc2l/e2d7f38d62f5ca91.png"},{"sourceUrl":"https://arxiv.org/static/base/1.0.1/images/funders/simons-foundation-international.png","alt":"Simons Foundation International","afterParagraph":1,"url":"/media/articles/cmrkswubg00wabi5qrgj8jc2l/1d56e29c5557cbdc.png"}],"mediaStatus":"ok","articleBodyZh":["arXivLabs 是一个框架，允许合作者直接在我们的网站上开发和分享新的 arXiv 功能。","有一个可以为 arXiv 社区增加价值的项目想法吗？了解更多关于 arXivLabs 的信息：https://info.arxiv.org/labs/index.html。"],"translationStatus":"translated","bodyOrigin":"source-page","editorial":{"summary":"材料摘要称，小米推出380亿参数多模态自回归模型Xiaomi-Robotics-U0，将图像、视频与多类具身生成任务纳入联合优化，并已开源代码与检查点。","background":"该模型把具身生成视为基础图像和视频生成的延伸，覆盖文生图、图像编辑、具身场景生成、具身迁移与具身视频生成。正文摘录仅介绍arXivLabs，未提供论文技术细节。","viewpoint":"Aioga判断，其主要编辑价值在于尝试以单一自回归模型统一多种具身合成任务，并强调跨机器人形态和结构化控制；但现有材料中的性能结论主要来自摘要，仍需论文实验细节支撑。","implications":"若摘要所述结果可复现，该方法可能降低不同机器人形态间场景与视频数据生成的割裂程度，并为真实世界操控的分布外泛化提供辅助；目前不能据此推断其已具备通用机器人控制能力。","nextStep":"值得关注论文对训练数据、评测协议、基线设置、人类评估流程及真实世界任务的披露，并核验World Arena排名、与GPT-Image-2.0的比较，以及36.9%至63.2%的提升能否独立复现。","evidenceRefs":["title","summary","articleBody","source"],"status":"published","aiGenerated":true,"autoApproved":true,"generatedBy":"aioga-editorial:gpt-5.6-sol","reviewedBy":"aioga-editorial-review:gpt-5.6-sol","generatedAt":"2026-07-22T19:51:34.427Z","sourceHash":"e80051eedacc640e","review":{"approved":true,"groundedness":96,"clarity":92,"duplicationRisk":18,"blockingIssues":[],"notes":["候选内容准确区分了摘要中的技术与性能主张、正文摘录的有限信息以及编辑判断。","对潜在影响使用“若摘要所述结果可复现”“可能”等条件性表述，并明确不能推断其具备通用机器人控制能力，避免了过度结论。","后续核验项与来源摘要中的World Arena排名、GPT-Image-2.0比较及真实世界操控成功率数据直接对应。"]},"validation":{"passed":true,"mode":"ai-auto","revisions":0,"checks":["schema","length","source-attribution","low-source-overlap","no-html","independent-ai-review"]}},"tags":["论文研究","HuggingFace Daily Papers（社区热门论文）"],"translations":{"zh-CN":{"title":"小米发布Xiaomi-Robotics-U0：380亿参数多模态自回归模型统一具身合成","summary":"小米推出Xiaomi-Robotics-U0，一个380亿参数的多模态自回归模型，用于统一具身合成。该模型将具身生成视为基础图像与视频生成的延伸，联合优化文生图、图像编辑、具身场景生成、具身迁移及具身视频生成。它是首个支持跨多种机器人形态的高质量多视角场景生成模型，并引入结构化可控具身迁移。该模型在单步与序列生成任务上达到SOTA，在具身场景生成与迁移的人类评估中超越GPT-Image-2.0，在World Arena具身视频生成排名第一，并将pi_0.5在真实世界操控任务上的分布外成功率从36.9%提升至63.2%。代码与检查点已开源。","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"小米发布Xiaomi-Robotics-U0：380亿参数多模态自回归模型统一具身合成 - Aioga AI资讯","description":"小米推出Xiaomi-Robotics-U0，一个380亿参数的多模态自回归模型，用于统一具身合成。该模型将具身生成视为基础图像与视频生成的延伸，联合优化文生图、图像编辑、具身场景生成、具身迁移及具身视频生成。它是首个支持跨多种机器人形态的高质量多视角场景生成模型，并引入结构化可控具身迁移。该模型在单步与序列生成任务上达到SOTA，在具身场景生成与迁移的人类","url":"https://www.aioga.com/news/cmrkswubg00wabi5qrgj8jc2l/"},"en":{"title":"Xiaomi released Xiaomi-Robotics-U0: a 38-billion-parameter multimodal autoregressive model unified embodied synthesis","summary":"Xiaomi launched Xiaomi-Robotics-U0, a 38-billion-parameter multimodal autoregressive model for unified embodied synthesis. This model views embodied generation as an extension of basic image and video generation, jointly optimizing text-to-image, image editing, embodied scene generation, embodied migration, and embodied video generation. It is the first model to support high-quality multi-view scene generation across various robot forms, introducing structured, controllable embodiment migration. The model achieves SOTA in single-step and sequential generation tasks, surpasses GPT-Image-2.0 in human evaluation of embodied scene generation and transfer, ranks first in embodied video generation in World Arena, and increases pi_0.5's out-of-distribution success rate on real-world manipulation tasks from 36.9% to 63.2%. The code and checkpoints are open source.","category":"Research","source":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Xiaomi released Xiaomi-Robotics-U0: a 38-billion-parameter multimodal autoregressive model unified embodied synthesis - Aioga AI News","description":"Xiaomi launched Xiaomi-Robotics-U0, a 38-billion-parameter multimodal autoregressive model for unified embodied synthesis. This model views embodied generation as an extension of b","url":"https://www.aioga.com/en/news/cmrkswubg00wabi5qrgj8jc2l/","contentTranslated":true,"sourceHash":"6c5c4baabf9ae925","translatedAt":"2026-07-19T12:15:04.641Z"},"ja":{"title":"XiaomiはXiaomi-Robotics-U0をリリースしました。これは380億パラメータのマルチモーダル自己回帰モデルで、統合された身体統合モデルです","summary":"Xiaomiは、統一された身体合成のための380億パラメータのマルチモーダル自己回帰モデル「Xiaomi-Robotics-U0」を発表しました。 このモデルは、具身生成を基本的な画像および映像生成の延長として捉え、テキストから画像への変換、画像編集、具身シーン生成、身体化移動、具身化ビデオ生成を共同で最適化します。 これは、さまざまなロボット形態で高品質なマルチビューシーン生成をサポートする初のモデルであり、構造化され制御可能な身体移行を導入しました。 このモデルは単一段階および逐次生成タスクでSOTAを達成し、具現化シーン生成と転送の人間評価ではGPT-Image-2.0を上回り、World Arenaの具現化映像生成で1位にランクされ、pi_0.5の実世界の操作タスクにおける流通外成功率を36.9%から63.2%に引き上げました。 コードとチェックポイントはオープンソースです。","category":"論文研究","source":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"XiaomiはXiaomi-Robotics-U0をリリースしました。これは380億パラメータのマルチモーダル自己回帰モデルで、統合された身体統合モデルです - Aioga AIニュース","description":"Xiaomiは、統一された身体合成のための380億パラメータのマルチモーダル自己回帰モデル「Xiaomi-Robotics-U0」を発表しました。 このモデルは、具身生成を基本的な画像および映像生成の延長として捉え、テキストから画像への変換、画像編集、具身シーン生成、身体化移動、具身化ビデオ生成を共同で最適化します。 これは、さまざまなロボット形態で高品質な","url":"https://www.aioga.com/ja/news/cmrkswubg00wabi5qrgj8jc2l/","contentTranslated":true,"sourceHash":"6c5c4baabf9ae925","translatedAt":"2026-07-19T12:15:04.798Z"},"ko":{"title":"샤오미는 380억 파라미터의 다중 모달 자기회귀 통합 통합 합성 모델인 샤오미-로보틱스-U0를 출시했습니다","summary":"샤오미는 통합된 구현 합성을 위한 380억 파라미터 다중 모달 자기회귀 모델인 샤오미-로보틱스-U0를 출시했습니다. 이 모델은 내재 생성을 기본 이미지 및 비디오 생성의 확장으로 보고, 텍스트-이미지, 이미지 편집, 내체된 장면 생성, 내체된 이동, 내체된 비디오 생성을 공동으로 최적화합니다. 이 모델은 다양한 로봇 형태에서 고품질 다중 뷰 장면 생성을 지원하는 최초의 모델로, 구조적이고 제어 가능한 구현 이동을 도입했습니다. 이 모델은 단일 단계 및 순차 생성 작업에서 SOTA를 달성했으며, 구현된 장면 생성 및 전송에 대한 인간 평가에서 GPT-Image-2.0을 능가하고, World Arena에서 구현된 비디오 생성 부문에서 1위를 차지하며, 실제 조작 작업에서 pi_0.5의 배포 외 성공률을 36.9%에서 63.2%로 높였습니다. 코드와 체크포인트는 오픈 소스입니다.","category":"연구","source":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"샤오미는 380억 파라미터의 다중 모달 자기회귀 통합 통합 합성 모델인 샤오미-로보틱스-U0를 출시했습니다 - Aioga AI 뉴스","description":"샤오미는 통합된 구현 합성을 위한 380억 파라미터 다중 모달 자기회귀 모델인 샤오미-로보틱스-U0를 출시했습니다. 이 모델은 내재 생성을 기본 이미지 및 비디오 생성의 확장으로 보고, 텍스트-이미지, 이미지 편집, 내체된 장면 생성, 내체된 이동, 내체된 비디오 생성을 공동으로 최적화합니다. 이 모델은 다양한 로봇 형태","url":"https://www.aioga.com/ko/news/cmrkswubg00wabi5qrgj8jc2l/","contentTranslated":true,"sourceHash":"6c5c4baabf9ae925","translatedAt":"2026-07-19T12:15:04.709Z"},"es":{"title":"Xiaomi lanzó Xiaomi-Robotics-U0: un modelo autorregresivo multimodal de 38.000 millones de parámetros que unifica la síntesis incorporada","summary":"Xiaomi lanzó Xiaomi-Robotics-U0, un modelo autoregresivo multimodal de 38 mil millones de parámetros para síntesis incorporada unificada. Este modelo considera la generación incorporada como una extensión de la generación básica de imágenes y vídeo, optimizando conjuntamente el texto a imagen, la edición de imágenes, la generación de escenas incorporadas, la migración incorporada y la generación de vídeo incorporado. Es el primer modelo que soporta la generación de escenas multivista de alta calidad en diversas formas robóticas, introduciendo una migración estructurada y controlable de la incorporación. El modelo logra SOTA en tareas de generación de un solo paso y secuencial, supera a GPT-Image-2.0 en la evaluación humana de la generación y transferencia de escenas incorporadas, ocupa el primer lugar en generación de vídeo incorporado en World Arena y aumenta la tasa de éxito fuera de distribución de pi_0.5 en tareas de manipulación del mundo real del 36,9% al 63,2%. El código y los puntos de control son de código abierto.","category":"Investigación","source":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Xiaomi lanzó Xiaomi-Robotics-U0: un modelo autorregresivo multimodal de 38.000 millones de parámetros que unifica la síntesis incorporada - Aioga Noticias de IA","description":"Xiaomi lanzó Xiaomi-Robotics-U0, un modelo autoregresivo multimodal de 38 mil millones de parámetros para síntesis incorporada unificada. Este modelo considera la generación incorp","url":"https://www.aioga.com/es/news/cmrkswubg00wabi5qrgj8jc2l/","contentTranslated":true,"sourceHash":"6c5c4baabf9ae925","translatedAt":"2026-07-19T12:15:04.880Z"},"fr":{"title":"Xiaomi a lancé Xiaomi-Robotics-U0 : un modèle autorégressif multimodal unifié de 38 milliards de paramètres","summary":"Xiaomi a lancé Xiaomi-Robotics-U0, un modèle autorégressif multimodal de 38 milliards de paramètres pour la synthèse unifiée de l’incarnation. Ce modèle considère la génération incarnée comme une extension de la génération d’images et de vidéos de base, optimisant conjointement le texte à image, le montage d’images, la génération de scènes incarnées, la migration incarnée et la génération vidéo incarnée. C’est le premier modèle à supporter la génération de scènes multi-vues de haute qualité sur différentes formes de robots, introduisant une migration structurée et contrôlable des incarnations. Le modèle atteint la SOTA dans les tâches de génération en une étape et séquentielle, dépasse GPT-Image-2.0 dans l’évaluation humaine de la génération et du transfert de scènes incarnées, se classe premier en génération vidéo incarnée dans World Arena, et augmente le taux de réussite hors distribution de pi_0.5 sur les tâches de manipulation réelles de 36,9 % à 63,2 %. Le code et les points de contrôle sont open source.","category":"Recherche","source":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Xiaomi a lancé Xiaomi-Robotics-U0 : un modèle autorégressif multimodal unifié de 38 milliards de paramètres - Aioga Actualités IA","description":"Xiaomi a lancé Xiaomi-Robotics-U0, un modèle autorégressif multimodal de 38 milliards de paramètres pour la synthèse unifiée de l’incarnation. Ce modèle considère la génération inc","url":"https://www.aioga.com/fr/news/cmrkswubg00wabi5qrgj8jc2l/","contentTranslated":true,"sourceHash":"6c5c4baabf9ae925","translatedAt":"2026-07-19T12:15:04.834Z"},"de":{"title":"Xiaomi veröffentlichte Xiaomi-Robotics-U0: ein multimodales autoregressives Modell mit 38 Milliarden Parametern, das einheitliche verkörperte Synthese vereinheitlicht","summary":"Xiaomi brachte Xiaomi-Robotics-U0 auf den Markt, ein multimodales autoregressives Modell mit 38 Milliarden Parametern für einheitliche verkörperte Synthese. Dieses Modell betrachtet die verkörperte Generierung als eine Erweiterung der grundlegenden Bild- und Videogenerierung und optimiert gemeinsam Text-zu-Bild, Bildbearbeitung, verkörperte Szenengenerierung, verkörperte Migration und verkörperte Videogenerierung. Es ist das erste Modell, das hochwertige Multi-View-Szenengenerierung über verschiedene Roboterformen hinweg unterstützt und eine strukturierte, steuerbare Verkörperungsmigration einführt. Das Modell erreicht SOTA in einstufigen und sequentiellen Generierungsaufgaben, übertrifft GPT-Image-2.0 bei der menschlichen Bewertung von verkörperter Szenengenerierung und -übertragung, belegt den ersten Platz bei der Generierung von verkörperten Videos in World Arena und erhöht die Erfolgsquote von pi_0,5 bei realen Manipulationsaufgaben von 36,9 % auf 63,2 %. Der Code und die Checkpoints sind Open Source.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Xiaomi veröffentlichte Xiaomi-Robotics-U0: ein multimodales autoregressives Modell mit 38 Milliarden Parametern, das einheitliche verkörperte Synthese vereinheitlicht - Aioga KI-News","description":"Xiaomi brachte Xiaomi-Robotics-U0 auf den Markt, ein multimodales autoregressives Modell mit 38 Milliarden Parametern für einheitliche verkörperte Synthese. Dieses Modell betrachte","url":"https://www.aioga.com/de/news/cmrkswubg00wabi5qrgj8jc2l/","contentTranslated":true,"sourceHash":"6c5c4baabf9ae925","translatedAt":"2026-07-19T12:15:11.141Z"},"pt-BR":{"title":"A Xiaomi lançou Xiaomi-Robotics-U0: um modelo autoregressivo multimodal de 38 bilhões de parâmetros que unifica a síntese incorporada","summary":"A Xiaomi lançou o Xiaomi-Robotics-U0, um modelo autoregressivo multimodal multimodal com 38 bilhões de parâmetros para síntese incorporada unificada. Este modelo vê a geração incorporada como uma extensão da geração básica de imagens e vídeos, otimizando conjuntamente texto para imagem, edição de imagens, geração de cena incorporada, migração incorporada e geração de vídeo incorporado. É o primeiro modelo a suportar geração de cenas multi-vista de alta qualidade em várias formas robóticas, introduzindo migração estruturada e controlável de corpos. O modelo alcança SOTA em tarefas de geração em etapas únicas e sequenciais, supera o GPT-Image-2.0 na avaliação humana da geração e transferência de cenas incorporadas, ocupa o primeiro lugar em geração de vídeo incorporado na World Arena e aumenta a taxa de sucesso fora de distribuição do pi_0.5 em tarefas de manipulação do mundo real de 36,9% para 63,2%. O código e os checkpoints são open source.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"A Xiaomi lançou Xiaomi-Robotics-U0: um modelo autoregressivo multimodal de 38 bilhões de parâmetros que unifica a síntese incorporada - Aioga Notícias de IA","description":"A Xiaomi lançou o Xiaomi-Robotics-U0, um modelo autoregressivo multimodal multimodal com 38 bilhões de parâmetros para síntese incorporada unificada. Este modelo vê a geração incor","url":"https://www.aioga.com/pt-BR/news/cmrkswubg00wabi5qrgj8jc2l/","contentTranslated":true,"sourceHash":"6c5c4baabf9ae925","translatedAt":"2026-07-19T12:15:09.313Z"},"ru":{"title":"Xiaomi выпустила Xiaomi-Robotics-U0: мультимодальную авторегрессивную модель унифицированного синтеза с 38 миллиардами параметров","summary":"Xiaomi выпустила Xiaomi-Robotics-U0 — мультимодальную авторегрессивную модель с 38 миллиардами параметров для унифицированного воплощённого синтеза. Эта модель рассматривает воплощённое поколение как расширение базовой генерации изображений и видео, совместно оптимизируя процесс преобразования текста в изображение, редактирование изображений, генерацию воплощённой сцены, воплощённую миграцию и генерацию воплощённого видео. Это первая модель, поддерживающая высококачественную многовидную генерацию сцен в различных формах роботов, вводя структурированную, управляемую миграцию воплощений. Модель достигает SOTA в одноступенчатых и последовательных задачах генерации, превосходит GPT-Image-2.0 в оценке человеческой генерации и передачи воплощённой сцены, занимает первое место по генерации воплощённого видео в World Arena и повышает уровень успешности pi_0.5 вне дистрибуции в реальных манипуляционных задачах с 36,9% до 63,2%. Код и контрольные точки — с открытым исходным кодом.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Xiaomi выпустила Xiaomi-Robotics-U0: мультимодальную авторегрессивную модель унифицированного синтеза с 38 миллиардами параметров - Aioga Новости ИИ","description":"Xiaomi выпустила Xiaomi-Robotics-U0 — мультимодальную авторегрессивную модель с 38 миллиардами параметров для унифицированного воплощённого синтеза. Эта модель рассматривает воплощ","url":"https://www.aioga.com/ru/news/cmrkswubg00wabi5qrgj8jc2l/","contentTranslated":true,"sourceHash":"6c5c4baabf9ae925","translatedAt":"2026-07-19T12:15:10.005Z"},"ar":{"title":"أصدرت شاومي Xiaomi-Robotics-U0: نموذج ذاتي متعدد الوسائط متعدد الوسائط بسعة 38 مليار معاملة، تركيب موحد متجسد","summary":"أطلقت شاومي نموذج Xiaomi-Robotics-U0، وهو نموذج ذاتي متعدد الوسائط بقيمة 38 مليار معاملة لتركيب موحد متجسد. يرى هذا النموذج التوليد المتجسد كامتداد لتوليد الصور والفيديو الأساسي، حيث يحسن معا تحويل النص إلى صورة، وتحرير الصور، وتوليد المشاهد المتجسدة، والهجرة المجسدة، وتوليد الفيديو المجسد. وهو أول نموذج يدعم توليد المشاهد متعددة المشاهدة عالية الجودة عبر أشكال روبوتات مختلفة، مقدما ترحيل تجسيد منظم وقابل للتحكم. يحقق النموذج SOTA في مهام التوليد بخطوة واحدة وتسلسل الإنتاج، ويتجاوز GPT-Image-2.0 في التقييم البشري لتوليد ونقل المشاهد المتجسدة، ويحتل المرتبة الأولى في توليد الفيديو المجسد في World Arena، ويزيد من معدل نجاح pi_0.5 خارج التوزيع في مهام التلاعب الحقيقية من 36.9٪ إلى 63.2٪. الكود ونقاط التفتيش مفتوحة المصدر.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"أصدرت شاومي Xiaomi-Robotics-U0: نموذج ذاتي متعدد الوسائط متعدد الوسائط بسعة 38 مليار معاملة، تركيب موحد متجسد - Aioga أخبار الذكاء الاصطناعي","description":"أطلقت شاومي نموذج Xiaomi-Robotics-U0، وهو نموذج ذاتي متعدد الوسائط بقيمة 38 مليار معاملة لتركيب موحد متجسد. يرى هذا النموذج التوليد المتجسد كامتداد لتوليد الصور والفيديو الأساسي، ح","url":"https://www.aioga.com/ar/news/cmrkswubg00wabi5qrgj8jc2l/","contentTranslated":true,"sourceHash":"6c5c4baabf9ae925","translatedAt":"2026-07-19T12:15:10.899Z"},"hi":{"title":"Xiaomi ने Xiaomi-Robotics-U0 जारी किया: एक 38-बिलियन-पैरामीटर मल्टीमॉडल ऑटोरेग्रेसिव मॉडल एकीकृत सन्निहित संश्लेषण","summary":"Xiaomi ने Xiaomi-Robotics-U0 लॉन्च किया, जो एकीकृत सन्निहित संश्लेषण के लिए 38-बिलियन-पैरामीटर मल्टीमॉडल ऑटोरेग्रेसिव मॉडल है। यह मॉडल सन्निहित पीढ़ी को बुनियादी छवि और वीडियो पीढ़ी के विस्तार के रूप में देखता है, संयुक्त रूप से टेक्स्ट-टू-इमेज, छवि संपादन, सन्निहित दृश्य निर्माण, सन्निहित प्रवासन और सन्निहित वीडियो पीढ़ी का अनुकूलन करता है। यह विभिन्न रोबोट रूपों में उच्च गुणवत्ता वाले बहु-दृश्य दृश्य पीढ़ी का समर्थन करने वाला पहला मॉडल है, जो संरचित, नियंत्रणीय अवतार प्रवास पेश करता है। मॉडल एकल-चरण और अनुक्रमिक पीढ़ी के कार्यों में SOTA प्राप्त करता है, सन्निहित दृश्य निर्माण और स्थानांतरण के मानव मूल्यांकन में GPT-Image-2.0 को पार करता है, विश्व क्षेत्र में सन्निहित वीडियो पीढ़ी में पहले स्थान पर है, और वास्तविक दुनिया के हेरफेर कार्यों पर pi_0.5 की आउट-ऑफ-डिस्ट्रीब्यूशन सफलता दर को 36.9% से बढ़ाकर 63.2% कर देता है। कोड और चौकियां ओपन सोर्स हैं।","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Xiaomi ने Xiaomi-Robotics-U0 जारी किया: एक 38-बिलियन-पैरामीटर मल्टीमॉडल ऑटोरेग्रेसिव मॉडल एकीकृत सन्निहित संश्लेषण - Aioga AI समाचार","description":"Xiaomi ने Xiaomi-Robotics-U0 लॉन्च किया, जो एकीकृत सन्निहित संश्लेषण के लिए 38-बिलियन-पैरामीटर मल्टीमॉडल ऑटोरेग्रेसिव मॉडल है। यह मॉडल सन्निहित पीढ़ी को बुनियादी छवि और वीडियो पीढ़","url":"https://www.aioga.com/hi/news/cmrkswubg00wabi5qrgj8jc2l/","contentTranslated":true,"sourceHash":"6c5c4baabf9ae925","translatedAt":"2026-07-19T12:15:12.241Z"},"it":{"title":"Xiaomi ha lanciato Xiaomi-Robotics-U0: un modello autoregressivo multimodale da 38 miliardi di parametri che unifica la sintesi incorporata","summary":"Xiaomi ha lanciato Xiaomi-Robotics-U0, un modello autoregressivo multimodale da 38 miliardi di parametri per la sintesi incarnata unificata. Questo modello considera la generazione incarnata come un'estensione della generazione di base di immagini e video, ottimizzando congiuntamente il testo-immagine, il montaggio delle immagini, la generazione di scene incarnate, la migrazione incorporata e la generazione di video incarnato. È il primo modello a supportare la generazione di scene multi-view di alta qualità tra varie forme robotiche, introducendo una migrazione strutturata e controllabile dell'incarnazione. Il modello raggiunge SOTA nei compiti di generazione a singolo passaggio e sequenziali, supera GPT-Image-2.0 nella valutazione umana della generazione e trasferimento di scene incarnate, si classifica primo nella generazione di video incarnati nel World Arena e aumenta il tasso di successo fuori distribuzione di pi_0.5 nei compiti di manipolazione reali dal 36,9% al 63,2%. Il codice e i checkpoint sono open source.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Xiaomi ha lanciato Xiaomi-Robotics-U0: un modello autoregressivo multimodale da 38 miliardi di parametri che unifica la sintesi incorporata - Aioga Notizie IA","description":"Xiaomi ha lanciato Xiaomi-Robotics-U0, un modello autoregressivo multimodale da 38 miliardi di parametri per la sintesi incarnata unificata. Questo modello considera la generazione","url":"https://www.aioga.com/it/news/cmrkswubg00wabi5qrgj8jc2l/","contentTranslated":true,"sourceHash":"6c5c4baabf9ae925","translatedAt":"2026-07-19T12:15:09.986Z"},"nl":{"title":"Xiaomi bracht Xiaomi-Robotics-U0 uit: een multimodal autoregressief model met 38 miljard parameters en een verenigd belichaamd synthese","summary":"Xiaomi lanceerde Xiaomi-Robotics-U0, een multimodaal autoregressief model met 38 miljard parameters voor unified embodied synthese. Dit model ziet belichaamde generatie als een uitbreiding van basisbeeld- en videogeneratie, waarbij gezamenlijk tekst-naar-beeld, beeldbewerking, belichaamde scènegeneratie, belichaamde migratie en belichaamde videogeneratie worden geoptimaliseerd. Het is het eerste model dat hoogwaardige multi-view scènegeneratie ondersteunt over verschillende robotvormen, waarmee gestructureerde, beheersbare embodimentmigratie wordt geïntroduceerd. Het model behaalt SOTA in single-step en sequentiële generatietaken, overtreft GPT-Image-2.0 in menselijke evaluatie van belichaamde scènegeneratie en -overdracht, staat eerste in belichaamde videogeneratie in World Arena, en verhoogt het slagingspercentage van pi_0,5 bij echte manipulatietaken van 36,9% naar 63,2%. De code en checkpoints zijn open source.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Xiaomi bracht Xiaomi-Robotics-U0 uit: een multimodal autoregressief model met 38 miljard parameters en een verenigd belichaamd synthese - Aioga AI-nieuws","description":"Xiaomi lanceerde Xiaomi-Robotics-U0, een multimodaal autoregressief model met 38 miljard parameters voor unified embodied synthese. Dit model ziet belichaamde generatie als een uit","url":"https://www.aioga.com/nl/news/cmrkswubg00wabi5qrgj8jc2l/","contentTranslated":true,"sourceHash":"6c5c4baabf9ae925","translatedAt":"2026-07-19T12:15:09.519Z"},"tr":{"title":"Xiaomi, 38 milyar parametreli multimodal otoregresif model, birleşik bedenli sentezi içeren Xiaomi-Robotics-U0'u piyasaya sürdü","summary":"Xiaomi, birleşik bedenli sentez için 38 milyar parametreli çok modlu otoregresif bir model olan Xiaomi-Robotics-U0'u başlattı. Bu model, bedenli üretimi temel görüntü ve video üretiminin bir uzantısı olarak görür; metinden görüntüye düzenleme, görüntü düzenleme, bedenli sahne üretimi, bedenli göç ve bedenli video üretimini birlikte optimize eder. Çeşitli robot formlarında yüksek kaliteli çoklu görünüm sahne üretimini destekleyen ilk modeldir ve yapılandırılmış, kontrol edilebilir beden göçünü tanıtır. Model, tek adımlı ve ardışık üretim görevlerinde SOTA'yı başarıyor, bedenlenmiş sahne üretimi ve transferinin insan değerlendirmesinde GPT-Image-2.0'ı geride bırakıyor, World Arena'da bedenlenmiş video üretiminde birinci sırada yer alıyor ve pi_0.5'in gerçek dünya manipülasyon görevlerinde dağıtım dışı başarı oranını %36,9'dan %63,2'ye yükseltiyor. Kod ve kontrol noktaları açık kaynaklıdır.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Xiaomi, 38 milyar parametreli multimodal otoregresif model, birleşik bedenli sentezi içeren Xiaomi-Robotics-U0'u piyasaya sürdü - Aioga AI Haberleri","description":"Xiaomi, birleşik bedenli sentez için 38 milyar parametreli çok modlu otoregresif bir model olan Xiaomi-Robotics-U0'u başlattı. Bu model, bedenli üretimi temel görüntü ve video üret","url":"https://www.aioga.com/tr/news/cmrkswubg00wabi5qrgj8jc2l/","contentTranslated":true,"sourceHash":"6c5c4baabf9ae925","translatedAt":"2026-07-19T12:15:11.878Z"},"vi":{"title":"Xiaomi đã phát hành Xiaomi-Robotics-U0: một mô hình tự hồi quy đa phương thức 38 tỷ tham số tổng hợp thể hiện thống nhất","summary":"Xiaomi đã ra mắt Xiaomi-Robotics-U0, một mô hình tự hồi quy đa phương thức 38 tỷ tham số để tổng hợp thể hiện thống nhất. Mô hình này xem tạo hiện thân như một phần mở rộng của tạo hình ảnh và video cơ bản, cùng tối ưu hóa văn bản thành hình ảnh, chỉnh sửa hình ảnh, tạo cảnh hiện thân, di chuyển hiện thân và tạo video hiện thân. Đây là mô hình đầu tiên hỗ trợ tạo cảnh đa chế độ xem chất lượng cao trên các dạng rô-bốt khác nhau, giới thiệu di chuyển hiện thân có cấu trúc, có thể điều khiển. Mô hình đạt được SOTA trong các tác vụ tạo một bước và tuần tự, vượt qua GPT-Image-2.0 trong đánh giá của con người về việc tạo và truyền cảnh thể hiện, đứng đầu về tạo video thể hiện trong World Arena và tăng tỷ lệ thành công ngoài phân phối của pi_0.5 trong các tác vụ thao tác trong thế giới thực từ 36,9% lên 63,2%. Mã và các trạm kiểm soát là mã nguồn mở.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Xiaomi đã phát hành Xiaomi-Robotics-U0: một mô hình tự hồi quy đa phương thức 38 tỷ tham số tổng hợp thể hiện thống nhất - Tin tức AI Aioga","description":"Xiaomi đã ra mắt Xiaomi-Robotics-U0, một mô hình tự hồi quy đa phương thức 38 tỷ tham số để tổng hợp thể hiện thống nhất. Mô hình này xem tạo hiện thân như một phần mở rộng của tạo","url":"https://www.aioga.com/vi/news/cmrkswubg00wabi5qrgj8jc2l/","contentTranslated":true,"sourceHash":"6c5c4baabf9ae925","translatedAt":"2026-07-19T12:15:11.438Z"},"id":{"title":"Xiaomi merilis Xiaomi-Robotics-U0: sintesis terwujud terpadu model autoregresif multimodal 38 miliar parameter","summary":"Xiaomi meluncurkan Xiaomi-Robotics-U0, model regresif otomatis multimodal 38 miliar parameter untuk sintesis terwujud terpadu. Model ini memandang generasi yang diwujudkan sebagai perpanjangan dari pembuatan gambar dan video dasar, bersama-sama mengoptimalkan teks-ke-gambar, pengeditan gambar, pembuatan adegan yang diwujudkan, migrasi yang diwujudkan, dan pembuatan video yang diwujudkan. Ini adalah model pertama yang mendukung pembuatan adegan multi-tampilan berkualitas tinggi di berbagai bentuk robot, memperkenalkan migrasi perwujudan yang terstruktur dan dapat dikontrol. Model ini mencapai SOTA dalam tugas pembuatan satu langkah dan berurutan, melampaui GPT-Image-2.0 dalam evaluasi manusia terhadap pembuatan dan transfer adegan yang diwujudkan, menempati peringkat pertama dalam pembuatan video yang diwujudkan di World Arena, dan meningkatkan tingkat keberhasilan di luar distribusi pi_0.5 pada tugas manipulasi dunia nyata dari 36,9% menjadi 63,2%. Kode dan pos pemeriksaan adalah open source.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Xiaomi merilis Xiaomi-Robotics-U0: sintesis terwujud terpadu model autoregresif multimodal 38 miliar parameter - Berita AI Aioga","description":"Xiaomi meluncurkan Xiaomi-Robotics-U0, model regresif otomatis multimodal 38 miliar parameter untuk sintesis terwujud terpadu. Model ini memandang generasi yang diwujudkan sebagai ","url":"https://www.aioga.com/id/news/cmrkswubg00wabi5qrgj8jc2l/","contentTranslated":true,"sourceHash":"6c5c4baabf9ae925","translatedAt":"2026-07-19T12:15:09.284Z"},"th":{"title":"Xiaomi เปิดตัว Xiaomi-Robotics-U0: โมเดลการถดถอยอัตโนมัติแบบมัลติโมดอล 38 พันล้านพารามิเตอร์","summary":"Xiaomi เปิดตัว Xiaomi-Robotics-U0 ซึ่งเป็นโมเดลการถดถอยอัตโนมัติแบบหลายรูปแบบที่มีพารามิเตอร์ 38 พันล้านพารามิเตอร์สําหรับการสังเคราะห์ที่เป็นตัวเป็นตนแบบครบวงจร โมเดลนี้มองว่าการสร้างที่เป็นตัวเป็นตนเป็นส่วนขยายของการสร้างภาพและวิดีโอพื้นฐานร่วมกันเพิ่มประสิทธิภาพการแปลงข้อความเป็นรูปภาพการแก้ไขภาพการสร้างฉากที่เป็นตัวเป็นตนการย้ายข้อมูลที่เป็นตัวเป็นตนและการสร้างวิดีโอที่เป็นตัวเป็นตน เป็นรุ่นแรกที่รองรับการสร้างฉากหลายมุมมองคุณภาพสูงในรูปแบบหุ่นยนต์ต่างๆ โดยแนะนําการโยกย้ายศูนย์รวมที่มีโครงสร้างและควบคุมได้ โมเดลนี้บรรลุ SOTA ในงานสร้างขั้นตอนเดียวและตามลําดับ เหนือกว่า GPT-Image-2.0 ในการประเมินการสร้างและการถ่ายโอนฉากที่เป็นตัวเป็นตนโดยมนุษย์ เป็นอันดับแรกในการสร้างวิดีโอที่เป็นตัวเป็นตนใน World Arena และเพิ่มอัตราความสําเร็จนอกการเผยแพร่ของ pi_0.5 ในงานการจัดการในโลกแห่งความเป็นจริงจาก 36.9% เป็น 63.2% รหัสและจุดตรวจเป็นโอเพ่นซอร์ส","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Xiaomi เปิดตัว Xiaomi-Robotics-U0: โมเดลการถดถอยอัตโนมัติแบบมัลติโมดอล 38 พันล้านพารามิเตอร์ - ข่าว AI Aioga","description":"Xiaomi เปิดตัว Xiaomi-Robotics-U0 ซึ่งเป็นโมเดลการถดถอยอัตโนมัติแบบหลายรูปแบบที่มีพารามิเตอร์ 38 พันล้านพารามิเตอร์สําหรับการสังเคราะห์ที่เป็นตัวเป็นตนแบบครบวงจร โมเดลนี้มองว่าการส","url":"https://www.aioga.com/th/news/cmrkswubg00wabi5qrgj8jc2l/","contentTranslated":true,"sourceHash":"6c5c4baabf9ae925","translatedAt":"2026-07-19T12:15:12.287Z"},"pl":{"title":"Xiaomi wypuściło Xiaomi-Robotics-U0: 38-miliardowy wieloparametrowy model autoregresyjny z uniwersyfikowanym ucieleśnieniem","summary":"Xiaomi uruchomiło Xiaomi-Robotics-U0, 38-miliardowy model multimodalny autoreresyjny do zunifikowanej syntezy ucieleśnianej. Model ten postrzega generowanie ucieleśnione jako rozszerzenie podstawowego generowania obrazu i wideo, wspólnie optymalizując przekształcenie tekstu w obraz, edycję obrazów, generowanie scen ucieleśnionych, migrację ucieleśnioną oraz generowanie wideo ucieleśnionego. Jest to pierwszy model wspierający wysokiej jakości generowanie scen wielowidokowych w różnych formach robotów, wprowadzając ustrukturyzowaną, kontrolowaną migrację ucieleśnienia. Model osiąga SOTA w zadaniach generowania jednokrokowego i sekwencyjnego, przewyższa GPT-Image-2.0 w ocenie generowania i transferu ucieleśnionych scen, zajmuje pierwsze miejsce w generowaniu wideo emkorpedowego na World Arena oraz zwiększa wskaźnik sukcesu pi_0,5 w zadaniach manipulacji rzeczywistymi z 36,9% do 63,2%. Kod i punkty kontrolne są open source.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Xiaomi wypuściło Xiaomi-Robotics-U0: 38-miliardowy wieloparametrowy model autoregresyjny z uniwersyfikowanym ucieleśnieniem - Aioga Wiadomości AI","description":"Xiaomi uruchomiło Xiaomi-Robotics-U0, 38-miliardowy model multimodalny autoreresyjny do zunifikowanej syntezy ucieleśnianej. Model ten postrzega generowanie ucieleśnione jako rozsz","url":"https://www.aioga.com/pl/news/cmrkswubg00wabi5qrgj8jc2l/","contentTranslated":true,"sourceHash":"6c5c4baabf9ae925","translatedAt":"2026-07-19T12:15:11.730Z"}}}}