Xiaomi meluncurkan Xiaomi-Robotics-U0, model regresif otomatis multimodal 38 miliar parameter untuk sintesis terwujud terpadu. Model ini memandang generasi...
论文研究HuggingFace Daily Papers(社区热门论文)
Ringkasan intelijen AI hari ini
Xiaomi meluncurkan Xiaomi-Robotics-U0, model regresif otomatis multimodal 38 miliar parameter untuk
sintesis terwujud terpadu. Model ini memandang generasi yang diwujudkan sebagai perpanjangan dari pembuatan gambar dan video dasar, bersama-sama mengoptimalkan teks-ke-gambar, pengeditan gambar, pembuatan adegan yang diwujudkan, migrasi yang diwujudkan, dan pembuatan video yang diwujudkan. Ini adalah model pertama yang mendukung pembuatan adegan multi-tampilan berkualitas tinggi di berbagai bentuk robot, memperkenalkan migrasi perwujudan yang terstruktur dan dapat dikontrol. Model ini mencapai SOTA dalam tugas pembuatan satu langkah dan berurutan, melampaui GPT-Image-2.0 dalam evaluasi manusia terhadap pembuatan dan transfer adegan yang diwujudkan, menempati peringkat pertama dalam pembuatan video yang diwujudkan di World Arena, dan meningkatkan tingkat keberhasilan di luar distribusi pi_0.5 pada tugas manipulasi dunia nyata dari 36,9% menjadi 63,2%. Kode dan pos pemeriksaan adalah open source.
Kutipan artikel asli
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
Xiaomi meluncurkan Xiaomi-Robotics-U0, model regresif otomatis multimodal 38 miliar parameter untuk sintesis terwujud terpadu. Model ini memandang generasi...