Xiaomi veröffentlichte Xiaomi-Robotics-U0: ein multimodales autoregressives Modell mit 38 Milliarden Parametern, das einheitliche verkörperte Synthese vereinheitlicht
Xiaomi brachte Xiaomi-Robotics-U0 auf den Markt, ein multimodales autoregressives Modell mit 38 Milliarden Parametern für einheitliche verkörperte Synthese...
论文研究HuggingFace Daily Papers(社区热门论文)
KI-Informationsbrief des Tages
Xiaomi brachte Xiaomi-Robotics-U0 auf den Markt, ein multimodales autoregressives Modell mit 38
Milliarden Parametern für einheitliche verkörperte Synthese. Dieses Modell betrachtet die verkörperte Generierung als eine Erweiterung der grundlegenden Bild- und Videogenerierung und optimiert gemeinsam Text-zu-Bild, Bildbearbeitung, verkörperte Szenengenerierung, verkörperte Migration und verkörperte Videogenerierung. Es ist das erste Modell, das hochwertige Multi-View-Szenengenerierung über verschiedene Roboterformen hinweg unterstützt und eine strukturierte, steuerbare Verkörperungsmigration einführt. Das Modell erreicht SOTA in einstufigen und sequentiellen Generierungsaufgaben, übertrifft GPT-Image-2.0 bei der menschlichen Bewertung von verkörperter Szenengenerierung und -übertragung, belegt den ersten Platz bei der Generierung von verkörperten Videos in World Arena und erhöht die Erfolgsquote von pi_0,5 bei realen Manipulationsaufgaben von 36,9 % auf 63,2 %. Der Code und die Checkpoints sind Open Source.
Originaler Artikelauszug
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
Xiaomi brachte Xiaomi-Robotics-U0 auf den Markt, ein multimodales autoregressives Modell mit 38 Milliarden Parametern für einheitliche verkörperte Synthese...