Xiaomi uruchomiło Xiaomi-Robotics-U0, 38-miliardowy model multimodalny autoreresyjny do zunifikowanej syntezy ucieleśnianej. Model ten postrzega generowani...
论文研究HuggingFace Daily Papers(社区热门论文)
Dzisiejszy biuletyn AI
Xiaomi uruchomiło Xiaomi-Robotics-U0, 38-miliardowy model multimodalny autoreresyjny do
zunifikowanej syntezy ucieleśnianej. Model ten postrzega generowanie ucieleśnione jako rozszerzenie podstawowego generowania obrazu i wideo, wspólnie optymalizując przekształcenie tekstu w obraz, edycję obrazów, generowanie scen ucieleśnionych, migrację ucieleśnioną oraz generowanie wideo ucieleśnionego. Jest to pierwszy model wspierający wysokiej jakości generowanie scen wielowidokowych w różnych formach robotów, wprowadzając ustrukturyzowaną, kontrolowaną migrację ucieleśnienia. Model osiąga SOTA w zadaniach generowania jednokrokowego i sekwencyjnego, przewyższa GPT-Image-2.0 w ocenie generowania i transferu ucieleśnionych scen, zajmuje pierwsze miejsce w generowaniu wideo emkorpedowego na World Arena oraz zwiększa wskaźnik sukcesu pi_0,5 w zadaniach manipulacji rzeczywistymi z 36,9% do 63,2%. Kod i punkty kontrolne są open source.
Fragment oryginalnego artykułu
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
Xiaomi uruchomiło Xiaomi-Robotics-U0, 38-miliardowy model multimodalny autoreresyjny do zunifikowanej syntezy ucieleśnianej. Model ten postrzega generowani...