Xiaomi ha lanciato Xiaomi-Robotics-U0, un modello autoregressivo multimodale da 38 miliardi di parametri per la sintesi incarnata unificata. Questo modello...
论文研究HuggingFace Daily Papers(社区热门论文)
Brief quotidiano sull’IA
Xiaomi ha lanciato Xiaomi-Robotics-U0, un modello autoregressivo multimodale da 38 miliardi di
parametri per la sintesi incarnata unificata. Questo modello considera la generazione incarnata come un'estensione della generazione di base di immagini e video, ottimizzando congiuntamente il testo-immagine, il montaggio delle immagini, la generazione di scene incarnate, la migrazione incorporata e la generazione di video incarnato. È il primo modello a supportare la generazione di scene multi-view di alta qualità tra varie forme robotiche, introducendo una migrazione strutturata e controllabile dell'incarnazione. Il modello raggiunge SOTA nei compiti di generazione a singolo passaggio e sequenziali, supera GPT-Image-2.0 nella valutazione umana della generazione e trasferimento di scene incarnate, si classifica primo nella generazione di video incarnati nel World Arena e aumenta il tasso di successo fuori distribuzione di pi_0.5 nei compiti di manipolazione reali dal 36,9% al 63,2%. Il codice e i checkpoint sono open source.
Estratto dell’articolo originale
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
Xiaomi ha lanciato Xiaomi-Robotics-U0, un modello autoregressivo multimodale da 38 miliardi di parametri per la sintesi incarnata unificata. Questo modello...