Xiaomi a lancé Xiaomi-Robotics-U0, un modèle autorégressif multimodal de 38 milliards de paramètres pour la synthèse unifiée de l’incarnation. Ce modèle co...
论文研究HuggingFace Daily Papers(社区热门论文)
Brief IA du jour
Xiaomi a lancé Xiaomi-Robotics-U0, un modèle autorégressif multimodal de 38 milliards de paramètres
pour la synthèse unifiée de l’incarnation. Ce modèle considère la génération incarnée comme une extension de la génération d’images et de vidéos de base, optimisant conjointement le texte à image, le montage d’images, la génération de scènes incarnées, la migration incarnée et la génération vidéo incarnée. C’est le premier modèle à supporter la génération de scènes multi-vues de haute qualité sur différentes formes de robots, introduisant une migration structurée et contrôlable des incarnations. Le modèle atteint la SOTA dans les tâches de génération en une étape et séquentielle, dépasse GPT-Image-2.0 dans l’évaluation humaine de la génération et du transfert de scènes incarnées, se classe premier en génération vidéo incarnée dans World Arena, et augmente le taux de réussite hors distribution de pi_0.5 sur les tâches de manipulation réelles de 36,9 % à 63,2 %. Le code et les points de contrôle sont open source.
Article et notes de source
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
Xiaomi a lancé Xiaomi-Robotics-U0, un modèle autorégressif multimodal de 38 milliards de paramètres pour la synthèse unifiée de l’incarnation. Ce modèle co...