A Xiaomi lançou o Xiaomi-Robotics-U0, um modelo autoregressivo multimodal multimodal com 38 bilhões de parâmetros para síntese incorporada unificada. Este...
论文研究HuggingFace Daily Papers(社区热门论文)
Resumo diário de inteligência em IA
A Xiaomi lançou o Xiaomi-Robotics-U0, um modelo autoregressivo multimodal multimodal com 38 bilhões
de parâmetros para síntese incorporada unificada. Este modelo vê a geração incorporada como uma extensão da geração básica de imagens e vídeos, otimizando conjuntamente texto para imagem, edição de imagens, geração de cena incorporada, migração incorporada e geração de vídeo incorporado. É o primeiro modelo a suportar geração de cenas multi-vista de alta qualidade em várias formas robóticas, introduzindo migração estruturada e controlável de corpos. O modelo alcança SOTA em tarefas de geração em etapas únicas e sequenciais, supera o GPT-Image-2.0 na avaliação humana da geração e transferência de cenas incorporadas, ocupa o primeiro lugar em geração de vídeo incorporado na World Arena e aumenta a taxa de sucesso fora de distribuição do pi_0.5 em tarefas de manipulação do mundo real de 36,9% para 63,2%. O código e os checkpoints são open source.
Trecho do artigo original
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
A Xiaomi lançou o Xiaomi-Robotics-U0, um modelo autoregressivo multimodal multimodal com 38 bilhões de parâmetros para síntese incorporada unificada. Este...