أطلقت شاومي نموذج Xiaomi-Robotics-U0، وهو نموذج ذاتي متعدد الوسائط بقيمة 38 مليار معاملة لتركيب موحد متجسد. يرى هذا النموذج التوليد المتجسد كامتداد لتوليد...
论文研究HuggingFace Daily Papers(社区热门论文)
ملخص معلومات AI اليوم
أطلقت شاومي نموذج Xiaomi-Robotics-U0، وهو نموذج ذاتي متعدد الوسائط بقيمة 38 مليار معاملة لتركيب موحد
متجسد. يرى هذا النموذج التوليد المتجسد كامتداد لتوليد الصور والفيديو الأساسي، حيث يحسن معا تحويل النص إلى صورة، وتحرير الصور، وتوليد المشاهد المتجسدة، والهجرة المجسدة، وتوليد الفيديو المجسد. وهو أول نموذج يدعم توليد المشاهد متعددة المشاهدة عالية الجودة عبر أشكال روبوتات مختلفة، مقدما ترحيل تجسيد منظم وقابل للتحكم. يحقق النموذج SOTA في مهام التوليد بخطوة واحدة وتسلسل الإنتاج، ويتجاوز GPT-Image-2.0 في التقييم البشري لتوليد ونقل المشاهد المتجسدة، ويحتل المرتبة الأولى في توليد الفيديو المجسد في World Arena، ويزيد من معدل نجاح pi_0.5 خارج التوزيع في مهام التلاعب الحقيقية من 36.9٪ إلى 63.2٪. الكود ونقاط التفتيش مفتوحة المصدر.
مقتطف من المقال الأصلي
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
أطلقت شاومي نموذج Xiaomi-Robotics-U0، وهو نموذج ذاتي متعدد الوسائط بقيمة 38 مليار معاملة لتركيب موحد متجسد. يرى هذا النموذج التوليد المتجسد كامتداد لتوليد...