فريق لي فيفي بجامعة ستانفورد اقترح Masked Visual Actions، حيث يتم تمثيل أفعال الروبوت كقناع في فضاء البكسل لمسار الكيانات في الفيديو. باستخدام 15 ساعة فقط...
论文研究HuggingFace Daily Papers(社区热门论文)
ملخص معلومات AI اليوم
فريق لي فيفي بجامعة ستانفورد اقترح Masked Visual Actions، حيث يتم تمثيل أفعال الروبوت كقناع في فضاء
البكسل لمسار الكيانات في الفيديو. باستخدام 15 ساعة فقط من البيانات الحقيقية والمحاكاة للتعديل الدقيق، يمكن لنموذج فيديو واحد أن يعمل ك نموذج ديناميكي أمامي ونموذج عكسي في نفس الوقت، ويستخدم لتقييم الاستراتيجيات والتخطيط المبني على النموذج.
مقتطف من المقال الأصلي
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
فريق لي فيفي بجامعة ستانفورد اقترح Masked Visual Actions، حيث يتم تمثيل أفعال الروبوت كقناع في فضاء البكسل لمسار الكيانات في الفيديو. باستخدام 15 ساعة فقط...