اقترح الباحثون إطار عمل معياري عالي الكفاءة للبيانات يُسمى SeededGrasp، يستخدم نموذج اللغة البصري (VLM) للتنبؤ بنقاط القبض بدون عينات، ثم يتم تسليمها إلى ن...
论文研究HuggingFace Daily Papers(社区热门论文)
ملخص معلومات AI اليوم
اقترح الباحثون إطار عمل معياري عالي الكفاءة للبيانات يُسمى SeededGrasp، يستخدم نموذج اللغة البصري
(VLM) للتنبؤ بنقاط القبض بدون عينات، ثم يتم تسليمها إلى نموذج مطابقة التدفق خفيف الوزن لتوليد الوضعيات الدقيقة للقبض، ما يفصل بين الاستنتاج الدلالي العالي المستوى والتنفيذ الهندسي الأساسي. هذه الطريقة لا تتطلب تدريب شامل من البداية للنهاية ويمكن أن تدعم العديد من الأذرع الآلية. تم التدريب على مجموعة بيانات تركيبية تضم 610 مشاهد فوضوية، 334 جسمًا، و3 أنواع من المخالب (بما في ذلك 2.56 مليون عملية قبض)، وبلغ معدل النجاح في المحاكاة 72٪، بينما وصل معدل النجاح في التجارب الواقعية إلى 78٪. تم نشر الشفرة والبيانات كمشروع مفتوح المصدر.
مقتطف من المقال الأصلي
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
اقترح الباحثون إطار عمل معياري عالي الكفاءة للبيانات يُسمى SeededGrasp، يستخدم نموذج اللغة البصري (VLM) للتنبؤ بنقاط القبض بدون عينات، ثم يتم تسليمها إلى ن...