นักวิจัยได้เสนอ SeededGrasp ซึ่งเป็นกรอบงานแบบโมดูลาร์ที่ใช้ข้อมูลอย่างมีประสิทธิภาพ ใช้ VLM
ในการทำนายจุดเมล็ดการจับแบบศูนย์ตัวอย่าง จากนั้นส่งต่อไปยังโมเดลจับคู่แบบไหลที่มีน้ำหนักเบาเพื่อสร้างท่าทางการจับที่ชัดเจน ทำให้การใช้เหตุผลเชิงความหมายระดับสูงและการดำเนินการทางเรขาคณิตระดับต่ำถูกแยกออกจากกัน วิธีการนี้ไม่ต้องการการฝึกแบบ end-to-end ก็สามารถรองรับแขนกลหลายตัวได้ โดยฝึกบนชุดข้อมูลสังเคราะห์ที่มี 610 ฉากสับสนวุ่นวาย, 334 วัตถุ, และ 3 ประเภทกรงเล็บ (รวมการจับ 2.56 ล้านครั้ง) อัตราความสำเร็จในการจำลองอยู่ที่ 72% และอัตราความสำเร็จในการทดลองจริงอยู่ที่ 78% โครงการได้เปิดเผยรหัสและข้อมูลแล้ว
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.

