これはデータ効率の高いモジュラー型フレームワークで、VLM によるゼロショットでの把持シード点予測を利用し、その後軽量なフローマッチングモデルにより具体的な把持姿勢を生成し、高次の意味推論と低次の幾何学的実行を切り離します。 この方法はエンドツーエンドの訓練を必要とせず、複数のロボットアームに対応可能です。 610 の乱雑なシーン、334 の物体、3 種類のグリッパーを含む合成データセット(256 万回の把持を含む)で訓練したところ、シミュレーションの成功率は 72%、実験環境での成功率は 78% でした。 プロジェクトはコードとデータをオープンソース化しています。
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.

