Badacze zaproponowali SeededGrasp, modułową ramę efektywną pod względem danych, która wykorzystuje VLM do przewidywania punktów chwytania w trybie zero-sho...
论文研究HuggingFace Daily Papers(社区热门论文)
Dzisiejszy biuletyn AI
Badacze zaproponowali SeededGrasp, modułową ramę efektywną pod względem danych, która wykorzystuje
VLM do przewidywania punktów chwytania w trybie zero-shot, a następnie przekazuje je do lekkiego modelu dopasowania przepływu w celu wygenerowania konkretnych postaw chwytania, rozdzielając wysokopoziomowe wnioskowanie semantyczne od wykonania geometrycznego na niskim poziomie. Metoda ta nie wymaga treningu end-to-end, aby wspierać wiele robotów, była trenowana na syntetycznym zestawie danych obejmującym 610 chaotycznych scen, 334 obiekty i 3 rodzaje chwytaków (łącznie 2,56 miliona prób chwytania), osiągając w symulacji skuteczność 72% oraz 78% w eksperymentach rzeczywistych. Projekt udostępnił już kod i dane.
Fragment oryginalnego artykułu
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
Badacze zaproponowali SeededGrasp, modułową ramę efektywną pod względem danych, która wykorzystuje VLM do przewidywania punktów chwytania w trybie zero-sho...