このモデルは、具身生成を基本的な画像および映像生成の延長として捉え、テキストから画像への変換、画像編集、具身シーン生成、身体化移動、具身化ビデオ生成を共同で最適化します。 これは、さまざまなロボット形態で高品質なマルチビューシーン生成をサポートする初のモデルであり、構造化され制御可能な身体移行を導入しました。 このモデルは単一段階および逐次生成タスクでSOTAを達成し、具現化シーン生成と転送の人間評価ではGPT-Image-2.0を上回り、World Arenaの具現化映像生成で1位にランクされ、pi_0.5の実世界の操作タスクにおける流通外成功率を36.9%から63.2%に引き上げました。 コードとチェックポイントはオープンソースです。
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.

