샤오미는 통합된 구현 합성을 위한 380억 파라미터 다중 모달 자기회귀 모델인 샤오미-로보틱스-U0를 출시했습니다. 이 모델은 내재 생성을 기본 이미지 및 비디오 생성의 확장으로 보고, 텍스트-이미지, 이미지 편집, 내체된 장면 생성, 내체된 이동, 내체된 비디오 생성을 공동으...
论文研究HuggingFace Daily Papers(社区热门论文)
오늘의 AI 정보 요약
샤오미는 통합된 구현 합성을 위한 380억 파라미터 다중 모달 자기회귀 모델인 샤오미-로보틱스-U0를 출시했습니다. 이 모델은 내재 생성을 기본 이미지 및 비디오 생성의 확장으로
보고, 텍스트-이미지, 이미지 편집, 내체된 장면 생성, 내체된 이동, 내체된 비디오 생성을 공동으로 최적화합니다. 이 모델은 다양한 로봇 형태에서 고품질 다중 뷰 장면 생성을 지원하는 최초의 모델로, 구조적이고 제어 가능한 구현 이동을 도입했습니다. 이 모델은 단일 단계 및 순차 생성 작업에서 SOTA를 달성했으며, 구현된 장면 생성 및 전송에 대한 인간 평가에서 GPT-Image-2.0을 능가하고, World Arena에서 구현된 비디오 생성 부문에서 1위를 차지하며, 실제 조작 작업에서 pi_0.5의 배포 외 성공률을 36.9%에서 63.2%로 높였습니다. 코드와 체크포인트는 오픈 소스입니다.
본문 및 출처 설명
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
샤오미는 통합된 구현 합성을 위한 380억 파라미터 다중 모달 자기회귀 모델인 샤오미-로보틱스-U0를 출시했습니다. 이 모델은 내재 생성을 기본 이미지 및 비디오 생성의 확장으로 보고, 텍스트-이미지, 이미지 편집, 내체된 장면 생성, 내체된 이동, 내체된 비디오 생성을 공동으...