Skip to main content
QUICK REVIEW

[논문 리뷰] RoboDreamer: Learning Compositional World Models for Robot Imagination

Siyuan Zhou, Yilun Du|arXiv (Cornell University)|2024. 04. 18.
Reinforcement Learning in Robotics인용 수 4
한 줄 요약

RoboDreamer는 자연어 구문 분석을 통해 영상 생성을 인과적으로 분해함으로써 로봇 계획에서 알려지지 않은 물체와 동작의 조합에 대해 제로샷 일반화를 가능하게 하는 구성적 월드 모델을 소개한다. 별도의 디퓨전 모델을 구문 분석된 언어 기반 원소와 다중모달 목표(예: 이미지, 스케치)에 조건화하여, 복잡한 지시어에 대한 우수한 일치도를 달성하고 시뮬레이션 기반 로봇 실행에서 단일 모델 기반 영상 생성 베이스라인을 능가한다.

ABSTRACT

Text-to-video models have demonstrated substantial potential in robotic decision-making, enabling the imagination of realistic plans of future actions as well as accurate environment simulation. However, one major issue in such models is generalization -- models are limited to synthesizing videos subject to language instructions similar to those seen at training time. This is heavily limiting in decision-making, where we seek a powerful world model to synthesize plans of unseen combinations of objects and actions in order to solve previously unseen tasks in new environments. To resolve this issue, we introduce RoboDreamer, an innovative approach for learning a compositional world model by factorizing the video generation. We leverage the natural compositionality of language to parse instructions into a set of lower-level primitives, which we condition a set of models on to generate videos. We illustrate how this factorization naturally enables compositional generalization, by allowing us to formulate a new natural language instruction as a combination of previously seen components. We further show how such a factorization enables us to add additional multimodal goals, allowing us to specify a video we wish to generate given both natural language instructions and a goal image. Our approach can successfully synthesize video plans on unseen goals in the RT-X, enables successful robot execution in simulation, and substantially outperforms monolithic baseline approaches to video generation.

연구 동기 및 목표

  • 기존의 텍스트-영상 모델이 로봇 분야에서 새로운 물체와 동작의 조합에 대해 제대로 일반화되지 못하는 문제를 해결하기 위해.
  • 자연어 지시어를 공간적 원소와 동작 원소로 분해하여 영상 생성에서 구성적 추론을 가능하게 하기 위해.
  • 목표 이미지나 스케치와 같은 다중모달 조건화를 포함하여 더 rich한 작업 명세를 위해 영상 생성을 확장하기 위해.
  • 시뮬레이션에서 정확하고 작업에 맞는 영상 트레이젝터리를 생성함으로써 로봇 계획 및 실행을 향상시키기 위해.
  • 기존에 볼 수 있었던 조합 외에는 일반화할 수 없는 단일 모델 기반 영상 디퓨전 모델의 한계를 극복하기 위해.

제안 방법

  • 텍스트 파서를 사용하여 자연어 지시어를 행동과 공간 관계의 이산적 구성요소로 분해함으로써 구성적 제어를 가능하게 한다.
  • 이러한 분해된 구성요소에 기반해 디퓨전 모델 세트를 조건화함으로써 각 모델이 영상의 특정 측면(예: 물체의 운동, 공간적 배치)을 전문화하여 생성할 수 있도록 한다.
  • 목표 이미지나 스케치와 같은 다중모달 목표를 인코딩하고 언어 구성요소와 함께 공동 조건화하여 영상 생성을 유도한다.
  • 추론 도중 언어와 다중모달 입력의 이전에 본 적 없는 조합을 제로샷으로 조합할 수 있도록 한다.
  • 사전 훈련된 텍스트-영상 모델을 활용하고, 구성 요소를 분리하여 해체 가능한 모듈식 아키텍처를 통해 생성 과정을 해석 가능한 구성요소로 분리하여 미세조정한다.
  • 로봇 조작 데이터를 기반으로 엔드 투 엔드로 훈련되며, 추론 시에 다양한 다중모달 조건화 기반의 영상 합성을 유연하게 가능하게 한다.

실험 결과

연구 질문

  • RQ1구성적 영상 생성 프레임워크는 훈련 중에 볼 수 없었던 물체와 동작의 조합에 대해 일반화할 수 있는가?
  • RQ2지시어를 원소로 분해함으로써 로봇 영상 생성에서 제로샷 일반화가 어떻게 향상되는가?
  • RQ3목표 이미지나 스케치와 같은 다중모달 입력이 구성적 영상 생성 파이프라인에 효과적으로 통합될 수 있는가?
  • RQ4Sim-to-Real 로봇 계획에서 RoboDreamer의 성능은 단일 모델 기반 텍스트-영상 모델과 비교해 어떻게 되는가?
  • RQ5언어와 시각적 목표 사양을 동시에 조건으로 삼을 때 모델이 얼마나 정확하고 작업에 맞는 영상 계획을 생성할 수 있는가?

주요 결과

  • RoboDreamer는 복잡한 다중모달 지시어와 높은 일치도를 달성하여, UniPi나 AVDC와 같은 단일 모델 기반 베이스라인보다 작업 관련 영상 계획 생성에서 뚜렷한 승리를 거두었다.
  • 모델은 언어 구성요소의 새로운 조합에 대해 효과적으로 일반화하여, 새로운 물체-행동 조합에 대해 제로샷 능력을 입증했다.
  • 시뮬레이션 환경에서 RoboDreamer는 새로운 작업에 대해 성공적인 로봇 실행을 가능하게 하여, 계획 수립 및 정책 학습에 있어 실용성을 입증했다.
  • 목표 이미지와 스케치의 통합은 생성된 영상의 정밀도를 높여 공간 관계의 모호성을 줄였다.
  • RoboDreamer는 언어적 의도와 시각적 목표 구성 모두에 부합하는 영상을 생성하는 데서 베이스라인 모델을 능가했다.
  • 모델은 훈련 중에 볼 수 없었던 언어와 이미지의 조합 조합조차도 새로운 다중모달 입력에 대해 뛰어난 내재성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.