Skip to main content
QUICK REVIEW

[논문 리뷰] MoDem: Accelerating Visual Model-Based Reinforcement Learning with Demonstrations

Nicklas Hansen, Yixin Lin|arXiv (Cornell University)|2022. 12. 12.
Reinforcement Learning in Robotics인용 수 8
한 줄 요약

MoDem는 단지 5개의 전문가 시범을 활용하여 시각적 모델 기반 강화학습을 가속화하는 세 단계 프레임워크를 제안한다. 정책을 시범 데이터로 미사전학습하고, 세계 모델을 전문가 우선 순서의 시뮬레이션으로 초기화하며, 모델 훈련 중에 시범 데이터를 적극적으로 과도 샘플링함으로써 MoDem는 단지 100만 번의 환경 상호작용과 함께 5개의 시범만으로도 이전 방법보다 160%~250% 높은 성공률을 달성한다. 이는 희소 보상 시각 제어 과제에서 성과를 보여준다.

ABSTRACT

Poor sample efficiency continues to be the primary challenge for deployment of deep Reinforcement Learning (RL) algorithms for real-world applications, and in particular for visuo-motor control. Model-based RL has the potential to be highly sample efficient by concurrently learning a world model and using synthetic rollouts for planning and policy improvement. However, in practice, sample-efficient learning with model-based RL is bottlenecked by the exploration challenge. In this work, we find that leveraging just a handful of demonstrations can dramatically improve the sample-efficiency of model-based RL. Simply appending demonstrations to the interaction dataset, however, does not suffice. We identify key ingredients for leveraging demonstrations in model learning -- policy pretraining, targeted exploration, and oversampling of demonstration data -- which forms the three phases of our model-based RL framework. We empirically study three complex visuo-motor control domains and find that our method is 150%-250% more successful in completing sparse reward tasks compared to prior approaches in the low data regime (100K interaction steps, 5 demonstrations). Code and videos are available at: https://nicklashansen.github.io/modemrl

연구 동기 및 목표

  • 실세계 시각 운동 제어 과제에서 시각적 모델 기반 강화학습(MBRL)의 낮은 샘플 효율성 문제를 해결하기 위해.
  • 표준 재생 버퍼 통합이 실패할 때, 소수의 전문가 시범이 MBRL을 어떻게 가속화할 수 있는지 조사하기 위해.
  • 시범 데이터를 효과적으로 활용하여 세계 모델 품질과 정책 학습을 향상시키는 체계적인 세 단계 프레임워크를 개발하기 위해.
  • 시범 데이터를 단순히 재생 버퍼에 추가하는 것보다는, 정책 사전학습과 시범 전이를 통해 강화학습 성능을 크게 향상시키는 것이 효과적인지 입증하기 위해.

제안 방법

  • 단계 1: 소수의 전문가 시범 데이터를 기반으로 행동 클로닝(BC)을 사용하여 시각적 표현과 정책을 사전학습한다.
  • 단계 2: 사전학습된 정책를 사용하여 탐색을 수행하고, 전문가 우선 순서의 고품질 데이터셋을 생성하여 세계 모델과 크리틱을 사전학습한다.
  • 단계 3: 세 단계의 데이터를 모두 활용하고, 시범 전이를 적극적으로 과도 샘플링함으로써, 합성 시뮬레이션과 함께 정책과 세계 모델을 공동으로 미세조정한다.
  • 모델 정규화와 일반화 성능 향상을 위해 단계 간 데이터 증강과 가중치 공유를 적용한다.
  • 정책과 세계 모델 훈련을 분리하기 위해 정지 기울기 연산자를 사용한다.
  • 시범 데이터를 단순히 시뮬레이션으로만 사용하는 것이 아니라, 대상 데이터 샘플링을 통해 세계 모델 감독의 핵심 구성 요소로 통합한다.

실험 결과

연구 질문

  • RQ1소수의 전문가 시범이 시각적 모델 기반 강화학습의 샘플 효율성을 크게 향상시킬 수 있는가?
  • RQ2왜 단순히 시범을 재생 버퍼에 추가하는 것은 MBRL의 가속화에 실패하는가?
  • RQ3MBRL에서 시범을 효과적으로 활용하기 위해 필요한 아키텍처 및 훈련 구성 요소는 무엇인가?
  • RQ4사전학습된 정책를 활용한 정책 사전학습과 대상 데이터 수집이 세계 모델 및 크리틱 학습에 어떻게 기여하는가?
  • RQ5데이터 증강과 시범 데이터 과도 샘플링이 시각적 MBRL 성능 향상에 얼마나 기여하는가?

주요 결과

  • MoDem는 100만 번의 환경 상호작용과 5개의 시범만으로도 21개의 도전적인 시각 운동 제어 과제에서 이전 최고 성능 방법보다 160%~250% 높은 성공률을 달성한다.
  • 단순히 시범을 재생 버퍼에 추가하는 것은, 에이전트가 행동 사전 지식을 효과적으로 활용하지 못함으로써 열악한 성능을 초래한다.
  • 세 단계 프레임워크—정책 사전학습, 전문가 우선 순서의 시뮬레이션으로 초기화, 상호작용 기반 미세조정—은 안정적이고 단조로운 학습을 가능하게 한다.
  • 세계 모델 훈련 중에 시범 데이터를 적극적으로 과도 샘플링하면 모델 정확도와 후속 정책 성공률이 크게 향상된다.
  • 데이터 증강과 사전학습된 시각 표현은 훈련 비용을 줄이고 낮은 데이터 환경에서의 강인성을 향상시킨다.
  • 이 방법은 모델 자유형 기반선보다 훨씬 뛰어난 성능을 보이며, 희소 보상 환경에서 MBRL이 모델 자유형 대안보다 더 샘플 효율적임을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.