Skip to main content
QUICK REVIEW

[논문 리뷰] Contrastive Variational Model-Based Reinforcement Learning for Complex Observations.

Xiao Ma, Siwei Chen|arXiv (Cornell University)|2020. 08. 06.
Reinforcement Learning in Robotics인용 수 10
한 줄 요약

이 논문은 복잡한 시각적 관찰 환경에서 표본 효율성과 강건성을 향상시키기 위해 대조적 변분 세계 모델을 사용하는 모델 기반 강화학습 프레임워크인 대비적 변분 강화학습(CVRL)을 제안한다. 대조 학습을 통해 잠재 상태와 관찰 간 상호정보량을 최대화함으로써, CVRL은 자연적인 시각적 관찰을 가진 새로운 벤치마크인 Natural Mujoco에서 최신의 생성적 MBRL 방법들을 능가한다.

ABSTRACT

Deep model-based reinforcement learning (MBRL) has achieved great sample-efficiency and generalization in decision making for sophisticated simulated tasks, such as Atari games. However, real-world robot decision making requires reasoning with complex natural visual observations. This paper presents Contrastive Variational Reinforcement Learning (CVRL), an MBRL framework for complex natural observations. In contrast to the commonly used generative world models, CVRL learns a contrastive variational world model by maximizing the mutual information between latent states and observations discriminatively by contrastive learning. Contrastive learning avoids modeling the complex observation space and is significantly more robust than the standard generative world models. For decision making, CVRL discovers long-horizon behavior by online search guided by an actor-critic. CVRL achieves comparable performance with the state-of-the-art (SOTA) generative MBRL approaches on a series of Mujoco tasks, and significantly outperforms SOTAs on Natural Mujoco tasks, a new, more challenging continuous control RL benchmark with complex observations introduced in this paper.

연구 동기 및 목표

  • 복잡한 자연적 시각적 관찰 하에서 표본 효율성과 강건성을 확보하는 데 도전하는 것.
  • 고차원 관찰 공간에서 생성적 세계 모델의 한계를 극복하기 위해, 잠재-관찰 상호정보량 최대화를 위한 대조 학습을 도입하는 것.
  • 온라인 액터-크리틱 지도 탐색을 통해 자연적 시각 입력을 가진 연속 제어 과제에서 효과적인 장기 계획을 수행할 수 있도록 하는 것.
  • 실제 세계의 로봇 학습 과제 도전 과제를 더 잘 반영하기 위해, 복잡한 자연적 관찰을 가진 연속 제어를 위한 새로운 벤치마크인 Natural Mujoco를 제안하고 평가하는 것.
  • 대조 학습 기반 세계 모델이 생성 모델에 비해 성능을 유사하거나 초월하면서도 더 강건한 성능을 보일 수 있음을 입증하는 것.

제안 방법

  • CVRL은 대조 학습을 통해 잠재 상태와 관찰 간 상호정보량을 최대화함으로써 잠재 표현을 학습하는 대조적 변분 세계 모델을 사용한다.
  • 대조 학습 목표는 관찰과 그에 해당하는 잠재 상태의 양성 및 음성 쌍을 사용하여 정의되며, 복잡한 관찰 공간의 밀도 추정을 직접적으로 피함으로써 효과를 발휘한다.
  • 변분 추론 프레임워크를 사용하여 세계 모델을 훈련함으로써, 시각 입력에 대해 종단 간 미분 가능성이 보장되고 확장 가능한 훈련이 가능해진다.
  • 결정은 액터-크리틱 정책에 의해 지도되는 온라인 탐색을 통해 수행되며, 세계 모델을 활용해 장기 계획 행동을 수행한다.
  • 이 프레임워크는 세계 모델과 정책 네트워크를 통합하며, 모방 학습과 강화학습 목표의 조합을 통해 훈련된다.
  • 이 방법은 표준 MuJoCo 환경과 실제 세계의 시각적 관찰을 사용하는 새로 도입된 Natural MuJoCo 벤치마크에서 평가된다.

실험 결과

연구 질문

  • RQ1대조적 변분 세계 모델링이 복잡한 시각적 관찰을 가진 모델 기반 강화학습에서 표본 효율성과 강건성을 향상시킬 수 있는가?
  • RQ2표준 및 자연적 시각 제어 벤치마크에서, CVRL은 최신의 생성적 MBRL 방법들과 비교해 성능과 표본 효율성 측면에서 어떻게 다른가?
  • RQ3생성 모델에 비해 대조 학습은 복잡한 관찰 분포를 직접 모델링할 필요를 얼마나 줄이는가?
  • RQ4자연적 시각 입력 환경에서, CVRL은 온라인 탐색을 통해 장기 행동을 효과적으로 발견할 수 있는가?
  • RQ5제안된 Natural Mujoco 벤치마크는 복잡한 관찰 조건 하에서 실제 세계의 RL 일반화 성능 평가에 의미 있는 도전 과제를 제공하는가?

주요 결과

  • CVRL은 표준 MuJoCo 과제에서 최신의 생성적 MBRL 방법들과 유사한 성능을 달성하며, 경쟁 가능한 표본 효율성과 정책 품질을 보였다.
  • 복잡한 자연적 시각적 관찰을 가진 새로 도입된 Natural MuJooco 벤치마크에서, CVRL은 기존의 SOTA 생성적 MBRL 접근법을 뚜렷이 능가했다.
  • 대조적 변분 세계 모델은 전체 관찰 분포를 모델링하지 않더라도 복잡한 관찰에서 관련 정보를 효과적으로 포착하여 강건성을 향상시켰다.
  • 대조 학습의 사용은 표준 생성 모델에 비해 고차원 시각 공간에서 더 나은 분리 및 표현 학습을 가능하게 했다.
  • 세계 모델 내에서의 온라인 액터-크리틱 지도 탐색은 복잡한 시각 환경에서 효과적인 장기 계획을 수행할 수 있도록 했다.
  • 결과적으로, 대조 학습은 시각적 강화학습에서 세계 모델의 생성 모델링 대안으로 실현 가능하고 더 강건한 대체 방법임을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.