Skip to main content
QUICK REVIEW

[논문 리뷰] Contrastive Variational Reinforcement Learning for Complex Observations

Xiao Ma, Siwei Chen|arXiv (Cornell University)|2020. 08. 06.
Reinforcement Learning in Robotics참고 문헌 41인용 수 6
한 줄 요약

이 논문은 복잡한 시각적 관측에서 픽셀 수준의 재구성 없이 강력한 잠재 세계 모델을 학습하기 위해 대비 학습을 사용하는 모델 기반 강화학습 프레임워크인 대비 변분 강화학습(CVRL)을 제안한다. 대비 목표를 통해 상태와 관측 간 상호정보를 최대화함으로써, CVRL은 동적인 그림자와 혼잡한 배경을 가진 작업에서 우수한 성능을 달성하며, 자연스러운 Mujoco 및 상자 밀기 작업에서 최신 기술을 능가하면서도 뛰어난 샘플 효율성을 유지한다.

ABSTRACT

Deep reinforcement learning (DRL) has achieved significant success in various robot tasks: manipulation, navigation, etc. However, complex visual observations in natural environments remains a major challenge. This paper presents Contrastive Variational Reinforcement Learning (CVRL), a model-based method that tackles complex visual observations in DRL. CVRL learns a contrastive variational model by maximizing the mutual information between latent states and observations discriminatively, through contrastive learning. It avoids modeling the complex observation space unnecessarily, as the commonly used generative observation model often does, and is significantly more robust. CVRL achieves comparable performance with state-of-the-art model-based DRL methods on standard Mujoco tasks. It significantly outperforms them on Natural Mujoco tasks and a robot box-pushing task with complex observations, e.g., dynamic shadows. The CVRL code is available publicly at https://github.com/Yusufma03/CVRL.

연구 동기 및 목표

  • 고차원적이고 복잡한 불필요한 시각적 간섭 요소(예: 동적인 그림자, 움직이는 배경 등)를 포함하는 관측에서 효과적인 세계 모델을 학습하는 데 도전하는 것.
  • 생성적 관측 모델링 대신 분류적 대비 표현 학습을 도입하여 모델 기반 강화학습의 강건성과 샘플 효율성을 향상시키는 것.
  • 하이브리드 액터-크리틱 및 잠재 변수 유도 모델 예측 제어(MPC) 프레임워크를 통해 복잡한 환경에서 장기 예측 계획과 의사결정을 가능하게 하는 것.
  • 대비 학습을 통한 상호정보 최대화가 전통적인 변분 오토인코더 기반 생성 모델링보다 더 안정적이고 정확한 세계 모델을 이끌어내는가를 입증하는 것.

제안 방법

  • CVRL은 실제 상태-관측 쌍과 가짜 쌍을 대비함으로써 잠재 상태와 관측 간 상호정보를 최대화하는 새로운 목표인 대비 증거 하한(lower bound, CELBO)를 도입한다.
  • 이 방법은 실제 쌍(s_t, o_t)을 부정적 쌍(s_t, o'_t)과 비교하여 복잡한 관측을 직접 재구성하지 않고 표현을 학습하는 대비 변분 세계 모델을 활용한다.
  • SAC(Soft Actor-Critic)를 사용하여 하이브리드 액터-크리틱 정책을 훈련시켜 고차원적 복잡한 관측 공간에서 강력하고 효율적인 정책 갱신을 달성한다.
  • 장기 예측 계획을 위해 잠재 변수 유도 모델 예측 제어(MPC)를 사용하며, 학습된 세계 모델을 활용해 행동 시퀀스를 생성한다.
  • CELBO를 통해 훈련된 세계 모델과 온라인 학습을 통합함으로써 자연스러운 환경에서 샘플 효율적이고 강건한 의사결정을 가능하게 한다.
  • 부정적 샘플은 무작위 증강 또는 다른 트레이젝터리에서 샘플링하여 생성되며, 대비 손실은 모델이 관련 있는 관측과 관련이 없는 관측을 구분하도록 유도한다.

실험 결과

연구 질문

  • RQ1대비 표현 학습은 복잡한 시각적 관측 하에서 모델 기반 강화학습의 세계 모델 강건성 향상에 기여하는가?
  • RQ2생성적 관측 모델링을 분류적 대비 학습으로 대체할 경우, 동적인 복잡한 배경을 가진 작업에서 성능 향상이 이루어지는가?
  • RQ3대비 학습, 잠재 변수 유도 MPC, SAC의 조합이 연속 제어 작업에서 장기 예측 의사결정을 어떻게 향상시키는가?
  • RQ4각 구성 요소(대비 학습, MPC, SAC)가 전체 성능에 기여하는 정도는 어떻게 되며, 특히 도전적인 환경에서 어떤 영향을 미치는가?
  • RQ5CVRL은 Dreamer와 같은 최신 기술 모델 기반 강화학습 방법과 비교해 샘플 효율성과 강건성 측면에서 어떤가?

주요 결과

  • CVRL은 동적인 그림자와 변동 배경을 포함하는 자연스러운 Mujoco 벤치마크에서 최신 기술 모델 기반 강화학습 방법을 크게 능가했다.
  • 복잡한 시각적 간섭 요소가 있는 로봇 상자 밀기 작업에서, CVRL은 가장 높은 누적 보상과 가장 짧은 실행 시간을 기록했으며, Dreamer와 SAC 모두를 능가했다.
  • 단절 실험 결과에 따르면 대비 학습 구성 요소가 필수적이었으며, CVRL-보상 전용 및 CVRL-생성 모델 버전은 유의미하게 열악한 성능을 보여, 대비 학습이 강건성을 이끄는 핵심 요소임을 확인했다.
  • 잠재 변수 유도 MPC 제거(CVRL-no-MPC) 시 10개 작업 중 8개에서 성능 저하가 발생했으며, 특히 카트폴 스윙업 및 퀼라드루프 워크와 같은 장기 예측 작업에서 뚜렷하게 나타났다.
  • 하이브리드 액터-크리틱(CVRL-no-SAC)은 상태-관측 간 결합도가 높은 작업에서 성능 저하를 보였으며, 이는 세계 모델 오차가 클 경우 SAC가 중요한 훈련 신호를 제공한다는 것을 시사한다.
  • 관측이 단순한 표준 Mujoco 작업에서는 CVRL이 Dreamer와 유사한 성능를 보였지만, 워커런과 체타혼 런에서는 약간 열등한 성능를 보였으며, 이는 관측 복잡도가 낮을 경우 대비 학습이 덜 효과적임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.