Skip to main content
QUICK REVIEW

[논문 리뷰] Recurrent Off-policy Baselines for Memory-based Continuous Control

Zhihan Yang, Van‐Dinh Nguyen|arXiv (Cornell University)|2021. 10. 25.
Reinforcement Learning in Robotics참고 문헌 31인용 수 13
한 줄 요약

이 논문은 부분 관찰 가능한 연속 제어 작업을 처리하기 위해 순환 신경망(RNN)을 사용한 기억 기반 시간 표현을 가능하게 하는 DDPG, TD3, SAC의 확장으로, RDPG, RTD3, RSAC라는 순환 오프-폴리시 딥 강화학습 알고리즘을 제안한다. RSAC는 다양한 작업에서 거의 최적의 성능을 달성하며 가장 신뢰할 수 있는 베이스라인으로 부상하지만, 체계적인 탐색은 여전히 도전 과제이다.

ABSTRACT

When the environment is partially observable (PO), a deep reinforcement learning (RL) agent must learn a suitable temporal representation of the entire history in addition to a strategy to control. This problem is not novel, and there have been model-free and model-based algorithms proposed for this problem. However, inspired by recent success in model-free image-based RL, we noticed the absence of a model-free baseline for history-based RL that (1) uses full history and (2) incorporates recent advances in off-policy continuous control. Therefore, we implement recurrent versions of DDPG, TD3, and SAC (RDPG, RTD3, and RSAC) in this work, evaluate them on short-term and long-term PO domains, and investigate key design choices. Our experiments show that RDPG and RTD3 can surprisingly fail on some domains and that RSAC is the most reliable, reaching near-optimal performance on nearly all domains. However, one task that requires systematic exploration still proved to be difficult, even for RSAC. These results show that model-free RL can learn good temporal representation using only reward signals; the primary difficulty seems to be computational cost and exploration. To facilitate future research, we have made our PyTorch implementation publicly available at https://github.com/zhihanyang2022/off-policy-continuous-control.

연구 동기 및 목표

  • 부분 관찰 환경에서 기억 기반 연속 제어를 위한 모델-프리(off-policy) 기반 베이스라인 간 격차를 해소하기 위해.
  • 전체 관찰-행동 역사 $ h_t = \{o_{1:t}, a_{1:t-1}\} $ 를 활용하는 DDPG, TD3, SAC의 순환 버전(RDPG, RTD3, RSAC)을 구현하고 평가하기 위해.
  • 공유된 순환 표현 및 순환 신경망 아키텍처(LSTM, GRU, VRNN)와 같은 핵심 설계 선택 사항이 오프-폴리시 강화학습에 미치는 영향을 조사하기 위해.
  • 미래의 역사 기반 딥 강화학습 연구를 위해 신뢰할 수 있고 공개 가능한 구현을 확립하기 위해.
  • 밀도 높은 보상 도메인에서 강력한 성능를 보이지만, 희박한 보상과 체계적인 탐색이 필요한 과제에서는 여전히 모델-프리 강화학습의 한계를 평가하기 위해.

제안 방법

  • RNN을 사용해 전체 역사 $ h_t = \{o_{1:t}, a_{1:t-1}\} $ 를 처리하도록 DDPG, TD3, SAC를 확장하여 RDPG, RTD3, RSAC를 생성한다.
  • 순환 에이전트를 위한 표준 경험 리플레이를 조정하여 전체 역사와 RNN 은닉 상태를 저장함으로써 시간적 맥락을 유지한다.
  • 비평가 손실만으로 최적화되는 공유된 순환 인코더를 사용하는 RSAC-Share를 제안함으로써 효율성과 표현 품질을 향상시킨다.
  • RNN, 액터, 비평가의 엔드 투 엔드 훈련을 위해 시간을 거슬러 내려가는 기울기 백프로파게이션(BPTT)을 사용한다.
  • 성능와 훈련 안정성 측면에서 LSTM, GRU, VRNN 등의 다양한 RNN 유형을 기억 기반 제어 과제에서 비교한다.
  • DrQ [21]의 통찰을 응용하여 이미지 기반 강화학습에서 단일 CNN을 공유하는 방식을 RNN에 적용함으로써 파라미터 효율성과 표현 학습을 향상시킨다.

실험 결과

연구 질문

  • RQ1RNN을 갖춘 오프-폴리시 딥 강화학습 알고리즘이 부분 관찰 환경에서 희박한 보상 신호만으로 효과적인 시간 표현을 학습할 수 있는가?
  • RQ2공유된 순환 표현 및 RNN 아키텍처(LSTM 대비 GRU 대비 VRNN)와 같은 설계 선택 사항이 학습 안정성과 성능에 어떤 영향을 미치는가?
  • RQ3액터와 비평가 간에 순환 인코더를 공유하면 샘플 효율성과 성능가 향상이 이루어지며, 훈련 동역학에 어떤 상충 관계가 존재하는가?
  • RQ4단기 및 장기 부분 관찰 제어 과제에서 RDPG, RTD3, RSAC는 신뢰성과 점차적 성능 측면에서 어떻게 비교되는가?
  • RQ5희박한 보상과 체계적인 탐색이 필요한 과제에서, 특히 POMDP에 대한 모델-프리 강화학습의 지속적인 과제는 무엇인가?

주요 결과

  • RSAC는 거의 모든 테스트된 부분 관찰 가능한 연속 제어 도메인에서 거의 최적의 성능를 달성하며, RDPG와 RTD3를 압도적으로 뛰어넘는다.
  • RDPG와 RTD3는 특정 과제에서 예상치 못하게 실패하며, 오프-폴리시 알고리즘을 사용하더라도 가치 과대평가와 정책 붕괴 문제가 여전히 문제로 남아 있음을 시사한다.
  • RSAC-Share는 비평가 손실만으로 최적화되는 공유된 순환 인코더를 사용하며, RNN 계산량을 절반으로 줄여 훈련 시간을 크게 단축시키면서도 RSAC 성능를 그대로 유지한다.
  • RSAC-Share는 공유된 표현 덕분에 두 비평가의 Q-값 간 상관관계가 더 높아지며, 이는 클리핑된 더블 Q-러닝의 효과를 감소시킬 수 있음을 시사한다.
  • RSAC-LSTM과 RSAC-GRU는 유사한 점차적 성능를 보이며, RSAC-VRNN은 심지어 유의미하게 열 劣하므로 장기간 시퀀스에서 기울기 소실/폭발 문제의 영향을 받는 것으로 보인다.
  • 밀도 높은 보상 과제에서는 강력한 성능를 보였지만, 체계적인 탐색이 필요한 유일한 과제에서는 모든 모델이 어려움을 겪으며, POMDP에 대한 모델-프리 강화학습의 지속적인 과제를 드러낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.