Skip to main content
QUICK REVIEW

[논문 리뷰] MEPG: A Minimalist Ensemble Policy Gradient Framework for Deep Reinforcement Learning

Qiang He, Su, Huangyuan|arXiv (Cornell University)|2021. 09. 22.
Gaussian Processes and Bayesian Inference참고 문헌 37인용 수 6
한 줄 요약

MEPG는 단일 모델 내 다수의 서브넷 간 일관된 벨먼 업데이트를 유지하기 위해 수정된 드롭아웃 연산자를 사용하는 최소한의 앙상블 딥 강화학습 프레임워크이다. 계산 비용이나 파라미터 수를 늘리지 않으면서도 최신의 앙상블 및 모델 프리 메서드와 동등하거나 그 이상의 성능을 달성한다.

ABSTRACT

During the training of a reinforcement learning (RL) agent, the distribution of training data is non-stationary as the agent's behavior changes over time. Therefore, there is a risk that the agent is overspecialized to a particular distribution and its performance suffers in the larger picture. Ensemble RL can mitigate this issue by learning a robust policy. However, it suffers from heavy computational resource consumption due to the newly introduced value and policy functions. In this paper, to avoid the notorious resources consumption issue, we design a novel and simple ensemble deep RL framework that integrates multiple models into a single model. Specifically, we propose the \underline{M}inimalist \underline{E}nsemble \underline{P}olicy \underline{G}radient framework (MEPG), which introduces minimalist ensemble consistent Bellman update by utilizing a modified dropout operator. MEPG holds ensemble property by keeping the dropout consistency of both sides of the Bellman equation. Additionally, the dropout operator also increases MEPG's generalization capability. Moreover, we theoretically show that the policy evaluation phase in the MEPG maintains two synchronized deep Gaussian Processes. To verify the MEPG framework's ability to generalize, we perform experiments on the gym simulator, which presents that the MEPG framework outperforms or achieves a similar level of performance as the current state-of-the-art ensemble methods and model-free methods without increasing additional computational resource costs.

연구 동기 및 목표

  • 기존의 앙상블 딥 강화학습(DRL) 방법에서 발생하는 높은 계산 비용과 하이퍼파라미터 부담을 해결한다.
  • 자원 오버헤드를 피하기 위해 단일 신경망을 사용하면서도 앙상블 학습의 일반화 이점을 유지한다.
  • 보조 손실 함수나 추가 네트워크 없이도 일관된 드롭아웃 적용을 통해 모델 다양성을 통합하는 방법을 개발한다.
  • 학습 중에 양변에 동일한 드롭아웃 마스크를 적용하여 벨먼 업데이트의 안정성과 일관성을 확보한다.
  • 자율 주행과 같은 실세계의 계산 자원이 제한된 응용 분야에서 앙상블 유사 DRL의 실용적 구현을 가능하게 한다.

제안 방법

  • 벨먼 방정식의 좌변과 우변에 동일한 드롭아웃 마스크를 적용하는 최소한의 앙상블 일관된 벨먼 업데이트를 도입한다.
  • 수정된 드롭아웃 연산자를 사용해 학습 중에 다수의 서브넷을 생성하며, 각각은 별개의 앙상블 멤버를 나타낸다.
  • 정책 평가 단계에서 두 개의 동기화된 딥 가우시안 프로세스를 유지하여 가치 함수 근사에서의 안정성과 일관성을 확보한다.
  • 값 업데이트 및 정책 업데이트 절차를 수정하여 DDPG 및 SAC 알고리즘에 일관된 드롭아웃 메커니즘을 통합한다.
  • 기본 DRL 알고리즘의 원래 아키텍처와 하이퍼파라미터를 유지하며, 오직 하나의 새로운 하이퍼파라미터인 드롭아웃 확률 $p$만 추가한다.
  • 모든 서브넷의 예측을 집계하기 위해 전체 네트워크(드롭아웃 없음)를 사용해 추론을 수행함으로써, 추가 계산 없이 앙상블 추론을 효과적으로 수행한다.

실험 결과

연구 질문

  • RQ1계산 비용이나 모델 복잡도를 증가시키지 않으면서도 DRL에서 앙상블 일반화의 이점을 달성할 수 있는가?
  • RQ2벨먼 방정식의 양변에 동일한 드롭아웃 마스크를 적용하는 것이 표준 드롭아웃이나 무작위 마스크보다 안정성과 성능 향상에 기여하는가?
  • RQ3제안된 프레임워크는 드롭아웃 확률 $p$의 선택에 얼마나 민감한가?
  • RQ4일관된 드롭아웃을 적용한 단일 모델 프레임워크가 REDQ 및 SUNRISE와 같은 다중 네트워크 앙상블 방법과 동등하거나 그 이상의 성능을 달성할 수 있는가?
  • RQ5정책 평가 단계에서 딥 가우시안 프로세스의 이론적 동기화가 학습 안정성과 성능 향상에 기여하는가?

주요 결과

  • MEPG는 Ant, Hopper, Walker, HCheetah를 포함한 PyBullet 제어 슈트의 다양한 환경에서 최신의 앙상블 및 모델 프리 DRL 메서드(SAC, DDPG, REDQ, SUNRISE)와 동등하거나 그 이상의 성능을 달성한다.
  • 프레임워크는 훨씬 줄어든 학습 시간으로도 뛰어난 성능을 기록한다: ME-SAC은 Ant에서 약 1시간 14분 내에 학습을 완료했고, REDQ(M)는 3시간 43분, SUNRISE는 7시간 24분이 소요되었다.
  • MEPG는 매우 낮은 파라미터 수를 유지한다: Ant에서 ME-SAC은 0.226M 파라미터를 사용하며, REDQ는 1.586M, ACE는 1.614M이므로 강력한 효율성을 보여준다.
  • 최적의 하이퍼파라미터 $p = 0.1$이 가장 높은 성능을 낼 뿐 아니라, 다양한 $p$ 값 범위에서 결과가 안정적이므로 민감도가 낮음을 확인했다.
  • 이론적 분석을 통해 MEPG가 정책 평가 단계에서 두 개의 동기화된 딥 가우시안 프로세스를 유지함으로써 벨먼 방정식의 안정성을 확보함을 확인했다.
  • MEPG는 추가 손실 함수나 계산 오버헤드 없이 도입되었으며, 자율 주행과 같은 실시간, 자원 제약이 있는 응용 분야에서의 구현이 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.