Skip to main content
QUICK REVIEW

[논문 리뷰] The Effect of Multi-step Methods on Overestimation in Deep Reinforcement Learning

Lingheng Meng, Rob Gorbet|arXiv (Cornell University)|2020. 06. 23.
Reinforcement Learning in Robotics참고 문헌 28인용 수 8
한 줄 요약

이 논문은 다단계 백업을 사용하여 딥 강화 학습에서 과소평가는 감소시키는 Multi-step DDPG(MDDPG)와 Mixed Multi-step DDPG(MMDDPG)를 제안한다. 재플레이 버퍼에서 얻은 다단계 수익을 활용함으로써, 표준 DDPG에 비해 과소평가가 크게 감소하여 학습 속도가 빨라지고 최종 성능이 향상되며, 계산 부담은 최소한으로 유지된다.

ABSTRACT

Multi-step (also called n-step) methods in reinforcement learning (RL) have been shown to be more efficient than the 1-step method due to faster propagation of the reward signal, both theoretically and empirically, in tasks exploiting tabular representation of the value-function. Recently, research in Deep Reinforcement Learning (DRL) also shows that multi-step methods improve learning speed and final performance in applications where the value-function and policy are represented with deep neural networks. However, there is a lack of understanding about what is actually contributing to the boost of performance. In this work, we analyze the effect of multi-step methods on alleviating the overestimation problem in DRL, where multi-step experiences are sampled from a replay buffer. Specifically building on top of Deep Deterministic Policy Gradient (DDPG), we propose Multi-step DDPG (MDDPG), where different step sizes are manually set, and its variant called Mixed Multi-step DDPG (MMDDPG) where an average over different multi-step backups is used as update target of Q-value function. Empirically, we show that both MDDPG and MMDDPG are significantly less affected by the overestimation problem than DDPG with 1-step backup, which consequently results in better final performance and learning speed. We also discuss the advantages and disadvantages of different ways to do multi-step expansion in order to reduce approximation error, and expose the tradeoff between overestimation and underestimation that underlies offline multi-step methods. Finally, we compare the computational resource needs of Twin Delayed Deep Deterministic Policy Gradient (TD3), a state-of-art algorithm proposed to address overestimation in actor-critic methods, and our proposed methods, since they show comparable final performance and learning speed.

연구 동기 및 목표

  • 다단계 방법이 딥 강화 학습(DRL)에서, 특히 DDPG와 같은 액터-크리틱 프레임워크에서 과소평가에 미치는 영향을 조사하는 것.
  • 연속 제어 작업에서 안정적이고 효율적인 학습을 방해하는 가치 함수 과소평가 문제를 해결하는 것.
  • 과소평가를 줄이면서도 학습 속도나 최종 성능를 유지하거나 향상시키는 DDPG의 다단계 확장 기법을 설계하고 평가하는 것.
  • 다단계 방법과 TD3와 같은 최신 알고리즘 간의 계산 효율성과 근사 오차 간의 트레이드오프를 비교하는 것.
  • 오프라인 다단계 백업에서 과소평가와 과소평가 간의 트레이드오프가 학습 안정성에 미치는 영향을 분석하는 것.

제안 방법

  • 다양한 고정된 단계 수(n)를 수동으로 설정하여 Q-값 타겟 계산에서 다단계 백업을 수행하는 Multi-step DDPG(MDDPG)를 제안한다.
  • 다양한 단계 수(n)에서의 Q-값 타겟을 가중 평균으로 계산하여 타겟 정확도를 향상시키는 Mixed Multi-step DDPG(MMDDPG)를 도입한다.
  • 다단계 전이를 저장하고 샘플링하기 위해 경험 재플레이 버퍼를 사용하여, 온라인 롤아웃 없이도 오프라인 다단계 백업을 가능하게 한다.
  • n단계에 걸친 부트스트랩 Q-값 추정을 통해 개별적으로 정확하지 않은 가치 추정치의 영향을 줄여 과소평가를 완화한다.
  • 학습 속도, 최종 성능, 계산 비용(전방/역전파 횟수) 측면에서 MDDPG와 MMDDPG를 DDPG 및 TD3와 비교한다.
  • 부트스트랩된 n단계 수익에서의 과소평가와 오프라인 재플레이 기반 백업에서의 과소평가 간의 트레이드오프를 분석하며, n이 이 트레이드오프를 균형 잡는 데 기여함을 보여준다.

실험 결과

연구 질문

  • RQ1DDPG에서 다단계 백업을 사용할 경우, Q-값 함수 근사에서 과소평가 정도에 어떤 영향을 미치는가?
  • RQ2다단계 방법을 사용해도 계산 비용을 증가시키지 않고 딥 강화 학습(DRL)에서 학습 속도와 최종 성능를 향상시킬 수 있는가?
  • RQ3부트스트랩된 n단계 수익에서의 과소평가와 오프라인 재플레이 기반 백업에서의 과소평가 간의 트레이드오프는 무엇인가?
  • RQ4TD3와 같은 과소평가를 줄이기 위해 특별히 설계된 최신 알고리즘과 비교해 MDDPG와 MMDDPG의 성능은 어떻게 되는가?
  • RQ5과소평가와 과소평가를 균형 잡기 위해 다단계 백업에서 단계 수 n을 선택하는 최적의 전략은 무엇인가?

주요 결과

  • 표준 DDPG에 비해 MDDPG와 MMDDPG는 과소평가를 크게 감소시켜 연속 제어 작업에서 더 안정적이고 효과적인 학습을 가능하게 한다.
  • MMDDPG는 TD3와 유사한 최종 성능와 학습 속도를 달성한다. TD3는 과소평가를 완화하기 위해 특별히 설계된 최신 알고리즘이다.
  • MDDPG는 TD3보다 더 적은 계산 자원을 소비한다. 미니배치당 전방 및 역전파를 각각 한 번씩 수행하므로 DDPG와 유사하다.
  • MMDDPG는 단계 수 n ≥ 4일 경우, 타겟 Q-값 계산을 위해 n번의 전방 전파가 필요하므로 TD3보다 더 높은 계산 비용을 유발한다.
  • 오프라인 다단계 백업은 초기에는 진짜 Q-값을 과소평가하는 경향이 있지만, 재플레이 버퍼가 채워질수록 점차 온라인 다단계 값에 수렴한다.
  • 단계 수 n의 선택은 부트스트랩된 n단계 수익에서의 과소평가와 오프라인 재플레이에서의 과소평가 간의 트레이드오프를 포함하며, 이는 학습 중 균형을 이루어야 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.