Skip to main content
QUICK REVIEW

[논문 리뷰] WD3: Taming the Estimation Bias in Deep Reinforcement Learning

Qiang He, Xinwen Hou|arXiv (Cornell University)|2020. 06. 18.
Reinforcement Learning in Robotics참고 문헌 20인용 수 4
한 줄 요약

WD3는 딥 강화학습에서 비용 함수 추정의 과대평가 및 과소평가 편향을 동시에 줄이기 위해 쌍둥이 크리틱스에 대한 가중 평균 메커니즘을 제안한다. 학습 가능한 가중치 β를 가진 두 크리틱스의 볼록 조합을 통해 WD3는 더 정확한 가치 추정을 달성하여 DDPG 및 TD3에 비해 더 높은 샘플 효율성과 연속 제어 작업 성능을 확보한다.

ABSTRACT

The overestimation phenomenon caused by function approximation is a well-known issue in value-based reinforcement learning algorithms such as deep Q-networks and DDPG, which could lead to suboptimal policies. To address this issue, TD3 takes the minimum value between a pair of critics. In this paper, we show that the TD3 algorithm introduces underestimation bias in mild assumptions. To obtain a more precise estimation for value function, we unify these two opposites and propose a novel algorithm \underline{W}eighted \underline{D}elayed \underline{D}eep \underline{D}eterministic Policy Gradient (WD3), which can eliminate the estimation bias and further improve the performance by weighting a pair of critics. To demonstrate the effectiveness of WD3, we compare the learning process of value function between DDPG, TD3, and WD3. The results verify that our algorithm does eliminate the estimation error of value functions. Furthermore, we evaluate our algorithm on the continuous control tasks. We observe that in each test task, the performance of WD3 consistently outperforms, or at the very least matches, that of the state-of-the-art algorithms\footnote{Our code is available at~\href{https://sites.google.com/view/ictai20-wd3/}{https://sites.google.com/view/ictai20-wd3/}.}.

연구 동기 및 목표

  • 가치 기반 딥 강화학습 알고리즘에서 지속적인 추정 편향(과대평가 및 과소평가) 문제를 해결한다.
  • TD3에서 두 크리틱스의 최소값을 사용할 경우 연속 제어 작업에서 과소평가 편향이 발생함을 규명한다.
  • 과대평가와 과소평가를 통합하는 새로운 알고리즘을 개발하여, 학습 가능한 가중 평균을 통해 더 정확한 가치 추정을 달성한다.
  • 연속 제어 환경에서 더 나은 가치 함수 추정을 통해 정책 학습의 안정성과 성능 향상을 입증한다.

제안 방법

  • 학습 가능한 파라미터 β를 가진 두 크리틱스의 가중 평균을 사용하는 타겟 가치 함수를 제안하여 과대평가와 과소평가의 균형을 이룬다.
  • 수정된 타겟 가치 계산을 도입: y_target = r + γ * (β * Q1(s', a') + (1 - β) * Q2(s', a'))를 행동가치 함수 추정에 활용한다.
  • 학습 안정성과 과적합 방지를 위해 TD3와 유사하게 지연된 정책 업데이트 및 타겟 네트워크 스무딩을 적용한다.
  • 두 크리틱스의 볼록 조합을 통해 TD3의 최소 연산자나 개별 크리틱스보다 더 강력하고 정확한 가치 추정을 구현한다.
  • 액터와 크리틱스를 엔드 투 엔드로 동시에 훈련하며, 오차 감소에 Huber 손실을 사용하여 외곽치에 대한 민감도를 낮춘다.
  • 편향과 분산의 균형을 맞추기 위해 조정 가능한 하이퍼파라미터 β를 도입하였으며, 다양한 β 값에서의 성능 안정성을 실험으로 입증하였다.

실험 결과

연구 질문

  • RQ1TD3에서 두 크리틱스의 최소값을 사용할 경우 연속 제어 작업에서 과소평가 편향이 발생하는가?
  • RQ2두 크리틱스의 가중 조합이 단일 크리틱스나 최소 연산자보다 과대평가 및 과소평가 편향을 더 효과적으로 줄일 수 있는가?
  • RQ3WD3의 가치 함수 추정은 DDPG 및 TD3에 비해 정확성과 안정성 측면에서 어떻게 비교되는가?
  • RQ4학습 가능한 가중치 β는 다양한 환경에서 알고리즘 성능과 내구성에 어떤 영향을 미치는가?
  • RQ5WD3는 연속 제어 벤치마크에서 최신 기술 수준의 알고리즘보다 일관된 성능 향상을 달성할 수 있는가?

주요 결과

  • WD3는 훈련 전반에 걸쳐 안정적이고 정확한 가치 함수 추정을 통해 가치 함수 학습에서의 추정 편향을 크게 줄였다. 이는 DDPG 및 TD3를 모두 능가하는 성능을 보였다.
  • Ant 환경에서 WD3의 가치 함수 추정은 몬테카를로 롤아웃을 통해 추정한 진짜 가치에 가까운 값을 유지하지만, DDPG는 과대평가하고 TD3는 과대평가 및 과소평가 단계를 번갈아가며 나타낸다.
  • WD3는 OpenAI Gym의 모든 연속 제어 환경에서 일관된 성능 향상을 보였으며, 최신 기술 수준의 알고리즘을 능가하거나 동등하게 성능을 내었다.
  • WD3의 하이퍼파라미터 β는 내구성이 뛰어나 다양한 값에서 성능이 안정적으로 유지되어, WD3는 광범위한 하이퍼파라미터 튜닝이 필요로 하지 않음을 시사한다.
  • WD3의 학습 과정은 심각한 과대평가 또는 과소평가가 발생하지 않아, DDPG 및 TD3에 비해 가치 함수 업데이트의 우수한 안정성을 보였다.
  • 이론적 및 실증 분석을 통해 TD3의 최소 연산자가 과소평가 편향을 유발하는 것으로 확인되었으며, WD3는 크리틱스의 볼록 조합을 통해 이를 효과적으로 완화함을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.