Skip to main content
QUICK REVIEW

[논문 리뷰] Noise, overestimation and exploration in Deep Reinforcement Learning

Rafael Stekolshchik|arXiv (Cornell University)|2020. 06. 25.
Reinforcement Learning in Robotics참고 문헌 6인용 수 7
한 줄 요약

이 논문은 딥 강화 학습에서 노이즈의 双중 역할을 조사한다: 가치 함수 추정에서 유해한 과대평가의 원인이 되는 것과 탐색 기제로서의 유익한 기능. DQN, Double DQN, DDPG, TD3, 그리고 힐-클라이밍에서의 노이즈 영향을 분석하며, 특히 HopperBulletEnv와 Walker2DBulletEnv와 같은 PyBullet 환경에서 TD3의 노이즈 파라미터를 최적화하는 데 중점을 두고, 탐색 효율성을 향상시키기 위해 힐-클라이밍에 적응형 노이즈를 도입한다.

ABSTRACT

We will discuss some statistical noise related phenomena, that were investigated by different authors in the framework of Deep Reinforcement Learning algorithms. The following algorithms are touched: DQN, Double DQN, DDPG, TD3, Hill-Climbing. Firstly, we consider overestimation, that is the harmful property resulting from noise. Then we deal with noise used for exploration, this is the useful noise. We discuss setting the noise parameter in TD3 for typical PyBullet environments associated with articulate bodies such as HopperBulletEnv and Walker2DBulletEnv. In the appendix, in relation with the Hill-Climbing algorithm, we will look at one more example of noise: adaptive noise.

연구 동기 및 목표

  • DQN과 Double DQN와 같은 가치 기반 딥 강화 학습 알고리즘에서 통계적 노이즈가 어떻게 과대평가를 유도하는지 이해하는 것.
  • DDPG와 TD3와 같은 액터-크리틱 방법에서 노이즈를 효과적인 탐색 전략으로 사용하는 방법을 검토하는 것.
  • PyBullet 환경에서의 이동 작업을 위한 TD3에서 노이즈 파라미터 설정에 대한 경험적 지침을 제공하는 것.
  • 탐색 효율성을 향상시키기 위한 힐-클라이밍에서의 적응형 노이즈 메커니즘을 탐색하는 것.

제안 방법

  • 부트스트랩드 타겟에서의 노이즈로 인한 가치 네트워크의 과대평가 편향을 분석하며, 특히 DQN과 Double DQN에서 중점적으로 다룬다.
  • DDPG와 TD3에서 행동 선택에 노이즈 주입을 탐색 전략으로 평가하며, 특히 연속 제어 작업에서의 적용을 중심으로 분석한다.
  • HopperBulletEnv와 Walker2DBulletEnv에서 TD3의 노이즈 스케일 하이퍼파라미터를 경험적으로 최적화하여 탐색과 안정성의 균형을 이루는 데 중점을 둔다.
  • 학습 진행 상황과 기울기 크기를 기반으로 노이즈 크기를 조정하는 적응형 노이즈를 도입하고 평가한다.

실험 결과

연구 질문

  • RQ1DQN과 Double DQN에서 가치 함수 타겟의 노이즈가 어떻게 과대평가를 유도하는가?
  • RQ2노이즈 기반 탐색이 PyBullet 이동 환경에서 TD3의 샘플 효율성에 얼마나 기여하는가?
  • RQ3HopperBulletEnv와 Walker2DBulletEnv에서 탐색과 수렴성을 균형 잡기 위해 TD3에서 어떤 최적의 노이즈 스케일을 사용해야 하는가?
  • RQ4적응형 노이즈가 고정 노이즈 탐색에 비해 수렴 속도와 최종 성능 측면에서 어떻게 비교되는가?

주요 결과

  • 값 함수 타겟에서의 노이즈는 DQN과 Double DQN에서 특히 고분산 환경에서 심각한 과대평가를 유도한다.
  • 적절히 최적화된 노이즈 스케일을 가진 TD3는 HopperBulletEnv와 Walker2DBulletEnv에서 안정적인 학습과 향상된 샘플 효율성을 달성한다.
  • TD3에서 최적의 노이즈 스케일은 환경에 따라 달라지며, 일반적으로 초기 학습 단계에서 더 높은 값이 탐색을 향상시킨다.
  • 힐-클라이밍에서의 적응형 노이즈는 수동 하이퍼파라미터 튜닝의 필요성을 줄이고 희소 보상 환경에서 수렴 속도를 가속화한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.