Skip to main content
QUICK REVIEW

[논문 리뷰] Successor Uncertainties: Exploration and Uncertainty in Temporal Difference Learning

David M. Janz, Jiri Hron|arXiv (Cornell University)|2018. 10. 15.
Reinforcement Learning in Robotics참고 문헌 32인용 수 9
한 줄 요약

이 논문은 성공자 불확실성(SU)을 소개한다. SU는 신경망 함수 근사와 함께 효과적인 탐색 성질을 유지하면서도 기존의 Posterior Sampling for Reinforcement Learning(PSRL)의 탐색 이점을 유지하는 모델 자유형 강화학습 알고리즘이다. SU는 희박 보상 타뷸라 환경에서 최신 기준 성능을 달성하였고, 49개의 Atari 2600 게임 중 38개에서 인간 수준 성능을 초월하여 기존의 Bootstrapped DQN 및 불확실성 벨만 방정식과 같은 방법들을 능가한다.

ABSTRACT

Posterior sampling for reinforcement learning (PSRL) is an effective method for balancing exploration and exploitation in reinforcement learning. Randomised value functions (RVF) can be viewed as a promising approach to scaling PSRL. However, we show that most contemporary algorithms combining RVF with neural network function approximation do not possess the properties which make PSRL effective, and provably fail in sparse reward problems. Moreover, we find that propagation of uncertainty, a property of PSRL previously thought important for exploration, does not preclude this failure. We use these insights to design Successor Uncertainties (SU), a cheap and easy to implement RVF algorithm that retains key properties of PSRL. SU is highly effective on hard tabular exploration benchmarks. Furthermore, on the Atari 2600 domain, it surpasses human performance on 38 of 49 games tested (achieving a median human normalised score of 2.09), and outperforms its closest RVF competitor, Bootstrapped DQN, on 36 of those.

연구 동기 및 목표

  • 기존의 랜덤화된 가치함수(RVF) 방법들이 신경망과 함께 PSRL을 확장할 때 핵심적인 PSRL 성질을 상실함으로써 실패하는 문제를 해결하기 위해.
  • 후행 샘플링에서 효과적인 탐색을 위해 불확실성 전파가 필수적이거나 충분한 조건인지 조사하기 위해.
  • 이론적·실험적으로 PSRL의 강점과 효과성을 유지하면서도 단순하고 효율적이며 확장 가능한 RVF 알고리즘을 설계하기 위해.
  • SU가 딱딱한 타뷸라 탐색 벤치마크와 Atari 2600 환경에서의 효과성을 입증하기 위해.

제안 방법

  • SU는 성공자 특징에 대한 사후 분포를 사용하여 불확실성을 모델링함으로써, 사후 샘플링을 통한 효과적인 탐색을 가능하게 한다.
  • 불확실성이 학습된 가중치 분포를 통해 가치함수를 통해 전파되는 파arameterized 성공자 특징 모델을 도입한다.
  • 신경망을 사용하여 성공자 특징과 그 불확실성을 동시에 예측하며, 매개변수에 대해 별도의 사전과 우도를 설정한다.
  • 핵심적 혁신은 가중치 분포에 대해 감쇠하는 공분산 행렬을 사용하는 것으로, 이는 학습 안정성과 불확실성 추정 유지에 기여한다.
  • SU는 근사 사후 분포에서 가중치를 샘플링하여 사후 샘플링을 적용하고, 샘플된 가중치와 특징의 선형 조합을 통해 Q-값을 계산한다.
  • 표준 딥 Q-네트워크 아키텍처를 사용하며, 공유된 특징과 보상 및 Q-값 예측를 위한 별도의 헤드를 갖추어 엔드 투 엔드 학습을 가능하게 한다.

실험 결과

연구 질문

  • RQ1신경망과 사후 샘플링을 결합한 기존 RVF 방법들이 PSRL의 효과성을 보장하는 이론적 성질을 유지하는가?
  • RQ2후행 샘플링 강화학습에서 효과적인 탐색을 위해 불확실성 전파가 필수적이거나 충분한 조건인가?
  • RQ3PSRL의 탐색 효율성을 함수 근사 설정에서 유지하면서도 단순하고 확장 가능한 RVF 알고리즘을 설계할 수 있는가?
  • RQ4희박 보상 환경에서 SU가 Bootstrapped DQN 및 불확실성 벨만 방정식과 같은 최신 탐색 알고리즘보다 어떻게 비교되는가?

주요 결과

  • SU는 딱딱한 타뷸라 탐색 벤치마크에서 최신 기준 성능을 달성하여 뛰어난 샘플 효율성과 강건성을 입증하였다.
  • Atari 2600 환경에서 SU는 49개 게임 중 38개에서 인간 성능을 초월하였으며, 인간 정규화된 중앙값 점수는 2.09를 기록하였다.
  • SU는 49개 Atari 게임 중 36개에서 Bootstrapped DQN을 능가하여 딥 강화학습 환경에서의 탐색 성능에서의 열세를 확인하였다.
  • 논문은 불확실성 전파가 후행 샘플링 강화학습에서 효과적인 탐색을 위해 필수적이지도, 충분한 조건지도 아니라는 것을 증명하였다. 이는 이전의 가정을 도전한다.
  • SU는 대규모 문제에서도 높은 성능을 유지하지만, 원-핫 상태 인코딩으로 인한 메모리 제약으로 체인 문제의 L ≤ 160까지의 실험에 국한되었다.
  • 6개의 Atari 게임에서의 하이퍼파ram터 튜닝을 통해 최적의 설정을 도출하였으며, 학습률 5×10⁻⁵, 배치 크기 32, 가중치 공분산 감쇠 인자 1−10⁻⁵를 포함한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.