Skip to main content
QUICK REVIEW

[논문 리뷰] Provable and Practical: Efficient Exploration in Reinforcement Learning via Langevin Monte Carlo

Haque Ishfaq, Qingfeng Lan|arXiv (Cornell University)|2023. 05. 29.
Reinforcement Learning in Robotics인용 수 5
한 줄 요약

이 논문은 랭지에빈 몬테카를로를 사용해 Q함수의 사후분포에서 직접 샘플링함으로써 가우시안 근사 없이 탐색을 수행하는, 증명 가능하게 효율적인 강화학습 탐색 방법인 LMC-LSVI(Langevin Monte Carlo Least-Squares Value Iteration)를 제안한다. 선형 MDP에서 $\widetilde{O}(d^{3/2}H^{5/2}\sqrt{T})$의 리그레트 한계를 달성하며, 예비 조건이 없는 Adam 변형인 Adam LMCDQN을 사용해 Atari57 작업에서 최신 딥 RL 알고리즘을 능가한다.

ABSTRACT

We present a scalable and effective exploration strategy based on Thompson sampling for reinforcement learning (RL). One of the key shortcomings of existing Thompson sampling algorithms is the need to perform a Gaussian approximation of the posterior distribution, which is not a good surrogate in most practical settings. We instead directly sample the Q function from its posterior distribution, by using Langevin Monte Carlo, an efficient type of Markov Chain Monte Carlo (MCMC) method. Our method only needs to perform noisy gradient descent updates to learn the exact posterior distribution of the Q function, which makes our approach easy to deploy in deep RL. We provide a rigorous theoretical analysis for the proposed method and demonstrate that, in the linear Markov decision process (linear MDP) setting, it has a regret bound of $ ilde{O}(d^{3/2}H^{3/2}\sqrt{T})$, where $d$ is the dimension of the feature mapping, $H$ is the planning horizon, and $T$ is the total number of steps. We apply this approach to deep RL, by using Adam optimizer to perform gradient updates. Our approach achieves better or similar results compared with state-of-the-art deep RL algorithms on several challenging exploration tasks from the Atari57 suite.

연구 동기 및 목표

  • Q함수의 사후분포에 대한 열악한 가우시안 근사를 기반으로 하는 기존 톰슨 샘플링 방법의 한계를 해결하기 위해.
  • 이론적 보장을 유지하면서도 확장성 있고 실용적인 딥 강화학습을 위한 탐색 전략을 개발하기 위해.
  • 사후분포의 구조에 대한 제약 조건 없이 Q함수의 직접 사후 샘플링을 가능하게 하기 위해.
  • 선형 MDP에서 증명 가능한 비선형 리그레트를 달성하면서도 고차원 딥 RL 환경에서 구현 가능한 방법을 개발하기 위해.
  • 어려운 탐색 벤치마크인 Atari57에서 최신 딥 RL 알고리즘에 비해 경험적으로 뛰어난 성능을 보여주기 위해.

제안 방법

  • 사후분포의 진짜 분포에서 직접 샘플링하기 위해 마르코프 체인 몬테카를로(Markov Chain Monte Carlo) 방법인 랭지에빈 몬테카를로(LMC)를 사용하여 가우시안 근사를 피한다.
  • 스토하스틱 그래디언트 랭지에빈 다이내믹스(SGLD)를 통해 노이즈가 있는 그래디언트 하강 업데이트를 적용하여, 딥 RL에서의 확장 가능한 사후분포 샘플링을 가능하게 한다.
  • 반복적인 노이즈가 있는 업데이트를 통해 사후분포 샘플링을 수행하는 원칙적인 온라인 강화학습 알고리즘인 LMC-LSVI를 도입한다.
  • 학습 안정성과 수렴성 향상을 위해 아담 최적화기(Adam optimizer)를 활용한 프리컨dition드 변형인 Adam LMCDQN을 제안한다.
  • Q-값 추정의 과대평가 편향을 줄이기 위해 더블 Q네트워크 아키텍처를 사용하여 안정성과 성능을 향상시킨다.
  • SGLD에서의 역온도 및 편향 인자 하이퍼파rameter를 사용하여 탐색 노이즈를 제어하고, 탐색과 이용의 균형을 조절한다.

실험 결과

연구 질문

  • RQ1랭지에빈 몬테카를로를 통한 Q함수의 직접 사후 샘플링이 딥 강화학습에서 증명 가능한 효율적 탐색을 이끌 수 있는가?
  • RQ2사후분포에 대한 가우시안 근사를 피하는 것이 복잡한 고차원 강화학습 환경에서 샘플 효율성과 성능을 향상시키는가?
  • RQ3선형 MDP 설정에서 LMC 기반 탐색 방법의 이론적 리그레트 한계는 무엇이며, 차원과 환경 길이에 따라 어떻게 척도가 변하는가?
  • RQ4아담을 사용한 프리컨디셔닝된 SGLD가 딥 Q네트워크에서 수렴성과 성능을 향상시키면서도 탐색 보장을 유지할 수 있는가?
  • RQ5제안된 방법은 어려운 탐색 벤치마크인 Atari57에서 최신 딥 RL 알고리즘과 경험적으로 어떻게 비교되는가?

주요 결과

  • 제안된 LMC-LSVI 알고리즘은 선형 MDP에서 $\widetilde{O}(d^{3/2}H^{5/2}\sqrt{T})$의 리그레트 한계를 달성하며, 이는 특성 차원 $d$에 대한 최적성으로 입증된다.
  • 아담 최적화기를 사용한 프리컨디셔닝 변형인 Adam LMCDQN은 Atari57 벤치마크 세트에서 최신 딥 RL 알고리즘과 비교해 더 낫거나 유사한 성능을 달성한다.
  • 대부분의 아타리 게임에서 랭지에빈 DQN보다 성능이 뛰어나, 아담 프리컨디셔닝이 탐색에 효과적임을 입증한다.
  • 경험 결과에 따르면 더블 Q네트워크 없이도 Adam LMCDQN의 성능은 약간 떨어질 뿐이지, 아키텍처 선택에 대해 매우 강건함을 보였다.
  • 하이퍼파라미터 스윕 결과, 역온도 $\beta_k$와 편향 인자 $a$가 성능에 크게 영향을 미치며, $\beta_k = 10^{16}$ 및 $a = 1.0$일 때 강력한 성능을 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.