Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Unknown Markov Decision Processes: A Thompson Sampling Approach

Yi Ouyang, Mukul Gagrani|arXiv (Cornell University)|2017. 09. 14.
Advanced Bandit Algorithms Research참고 문헌 9인용 수 14
한 줄 요약

이 논문은 알려지지 않은 약한 연결성 있는 마코프 결정 과정(MDPs)을 학습하기 위한 강화 학습 알고리즘인 동적 에피소드를 통한 톰슨 샘플링(TSDE)을 제안한다. MDP 파라미터의 사후분포에서 샘플링하고, 상태-행동 쌍의 방문 수가 두 배가 되는 것과 에피소드 길이의 통제된 증가라는 두 가지 정지 기준을 사용함으로써, TSDE는 $\tilde{O}(HS\sqrt{AT})$의 베이지안 기대 위험 한계를 달성한다. 이는 이 클래스의 MDP에 대해 알려진 바에 비해 최고의 이론적 성능을 보이며, 시뮬레이션에서 기존 알고리즘들을 능가한다.

ABSTRACT

We consider the problem of learning an unknown Markov Decision Process (MDP) that is weakly communicating in the infinite horizon setting. We propose a Thompson Sampling-based reinforcement learning algorithm with dynamic episodes (TSDE). At the beginning of each episode, the algorithm generates a sample from the posterior distribution over the unknown model parameters. It then follows the optimal stationary policy for the sampled model for the rest of the episode. The duration of each episode is dynamically determined by two stopping criteria. The first stopping criterion controls the growth rate of episode length. The second stopping criterion happens when the number of visits to any state-action pair is doubled. We establish $ ilde O(HS\sqrt{AT})$ bounds on expected regret under a Bayesian setting, where $S$ and $A$ are the sizes of the state and action spaces, $T$ is time, and $H$ is the bound of the span. This regret bound matches the best available bound for weakly communicating MDPs. Numerical results show it to perform better than existing algorithms for infinite horizon MDPs.

연구 동기 및 목표

  • 특수한 구조적 가정 없이 일반적인 무한할행 MDP에 대해 이론적으로 타당한 톰슨 샘플링 알고리즘이 부족한 문제를 해결하기 위해.
  • 약한 연결성 있는 MDP에서 강력한 위험 한계를 달성할 수 있도록 동적 에피소드 스케줄링 메커니즘을 설계하기 위해.
  • 사후 샘플링과 적응형 에피소드 종료를 통해 탐색과 이용의 균형을 이루기 위해.
  • 약한 연결성 있는 MDP에 대해 알려진 바에 비해 최고의 이론적 성능을 달성하는 위험 한계를 확립하기 위해.

제안 방법

  • 알고리즘은 각 에피소드의 시작 시, 알려지지 않은 MDP 파라미터에 대한 현재 믿음에서 사후분포에서 샘플링된 모델을 생성한다.
  • 에피소드가 어떤 상태-행동 쌍의 방문 수가 두 배로 증가하거나, 에피소드 길이가 시간에 따라 선형적으로 증가할 때 종료된다.
  • 에피소드 길이는 성장률 기준을 통해 동적으로 제어되어, 충분한 탐색과 위험 분석의 안정성을 확보한다.
  • 에이전트는 각 에피소드 동안 샘플된 MDP에 대한 최적의 정적 정책을 따르며 행동한다.
  • 전이 확률에 대한 딜레트 분포를 사전으로 사용하여 베이지안 추론을 적용함으로써 사후 분포를 유지한다.
  • 위험 분석은 농도 부등식과 에피소드 수 및 길이에 대한 경계를 조합하여 최종 위험 한계를 유도한다.

실험 결과

연구 질문

  • RQ1재귀성이나 알려진 재귀 상태와 같은 특수한 구조적 가정 없이, 일반적인 무한할행 MDP에 대해 톰슨 샘플링을 효과적으로 적용할 수 있는가?
  • RQ2MDP에 대한 톰슨 샘플링에서 강력한 위험 한계를 달성하기 위해 필요한 에피소드 종료 기준은 무엇인가?
  • RQ3성장률 제어와 방문 수 두 배 증가 기준을 조합한 동적 에피소드 길이 스케줄링이 위험 성능 향상에 기여하는가?
  • RQ4제안된 TSDE 알고리즘이 유사한 위험 순서를 가지는 기존 알고리즘들과 비교해 실제로 어떻게 성능을 냈는가?

주요 결과

  • TSDE는 $\tilde{O}(HS\sqrt{AT})$의 베이지안 기대 위험 한계를 달성하며, 약한 연결성 있는 MDP에 대해 알려진 바에 비해 최고의 한계와 일치한다.
  • 위험 한계는 로그 인자에 대해 정확하게 타이트하며, $T$의 순서에서 이론적 하한에 가까워진다.
  • 랜덤으로 생성된 MDP에서의 시뮬레이션 결과, TSDE는 기대 위험 측면에서 UCRL2, TSMDP, 그리고 레이지 PSRL를 뛰어넘는다.
  • 강하강수 문제에서 TSDE는 TSMDP와 특별히 선택된 재샘플링 상태를 사용한 경우조차도 모든 기준보다 뛰어나며, 모델 불확실성에 대한 강건성을 입증한다.
  • TSDE와 레이지 PSRL 간의 성능 격차는 성장률 제어 기준(첫 번째 정지 기준)이 이용과 탐색의 균형을 이루는 데 중요한 역할을 한다는 점을 시사한다.
  • 결과는 TSDE가 비베이지안 설정에서도 유사한 위험 한계를 달성할 수 있을 것임을 시사하지만, 분석은 여전히 베이지안 프레임워크 내에서 수행되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.