QUICK REVIEW
[논문 리뷰] Thompson Sampling is Asymptotically Optimal in General Environments
Jan Leike, Tor Lattimore|arXiv (Cornell University)|2016. 02. 25.
Advanced Bandit Algorithms Research참고 문헌 15인용 수 18
한 줄 요약
이 논문은 일반적인 스토케스틱 환경에서 마르코프, 에르고딕성, 완전 관측 조건을 필요로 하지 않고도 톰슨 샘플링이 減량적 최적성과 비선형적 최소 손실을 달성함을 입증한다. 가чёт한 환경 클래스에 대한 사후 분포에서 샘플링하고, 볼록한 전망 수준 동안 최적으로 행동함으로써, 이 방법은 최적 성능으로 수렴하고 복구 가능성 조건 하에서 점점 줄어드는 손실을 초래한다.
ABSTRACT
We discuss a variant of Thompson sampling for nonparametric reinforcement learning in a countable classes of general stochastic environments. These environments can be non-Markov, non-ergodic, and partially observable. We show that Thompson sampling learns the environment class in the sense that (1) asymptotically its value converges to the optimal value in mean and (2) given a recoverability assumption regret is sublinear.
연구 동기 및 목표
- 일반적이고 마르코프적이지도, 에르고딕성도 아니며 부분 관측 가능한 스토케스틱 환경에서 톰슨 샘플링의 점점 최적성과 비선형적 손실을 입증하는 것.
- 베이지안 에이전트의 제한을 극복하기 위해, 톰슨 샘플링이 사전 편향을 피하고 객관적 최적성을 달성함을 보이는 것.
- 비모수적이고 가чёт한 환경 클래스에서 강력한 에르고딕성 또는 사후 행동에 대한 강한 가정 없이도 톰슨 샘플링에 대한 이론적 보장을 제공하는 것.
- 일반 강화 학습 프레임워크 내에서 베이지안 탐색과 빈도주의 손실 한계를 조화시키는 것.
- 톰슨 샘플링이 약한 복구 가능성 가정 하에 평균적으로 점점 최적화되고 비선형적 손실을 달성할 수 있음을 보여주는 것.
제안 방법
- 톰슨 샘플링은 가чёт한 스토케스틱 환경 클래스에 대한 사후 분포에서 환경 모델 ρ를 선택한다.
- 각 샘플된 환경 ρ에 대해, 할인 함수의 질량을 대부분 포함하는 전망 수준 동안 ρ-최적 정책을 따르는 에이전트이다.
- 정책은 각 시간 단계에서 사후 분포에서 재샘플링하고 현재 유효한 전망 수준에 대해 최적으로 행동함으로써 업데이트된다.
- 분석은 에이전트가 나쁜 상태에서 벗어나 최적 성능으로 복구할 수 있도록 보장하는 복구 가능성 가정에 기반한다.
- 이론적 결과는 베이지안 업데이트와 진짜 환경과 구별할 수 없는 환경들에 대한 사후 집중을 사용하여 도출된다.
- 손실 한계는 커플링 추론과 특정 적분 가능성 및 감쇠 조건을 만족하는 할인 함수의 사용을 통해 확립된다.
실험 결과
연구 질문
- RQ1톰슨 샘플링은 마르코프성 또는 에르고딕성 가정 없이 일반적인 스토케스틱 환경에서 평균적으로 점점 최적화될 수 있는가?
- RQ2복구 가능성 조건 하에서 톰슨 샘플링은 일반 환경에서 비선형적 손실을 보일 수 있는가?
- RQ3사전가정이 잘못되었을 경우, 톰슨 샘플링은 베이즈-최적 에이전트와 비교해 손실과 수렴 속도 측면에서 어떻게 다른가?
- RQ4톰슨 샘플링은 탐색 메커니즘을 통해 오프-정책 예측이나 정보 획득을 달성할 수 있는가?
- RQ5고려된 일반 설정에서 톰슨 샘플링은 약한 점점 최적성을 가지는가?
주요 결과
- 톰슨 샘플링은 평균적으로 점점 최적화된다: 정책의 할인된 가치가 환경 클래스의 모든 환경에서 최적 값으로 수렴한다.
- 복구 가능성 가정 하에서, 톰슨 샘플링의 최악의 경우 손실은 비선형적이다. 즉, Rₘ(πₜ, μ) ∈ o(m) 이다.
- 수렴은 확률적 수렴이며, 사후 행동이나 에르고딕성에 대한 강한 가정이 필요하지 않다.
- 이 손실 한계는 마르코프적이지도 않고 부분 관측 가능한 설정을 포함한 이러한 일반적인 환경에서 톰슨 샘플링에 대해 처음으로 확립된 것이다.
- 톰슨 샘플링의 탐색은 정보 최대화가 아니라 보상 중심이므로, Bayes-Exp와는 탐색 전략에서 다르다.
- 강력한 사전 편향이 있음에도 불구하고, 사전가정이 ξ에 대해 높은 확률을 할당할 경우, 톰슨 샘플링은 베이지안 혼합 ξ에서 거의 최적의 성능을 달성할 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.