Skip to main content
QUICK REVIEW

[논문 리뷰] Regret Bounds for Thompson Sampling in Episodic Restless Bandit Problems

Young Hun Jung, Ambuj Tewari|arXiv (Cornell University)|2019. 05. 29.
Advanced Bandit Algorithms Research참고 문헌 16인용 수 11
한 줄 요약

이 논문은 이진 보상과 알려지지 않은 파라미터를 가진 에피소드적 불안정 밴드잇 문제에서 톰슨 샘플링을 분석하며, 일반 정책 매핑 경쟁자에 대해 베이지안 리그레트 한계 $ ilde{ackepsilon}(ackepsilonackepsilonackepsilonackepsilon)$ 를 증명한다. 이 접근법은 최적, 윌블 인덱스, 또는 시각 정책과 같은 정책에 대한 민첩한 벤치마킹을 가능하게 하며, 시뮬레이션된 질베르트-엘리엇 채널에서 이론적 결과를 검증하는 실험 결과를 제공한다.

ABSTRACT

Restless bandit problems are instances of non-stationary multi-armed bandits. These problems have been studied well from the optimization perspective, where the goal is to efficiently find a near-optimal policy when system parameters are known. However, very few papers adopt a learning perspective, where the parameters are unknown. In this paper, we analyze the performance of Thompson sampling in episodic restless bandits with unknown parameters. We consider a general policy map to define our competitor and prove an $ ilde{\mathcal{O}}(\sqrt{T})$ Bayesian regret bound. Our competitor is flexible enough to represent various benchmarks including the best fixed action policy, the optimal policy, the Whittle index policy, or the myopic policy. We also present empirical results that support our theoretical findings.

연구 동기 및 목표

  • 시스템 파라미터가 알려지지 않은 에피소드적 불안정 밴드잇 문제에서 톰슨 샘플링을 분석하는 것.
  • 최적, 윌블 인덱스, 또는 시각 정책과 같은 광범위한 경쟁자 정책 클래스에 적용 가능한 베이지안 리그레트 한계를 설정하는 것.
  • 에피소드적 리셋과 베이지안 추론을 활용하여 불안정 밴드잇에서의 부분 관측 문제에 도전하는 것.
  • 경쟁자 정책이 약하거나 최적일 수 없는 경우에도 톰슨 샘플링이 선형 이하의 리그레트를 달성할 수 있음을 보여주는 것.
  • 이론적 결과를 이산 사전을 가진 빈도주의 영역으로 확장하고 실험적으로 성능를 검증하는 것.

제안 방법

  • 문제는 이진 보상과 암호화된 상태 전이를 가진 부분 관측 가능 마르코프 결정 과정(POMDP)으로 모델링되며, 이는 암호화된 암호 선택에 따라 달라진다.
  • 에피소드적 구조를 가정하며, 매 $L$ 단위 시간마다 시스템이 리셋되며, 이는 유한 수명 문제로의 분석을 단순화한다.
  • 일반 정책 매핑을 도입하여 경쟁자를 정의함으로써, 경쟁자가 최적, 윌블 인덱스, 또는 시각 정책을 포함한 임의의 결정적 정책이 될 수 있도록 허용한다.
  • 톰슨 샘플링은 알려지지 않은 시스템 파라미터(전이 행렬 및 초기 상태)에 대한 사후 분포를 유지하고, 이 사후에서 액션을 샘플링함으로써 적용된다.
  • 리그레트는 진짜 파라미터 하에서 경쟁자 정책의 가치에 기반하여 정의되며, 농도 불등식과 사후 수렴을 이용하여 베이지안 리그레트를 경계한다.
  • 모의 실험을 통해 알려진 파라미터를 가진 시뮬레이션된 질베르트-엘리엇 채널을 사용하여 검증을 수행하며, 가치 함수 수렴과 사후 무게 동역학을 추적한다.

실험 결과

연구 질문

  • RQ1알려지지 않은 파라미터를 가진 에피소드적 불안정 밴드잇 문제에서 톰슨 샘플링이 선형 이하의 리그레트 한계를 달성할 수 있는가?
  • RQ2경쟁자 정책이 최적 정책이 아닌 경우, 예를 들어 윌블 인덱스나 시각 정책일 경우, $ackepsilonackepsilonackepsilonackepsilon$ 리그레트 한계가 유지되는가?
  • RQ3경쟁자 정책이 약하거나 최적일 수 없는 경우 실질적인 톰슨 샘플링의 성능은 어떠한가?
  • RQ4이산 사전 하에서 빈도주의 리그레트로의 확장이 가능한가?
  • RQ5다양한 경쟁자 매핑 하에서 톰슨 샘플링에서 진짜 파라미터에 대한 사후 무게는 시간이 지남에 따라 어떻게 변화하는가?

주요 결과

  • 논문은 임의의 결정적 정책 매핑을 경쟁자로 삼을 수 있는 에피소드적 불안정 밴드잇에서 톰슨 샘플링에 대해 $ ilde{ackepsilon}(ackepsilonackepsilonackepsilonackepsilon)$ 의 베이지안 리그레트 한계를 확립한다.
  • 실험 결과는 베이지안 리그레트가 선형 이하로 증가하며, $ackepsilon$-$ackepsilonackepsilon$ 기울기가 $1/2$ 미만임을 보여주어 이론적 한계를 지지한다.
  • K=4, N=2이며 전이 확률이 대칭인 시뮬레이션에서, 톰슨 샘플링의 가치 함수는 윌블 인덱스 정책의 벤치마크 가치인 55.6에 수렴한다.
  • 진짜 파라미터에 대한 사후 무게는 에피소드가 진행됨에 따라 단조적으로 증가하며, 효과적인 학습과 파라미터 집중을 확인한다.
  • 경쟁자 정책이 최적의 고정 암호 정책일지라도 리그레트는 선형 이하로 유지되며, 이는 일반적인 불안정 밴드잇 설정에서 이 정책이 최적일 수 없음을 고려할 때 중요하다.
  • 사전이 이산 지지 집합을 가지는 경우 빈도주의 리그레트로 이론적 결과를 확장할 수 있으며, 실험적 지원이 제공된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.