Skip to main content
QUICK REVIEW

[논문 리뷰] Thompson Sampling in Non-Episodic Restless Bandits

Young Hun Jung, Marc Abeille|arXiv (Cornell University)|2019. 10. 12.
Advanced Bandit Algorithms Research참고 문헌 22인용 수 4
한 줄 요약

이 논문은 시간에 따라 변화하는 보상 분포를 가진 비에피소딕 불안정한 다수의 손잡이 밴드잇 문제를 위한 동적 에피소드를 갖는 톰슨 샘플링(TSDE)의 변종을 제안한다. 정책 매핑을 사용하여 TSDE를 불안정한 밴드잇 프레임워크에 적응시킴으로써, 저자들은 $\mathcal{O}(\sqrt{T}\log T)$의 베이지안 리그레트 경계를 확립하였으며, 이는 무한 수평 설정에서의 비선형 리그레트에 대한 열린 문제를 해결한다.

ABSTRACT

Restless bandit problems assume time-varying reward distributions of the arms, which adds flexibility to the model but makes the analysis more challenging. We study learning algorithms over the unknown reward distributions and prove a sub-linear, $O(\sqrt{T}\log T)$, regret bound for a variant of Thompson sampling. Our analysis applies in the infinite time horizon setting, resolving the open question raised by Jung and Tewari (2019) whose analysis is limited to the episodic case. We adopt their policy mapping framework, which allows our algorithm to be efficient and simultaneously keeps the regret meaningful. Our algorithm adapts the TSDE algorithm of Ouyang et al. (2017) in a non-trivial manner to account for the special structure of restless bandits. We test our algorithm on a simulated dynamic channel access problem with several policy mappings, and the empirical regrets agree with the theoretical bound regardless of the choice of the policy mapping.

연구 동기 및 목표

  • 시스템이 주기적으로 리셋되지 않는 비에피소딕 불안정한 밴드잇에서 비선형 리그레트를 달성하는 열린 문제를 해결한다.
  • 정규화된 정책 매핑 $\mu$를 통해 의미 있는 정책과의 경쟁을 가능하게 하는 효율적인 학습 알고리즘을 개발한다.
  • 시간에 따라 변화하는 보상 분포를 처리할 수 있도록 TSDE 알고리즘을 완전히 관측 가능한 마르코프 결정 과정(MDP)에 확장한다.
  • MDP의 벨만 방정식과 혼합 시간에 대한 일반적인 조건 하에서 이론적 리그레트 경계가 유지됨을 보장한다.
  • 다양한 정책 매핑, 특히 윌러 인덱스와 최면 정책을 포함하여 실험적으로 강건한 성능을 보여준다.

제안 방법

  • 시간에 따라 변화하는 손잡이 보상이 존재하는 비에피소딕 불안정한 밴드잇 설정에 톰슨 샘플링과 동적 에피소드(TSDE) 알고리즘을 적응시킨다.
  • 알 수 없는 시스템 파라미터 $\theta^\star$ 를 정적 정책 $\pi^\star = \mu(\theta^\star)$로 매핑하는 정책 매핑 $\mu$ 를 사용하여 의미 있는 기준과의 비교를 가능하게 한다.
  • 각 에피소드에 대해 두 가지 종료 조건을 도입한다: 하나는 결정론적이며, 다른 하나는 무작위이다. 이는 주기적 리셋 없이도 에피소드 전환을 보장한다.
  • 각 에피소드의 시작 시점에서 사후 분포에서 시스템 파라미터 $\theta$ 를 샘플링하고, 해당 에피소드 기간 동안 정책 $\pi = \mu(\theta)$ 를 실행한다.
  • 정확한 계산 효율성을 유지하면서도 의미 있는 리그레트 비교를 보장하기 위해 Jung 및 Tewari(2019)의 정책 매핑 프레임워크를 활용한다.
  • 정책 불일치와 파라미터 추정 오차와 관련된 성분으로 리그레트를 분해함으로써 이론적 리그레트 경계를 확립한다. 이 과정에서 농도 부등식과 혼합 시간 분석을 사용한다.

실험 결과

연구 질문

  • RQ1시스템이 주기적으로 리셋되지 않는 비에피소딕 불안정한 밴드잇 설정에서 톰슨 샘플링이 비선형 리그레트를 달성할 수 있는가?
  • RQ2시간에 따라 변화하는 환경에서 정책 매핑 $\mu(\theta^\star)$ 와의 경쟁을 할 때 TSDE 알고리즘이 의미 있는 리그레트 경계를 유지하는가?
  • RQ3정책 매핑의 선택(예: 윌러 인덱스, 최면 정책, 고정된 손잡이)이 알고리즘의 실험적 성능에 어떤 영향을 미치는가?
  • RQ4이론적으로 예측된 $\mathcal{O}(\sqrt{T}\log T)$의 베이지안 리그레트 경계가 다양한 정책 매핑과 시스템 파라미터에서 실험적으로 검증될 수 있는가?
  • RQ5후행 분포의 집중도를 통해, 알고리즘이 진정된 시스템 파라미터 $\theta^\star$ 를 효과적으로 학습하는가?

주요 결과

  • 제안된 TSDE 알고리즘의 베이지안 리그레트는 $\mathcal{O}(\sqrt{T}\log T)$로 경계가 되었으며, 비에피소딕 불안정한 밴드잇에서의 비선형 리그레트에 대한 열린 문제를 해결하였다.
  • 실험 결과, 모든 테스트된 정책 매핑—최고의 고정 손잡이, 최면 정책, 윌러 인덱스—에 대해 비선형 베이지안 리그레트가 관찰되어 이론적 경계를 확인하였다.
  • 리그레트 대 시간의 로그-로그 플롯에서 기울기가 약 0.5로 나타나, 이론적으로 예측된 $\tilde{\mathcal{O}}(\sqrt{T})$ 스케일링을 확인하였다.
  • 빈도주의 설정에서 TSDE의 시간 평균 누적 보상은 $J_{\pi^\star}(\theta^\star)$ 기준값에 수렴함을 보여, 효과적인 학습이 이루어졌음을 시사한다.
  • 윌러 인덱스 정책 하에서 진정된 파라미터에 대한 사후 가중치가 모든 손잡이에서 일관되게 1로 증가함을 통해, $\theta^\star$ 를 일관적으로 학습하고 있음을 입증하였다.
  • 다양한 정책 매핑에 관계없이 알고리즘이 효율적이고 강건하며, 성능 저하 없이 다양한 경쟁자와의 비교에서 우수한 성능을 유지하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.