Skip to main content
QUICK REVIEW

[논문 리뷰] Approximations of the Restless Bandit Problem

Steffen Grünewälder, Azadeh Khaleghi|arXiv (Cornell University)|2017. 02. 22.
Advanced Bandit Algorithms Research참고 문헌 11인용 수 8
한 줄 요약

이 논문은 $φ$-혼합 보상 의존성 하에서의 불안정한 밴디트 문제에 대해 처리 가능한 근사법을 제안하며, 수정된 UCB 알고리즘이 최고의 정적 평균에 대해 로그 수준의 손실을 달성함을 보여준다. 핵심 기여는 혼합 계수의 합에 의존하는 손실 한계를 제시한 것으로, 의존성이 사라질 경우 독립적이고 동일하게 분포된(i.i.d.) 경우로 복원됨을 보여준다.

ABSTRACT

The multi-armed restless bandit problem is studied in the case where the pay-off distributions are stationary $φ$-mixing. This version of the problem provides a more realistic model for most real-world applications, but cannot be optimally solved in practice, since it is known to be PSPACE-hard. The objective of this paper is to characterize a sub-class of the problem where {\em good} approximate solutions can be found using tractable approaches. Specifically, it is shown that under some conditions on the $φ$-mixing coefficients, a modified version of UCB can prove effective. The main challenge is that, unlike in the i.i.d. setting, the distributions of the sampled pay-offs may not have the same characteristics as those of the original bandit arms. In particular, the $φ$-mixing property does not necessarily carry over. This is overcome by carefully controlling the effect of a sampling policy on the pay-off distributions. Some of the proof techniques developed in this paper can be more generally used in the context of online sampling under dependence. Proposed algorithms are accompanied with corresponding regret analysis.

연구 동기 및 목표

  • 의존적이고 i.i.d.이 아닌 보상 하에서 불안정한 밴디트 문제의 계산 비가용성에 대응하기 위해.
  • 처리 가능한 근사 알고리즘을 설계할 수 있는 불안정한 밴디트 문제의 하위 클래스를 규명하기 위해.
  • φ-혼합 의존성이 손실과 최적 정책 성능에 미치는 영향을 분석하기 위해.
  • 약한 의존성 있는 보상 하에서 효과적인 UCB 유형 알고리즘을 개발하고, 그 손실 한계를 확립하기 위해.
  • 혼합 계수와 정적 평균을 기준으로 근사 품질에 대한 이론적 보장을 제공하기 위해.

제안 방법

  • 장기적인 시간적 및 크로스 암 의존성을 모델링하기 위해 보상 시계열이 정적 $φ$-혼합임을 가정한다.
  • 샘플링 정책이 의존적 보상 분포에 미치는 영향을 고려한 수정된 UCB 알고리즘을 도입한다.
  • $φ$-혼합 과정에 맞춘 농도 부등식을 사용하여 제안된 알고리즘의 손실을 제한한다.
  • 정적 평균과 의존성 구조를 포함하는 성분으로 기대 손실을 분해하여 손실 한계를 수립한다.
  • 분포 특성에 대한 샘플링의 영향을 제어하기 위해 공분산 함수의 허들러 연속성 가정을 적용한다.
  • 조건부 독립적 추론과 밀도 제한 기법을 활용하여, 열 劣한 암 선택에 기인한 손실 기여도의 상한을 유도한다.

실험 결과

연구 질문

  • RQ1φ-혼합 계수에 어떤 조건이 성립할 경우, 불안정한 밴디트 문제에서 최적의 스위칭 전략이 가장 높은 정적 평균을 가진 암을 선택하는 것으로 근사될 수 있는가?
  • RQ2어떻게 의존적 보상 과정에 대해 낙관적 탐색 전략을 적응시켜 비선형 손실을 달성할 수 있는가?
  • RQ3보상 과정 내 시간적 및 크로스 암 의존성의 강도에 따라 손실 한계가 어떻게 달라지는가?
  • RQ4φ-혼합 프레임워크를 사용하여 i.i.d. 보상 이외의 UCB 스타일 알고리즘을 일반화할 수 있는가?
  • RQ5보상 과정의 의존성 정도에 따라, 정적 평균 기반의 완화된 문제의 근사 오차는 어떻게 척도화되는가?

주요 결과

  • 가장 높은 정적 평균을 가진 암을 선택하는 근사 오차는 유한하며, $φ_1$이 감소할수록 의존성이 약해지면서 점점 줄어든다.
  • 수정된 UCB 알고리즘이 $φ$-혼합 가정 하에서 가장 높은 정적 평균에 대해 로그 수준의 손실을 달성한다.
  • 손실 한계는 $φ$-혼합 계수의 합인 $\sum_i \varphi_i$ 에 비례하며, 의존성이 사라지는 i.i.d. 경우에 아우어 등(2002)의 고전적 로그 수준 손실 한계로 복원된다.
  • 개발된 증명 기법은 특히 조건부 독립성과 밀도 제한을 통해 의존적 과정 하에서의 온라인 샘플링에 일반화 가능하다.
  • 분석 결과, 샘플링 정책이 유도하는 의존성은 샘플된 보상의 결합 분포를 신중히 다룸으로써 제어할 수 있음을 보여준다.
  • 허들러 연속성 공분산 함수의 경우, 손실 한계는 더욱 정밀화되며, 지수 $\alpha$와 계수 $c$ 에 따라 달라진다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.