Skip to main content
QUICK REVIEW

[논문 리뷰] Analysis of Thompson Sampling for Combinatorial Multi-armed Bandit with Probabilistically Triggered Arms

Alihan Hüyük, Cem Tekin|arXiv (Cornell University)|2018. 09. 07.
Advanced Bandit Algorithms Research인용 수 8
한 줄 요약

이 논문은 반응 확률이 있는 기저 암부를 가진 조합적 다중 손실 밴드잇(Combinatorial Multi-Armed Bandits, CMAB-PTA)에 대해 조합적 톰슨 샘플링(CTS)을 분석한다. Lipschitz 연속성 조건 하에서 예상 보상 함수가 만족할 때, $O\left(\sum_{i=1}^{m}\frac{\log T}{p_i\Delta_i}\right)$의 순서 최적(regret) 경계를 확립한다. 여기서 $p_i$는 비영인 최소 촉발 확률이고, $\Delta_i$는 기저 암부 $i$의 부적합성 갭이다.

ABSTRACT

We analyze the regret of combinatorial Thompson sampling (CTS) for the combinatorial multi-armed bandit with probabilistically triggered arms under the semi-bandit feedback setting. We assume that the learner has access to an exact optimization oracle but does not know the expected base arm outcomes beforehand. When the expected reward function is Lipschitz continuous in the expected base arm outcomes, we derive $O(\\sum_{i =1}^m \\log T / (p_i \\Delta_i))$ regret bound for CTS, where $m$ denotes the number of base arms, $p_i$ denotes the minimum non-zero triggering probability of base arm $i$ and $\\Delta_i$ denotes the minimum suboptimality gap of base arm $i$. We also compare CTS with combinatorial upper confidence bound (CUCB) via numerical experiments on a cascading bandit problem.

연구 동기 및 목표

  • 조합적 다중 손실 밴드잇에서 반응 확률이 있는 기저 암부를 가진 조합적 톰슨 샘플링(CTS)의 성능을 분석하는 것.
  • 기저 암부 결과에 대한 예상 보상 함수가 Lipschitz 연속일 때, CTS에 대한 성능 경계를 수립하는 것. 단, 단조성 조건을 가정하지 않는다.
  • 수치 실험을 통해 CTS와 조합적 UCB(CUCB) 간의 성능 경계를 비교하는 것.
  • 기존의 CMAB-PTA에 대한 알려진 성능 하한과 비교하여 유도된 성능 경계가 날카로운지 입증하는 것.
  • 이 설정에서 하향선형 성능을 달성하기 위해 정확한 최적화 오라클이 필요한지 조사하는 것.

제안 방법

  • 초기 선택된 슈퍼 암부가 기저 암부를 확률적으로 촉발하고, 관측은 오직 촉발된 암부들에 한해 이루어지는 CMAB-PTA 문제를 모델링한다.
  • 학습자가 기저 암부 결과의 기대값이 주어졌을 때 최적의 슈퍼 암부를 반환하는 정확한 최적화 오라클에 접근 가능하다고 가정한다.
  • 예상 보상 함수가 기저 암부 결과의 벡터에 대해 Lipschitz 연속이라고 가정한다.
  • CTS는 기저 암부 결과에 대한 사후 분포에서 샘플링하고, 샘플된 결과 하에서 예상 보상을 최대화하는 슈퍼 암부를 선택함으로써 적용된다.
  • 집중 불등식을 사용하고 사후 샘플링을 통한 비최적 슈퍼 암부 선택 확률을 유계화함으로써 성능 분석을 수행한다.
  • 각 기저 암부 $i$의 촉발 확률 $p_i$를 고려하여, 관측 빈도와 학습 속도에 영향을 미친다.

실험 결과

연구 질문

  • RQ1조합적 다중 손실 밴드잇에서 반응 확률이 있는 기저 암부를 가진 조합적 톰슨 샘플링(CTS)의 성능은 어떠한가?
  • RQ2예상 보상 함수가 Lipschitz 연속일 경우, CTS가 순서 최적의 성능 경계를 달성할 수 있는가?
  • RQ3각 기저 암부의 최소 촉발 확률 $p_i$는 CTS의 성능 경계에 어떤 영향을 미치는가?
  • RQ4다양한 촉발 동역학을 가진 연쇄적 밴드잇 문제에서 CTS와 CUCB 간의 성능 경계는 어떻게 비교되는가?
  • RQ5일반적인 CMAB-PTA 설정에서 성능 경계에 $1/p_i$ 의존성이 피할 수 없는가?

주요 결과

  • 논문은 CTS에 대해 $O\left(\sum_{i=1}^{m}\frac{1}{p_i\Delta_i}\log T\right)$ 의 성능 경계를 도출하였으며, 이는 순서 최적이며 CMAB-PTA에 대해 알려진 성능 하한과 정확히 일치한다.
  • 성능 경계는 $1/p_i$ 에 의존하며, 여기서 $p_i$ 는 기저 암부 $i$ 의 비영인 최소 촉발 확률이다. 이는 희귀한 촉발 사건이 학습 속도를 저하시킨다는 것을 시사한다.
  • 논리적 분리 연쇄 밴드잇 문제에 대한 수치 실험 결과, CTS는 더 효율적인 탐색 덕분에 CUCB를 크게 능가한다.
  • 많은 양호한 암부들 중 하나의 나쁜 암부가 있는 연쇄적 밴드잇 설정에서는, CUCB가 초기에는 높은 UCB 지수 덕분에 CTS를 앞서지만, 사후 샘플링의 정확도가 향상되면서 CTS가 결국 CUCB를 앞서게 된다.
  • 기존 연구에서 제시된 하한과 일치함으로써, 성능 경계의 $1/p_i$ 항은 일반적인 CMAB-PTA 설정에서 피할 수 없다는 게 입증된다.
  • CTS는 정확한 최적화 오라클에 접근할 때에만 하향선형 성능을 달성하며, 근사 오라클을 사용할 경우 성능이 무한대로 증가한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.