Skip to main content
QUICK REVIEW

[논문 리뷰] Thompson Sampling for Combinatorial Semi-bandits with Sleeping Arms and Long-Term Fairness Constraints

Zhiming Huang, Yifan Xu|arXiv (Cornell University)|2020. 05. 14.
Advanced Bandit Algorithms Research참고 문헌 10인용 수 5
한 줄 요약

이 논문은 수면하는 암을 가진 조합적 반반밴딧과 장기적 공정성 제약 조건을 고려한 톰슨 샘플링 기반 알고리즘인 TSCSF-B를 제안한다. 베타 사전분포와 가상 큐 기법을 결합하여 보상 극대화와 공정성의 균형을 이루며, 문제에 독립적인 리그레트 한계 $\widetilde{O}\left(\frac{\sqrt{mNT}}{T}\right)$ 를 달성한다. 이는 이론적 하한과 일치하며, 기존의 UCB 기반 방법보다 실용적으로 뛰어난 성능을 보인다.

ABSTRACT

We study the combinatorial sleeping multi-armed semi-bandit problem with long-term fairness constraints~(CSMAB-F). To address the problem, we adopt Thompson Sampling~(TS) to maximize the total rewards and use virtual queue techniques to handle the fairness constraints, and design an algorithm called \emph{TS with beta priors and Bernoulli likelihoods for CSMAB-F~(TSCSF-B)}. Further, we prove TSCSF-B can satisfy the fairness constraints, and the time-averaged regret is upper bounded by $\frac{N}{2η} + O\left(\frac{\sqrt{mNT\ln T}}{T} ight)$, where $N$ is the total number of arms, $m$ is the maximum number of arms that can be pulled simultaneously in each round~(the cardinality constraint) and $η$ is the parameter trading off fairness for rewards. By relaxing the fairness constraints (i.e., let $η ightarrow \infty$), the bound boils down to the first problem-independent bound of TS algorithms for combinatorial sleeping multi-armed semi-bandit problems. Finally, we perform numerical experiments and use a high-rating movie recommendation application to show the effectiveness and efficiency of the proposed algorithm.

연구 동기 및 목표

  • 수면하는 암이 존재하고 공정성이 최소 추출 횟수를 요구하는 조합적 수면 다이아몬드 밴딧 문제(CSMAB-F)를 다루는 것.
  • 누적 보상을 극대화하면서도 공정성 제약 조건을 증명 가능하게 만족하는 톰슨 샘플링 기반 알고리즘을 개발하는 것.
  • 이 설정에서 톰슨 샘플링의 문제에 독립적인 리그레트 한계를 유도하고, 이론적 하한과 일치시키는 것.
  • 수치 실험과 실생활 영화 추천 응용을 통해 알고리즘의 효과성을 검증하는 것.
  • TS 기반 방법이 UCB 기반 대비 더 날카운 리그레트 한계를 달성하면서도 강력한 실용적 성능을 유지할 수 있음을 보여주는 것.

제안 방법

  • 암 보상의 사후분포에서 샘플링하기 위해 베타 사전분포와 베르누이 우도를 사용한 톰슨 샘플링을 채택한다.
  • 장기적 공정성 제약 조건을 이행하기 위해 가상 큐 기법을 통합하며, 큐의 진화를 수정하여 반올림 오차를 감소시킨다.
  • 공정성과 보상 간의 트레이드오���을 위해 파라미터 $\eta$ 를 사용하며, $\eta \to \infty$ 일 때 공정성 제약이 완화되어 순수한 CSMAB 설정이 된다.
  • 각 라운드에 선택 가능한 암의 수가 $m$ 으로 제한된 조건부 최적화 문제로 암 선택을 공식화한다.
  • 보상 관찰의 잠재적 지연을 처리하기 위해 지연 피드백 프레임워크를 적용하며, 리그레트에 추가 페널티를 부과한다.
  • 영화 추천 실험에서 다섯 장르에 대해 $\mathbf{k} = [0.3, 0.3, 0.3, 0.3, 0.3]$ 로 설정하여 공정성 제약 조건의 타당성을 확보한다.

실험 결과

연구 질문

  • RQ1톰슨 샘플링는 수면하는 암과 장기적 공정성 제약 조건이 있는 조합적 반반밴딧에 효과적으로 적응될 수 있는가?
  • RQ2CSMAB-F에 대한 톰슨 샘플링 기반 알고리즘의 이론적 리그레트 한계는 무엇이며, UCB 기반 방법과 비교해 볼 때 어떻게 되는가?
  • RQ3제안된 알고리즘이 LFG와 같은 기존의 공정성 인식 밴딧 알고리즘보다 더 뛰어난 경험적 성능을 달성하는가?
  • RQ4공정성 파라미터 $\eta$ 는 보상 극대화와 제약 조건 이행 간의 트레이드오프에 어떻게 영향을 미치는가?
  • RQ5리그레트 한계를 문제에 독립적으로 만들고, CSMAB 문제에 알려진 하한과 일치시킬 수 있는가?

주요 결과

  • 제안된 TSCSF-B 알고리즘은 시간 평균 리그레트 상한 $\frac{N}{2\eta} + O\left(\frac{\sqrt{mNT\ln T}}{T}\right)$ 을 달성하며, 이는 문제에 독립적이며 $\eta \to \infty$ 일 때 이론적 하한과 일치한다.
  • 리그레트 한계의 계수는 UCB 기반 LFG 알고리즘보다 낮아, 톰슨 샘플링의 더 날카운 이론적 성능 보장을 시사한다.
  • MovieLens 20M 데이터셋에 대한 수치 실험에서, TSCSF-B는 LFG보다 진짜 평균에 더 가까운 최종 평점을 기록하여 보상 추정의 더 높은 정확도를 보였다.
  • 영화 추천 응용에서 TSCSF-B는 LFG보다 더 빠르게 수렴했으며, 이는 낮은 시간 평균 리그레트로 나타났다.
  • TSCSF-B와 LFG 모두 $\eta = \sqrt{\frac{NT}{m\ln T}}$ 에서 공정성 제약 조건을 만족했지만, TSCSF-B는 더 높은 보상 효율성을 유지했다.
  • 공정성 제약 조건이 완화될 경우($\eta \to \infty$), 리그레트 한계는 조합적 수면 밴딧에서 톰슨 샘플링의 첫 번째 문제에 독립적인 한계로 줄어들며, Bubeck 등(2012)의 하한과 일치한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.