Skip to main content
QUICK REVIEW

[논문 리뷰] PAC Battling Bandits in the Plackett-Luce Model

Aadirupa Saha, Aditya Gopalan|arXiv (Cornell University)|2018. 08. 12.
Advanced Bandit Algorithms Research인용 수 9
한 줄 요약

이 논문은 플래켓-라우스 모델 하에서, 학습자가 $k$개의 암을 선택하고 승자 또는 상위-$m$ 순위 피드백을 관찰하는 PAC 전투 밴딧 프레임워크를 제안한다. 승자 피드백의 경우 샘플 복잡도는 $k$에 독립적으로 $O(n/ε^2 \ln(1/\delta))$ 유지되며, 상위-$m$ 순위 피드백의 경우 이는 $\Omega(n/(m\epsilon^2)\ln(1/\delta))$로 감소하여 통계적 효율성에서 $m$ 배의 향상이 이루어진다.

ABSTRACT

We introduce the probably approximately correct (PAC) \emph{Battling-Bandit} problem with the Plackett-Luce (PL) subset choice model--an online learning framework where at each trial the learner chooses a subset of $k$ arms from a fixed set of $n$ arms, and subsequently observes a stochastic feedback indicating preference information of the items in the chosen subset, e.g., the most preferred item or ranking of the top $m$ most preferred items etc. The objective is to identify a near-best item in the underlying PL model with high confidence. This generalizes the well-studied PAC \emph{Dueling-Bandit} problem over $n$ arms, which aims to recover the \emph{best-arm} from pairwise preference information, and is known to require $O(\frac{n}{ε^2} \ln \frac{1}δ)$ sample complexity \citep{Busa_pl,Busa_top}. We study the sample complexity of this problem under various feedback models: (1) Winner of the subset (WI), and (2) Ranking of top-$m$ items (TR) for $2\le m \le k$. We show, surprisingly, that with winner information (WI) feedback over subsets of size $2 \leq k \leq n$, the best achievable sample complexity is still $O\left( \frac{n}{ε^2} \ln \frac{1}δ ight)$, independent of $k$, and the same as that in the Dueling Bandit setting ($k=2$). For the more general top-$m$ ranking (TR) feedback model, we show a significantly smaller lower bound on sample complexity of $Ω\bigg( \frac{n}{mε^2} \ln \frac{1}δ\bigg)$, which suggests a multiplicative reduction by a factor ${m}$ owing to the additional information revealed from preferences among $m$ items instead of just $1$. We also propose two algorithms for the PAC problem with the TR feedback model with optimal (upto logarithmic factors) sample complexity guarantees, establishing the increase in statistical efficiency from exploiting rank-ordered feedback.

연구 동기 및 목표

  • 플래켓-라우스 선택 모델을 갖는 전투 밴딧 설정에서 PAC 학습 목표를 정식화하여, 고정 확률로 $\epsilon$-근사 최적의 암을 식별하고자 한다.
  • 부분집합 크기 $k$와 피드백 구조(승자 대비 상위-$m$ 순위)가 부분집합 기반 선호도 피드백에서 샘플 복잡도에 미치는 영향을 분석하고자 한다.
  • 상위-$m$ 순위 피드백 모델에 대해 정보 이론적 하한을 확립하고 최적 알고리즘을 설계하고자 한다.
  • 순서가 매겨진 피드백이 승자 피드백에 비해 통계적 효율성이 크게 향상됨을 보여주고자 한다.

제안 방법

  • 플래켓-라우스 선호도를 갖는 PAC 전투 밴딧 문제를 제안하며, 학습자는 크기가 $k$인 부분집합을 선택하고 확률적 선호도 피드백을 관찰한다.
  • 승자 피드백에 대해 정보 이론적 하한 $\Omega(n/\epsilon^2 \ln(1/\delta))$를 유도하여, 더 큰 $k$로의 개선이 없음을 보여준다.
  • 상위-$m$ 순위(정렬) 피드백(TR) 모델을 도입하며, 학습자는 부분집합 내에서 가장 선호도가 높은 $m$개 항목의 순서가 매겨진 선호도를 관찰한다.
  • 하한에 대해 로그 인자 외에는 일치하는 샘플 복잡도를 갖는 TR 피드백 모델을 위한 두 알고리즘을 설계한다.
  • 중위수 제거와 신뢰구간 추정 기법을 사용하여, 추정된 플래켓-라우스 파라미터를 바탕으로 점진적으로 열악한 암을 제거한다.
  • 집중 부등식과 사건 분해 기법을 활용하여 실패 확률을 제어하고, 최종 결과에 대해 $1-\delta$ 신뢰도를 확보한다.

실험 결과

연구 질문

  • RQ1승자 피드백을 갖는 PAC 전투 밴딧 문제에서 더 큰 부분집합($k > 2$)을 선택하면 샘플 복잡도가 향상되는가?
  • RQ2상위-$m$ 순위 피드백($2 \leq m \leq k$)은 승자 피드백에 비해 샘플 복잡도를 어떻게 감소시키는가?
  • RQ3상위 $m$개 항목의 순위 정보 추가로 인해 샘플 복잡도에 다중성 향상이 이루어지는가?
  • RQ4플래켓-라우스 모델 하에서 부분집합 피드백을 갖는 조건에서 $\epsilon$-최적 암을 식별하는 데 최적의 샘플 복잡도는 무엇인가?
  • RQ5정보 이론적 하한을 충족하는 알고리즘을 TR 피드백 모델에 대해 설계할 수 있는가?

주요 결과

  • 승자 피드백(WI)의 경우 샘플 복잡도는 $\Omega(n/\epsilon^2 \ln(1/\delta))$이며, 이는 듀얼링 밴딧 설정과 일치하며 부분집합 크기 $k$에 독립적이다.
  • 상위-$m$ 순위 피드백(TR)의 경우 샘플 복잡도 하한은 $\Omega(n/(m\epsilon^2) \ln(1/\delta))$이며, 이는 $m$ 배의 다중성 향상을 보여준다.
  • 제안된 알고리즘은 하한에 대해 로그 인자 외에는 일치하는 샘플 복잡도를 달성하여, TR 피드백 모델의 순서 최적성(오더 오пт리멀리티)을 입증한다.
  • 중위수 제거 기반 알고리즘은 $k$가 변동 가능할 경우에도 $O(n/\epsilon^2 \ln(1/\delta))$ 샘플 복잡도를 달성하여 이전의 PAC-듀얼링 밴딧 경계를 향상시킨다.
  • 분석 결과, 피드백의 풍부성 증가(1개에서 $m$개 순위 항목으로)가 학습 효율성에 크게 기여하며, 필요한 샘플 수가 명백히 $m$ 배 감소함을 보여준다.
  • 반복적 제거 단계에서의 유의미한 유니온 바운드와 신뢰구간 제어를 통해 실패 확률은 $\delta$ 이하로 제한된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.