Skip to main content
QUICK REVIEW

[논문 리뷰] Top-k Combinatorial Bandits with Full-Bandit Feedback

Idan Rejwan, Yishay Mansour|arXiv (Cornell University)|2019. 05. 28.
Advanced Bandit Algorithms Research참고 문헌 34인용 수 10
한 줄 요약

이 논문은 전체 밴딧 피드백 상황에서, 선택된 암호의 보상 합만 관측 가능한 상황에서 상위-k 조합 밴딧 문제를 위한 조합적 연속 수용 및 기각(Combinatorial Successive Accepts and Rejects, CSAR) 알고리즘을 제안한다. 새로운 샘플링 기반 기반으로 허미트 행렬을 사용하여 개별 암호 보상을 효율적으로 추정하며, $O(n/\Delta^2 \log(n/\delta))$의 최적 샘플 복잡도와 날카로운 리그레트 경계를 달성한다. 실험적 검증을 통해 기존 기준 대비 뛰어난 성능을 보였다.

ABSTRACT

Top-k Combinatorial Bandits generalize multi-armed bandits, where at each round any subset of $k$ out of $n$ arms may be chosen and the sum of the rewards is gained. We address the full-bandit feedback, in which the agent observes only the sum of rewards, in contrast to the semi-bandit feedback, in which the agent observes also the individual arms' rewards. We present the Combinatorial Successive Accepts and Rejects (CSAR) algorithm, which generalizes SAR (Bubeck et al, 2013) for top-k combinatorial bandits. Our main contribution is an efficient sampling scheme that uses Hadamard matrices in order to estimate accurately the individual arms' expected rewards. We discuss two variants of the algorithm, the first minimizes the sample complexity and the second minimizes the regret. We also prove a lower bound on sample complexity, which is tight for $k=O(1)$. Finally, we run experiments and show that our algorithm outperforms other methods.

연구 동기 및 목표

  • 전체 밴딧 피드백 상황에서 보상 합만 관측 가능한 상황에서 n개의 암호 중 최적의 k개 암호 조합을 식별하는 문제에 대응하기 위해.
  • 제한된 피드백 하에서 탐색과 이용을 균형 있게 조절하는 효율적인 알고리즘을 설계하여 샘플 복잡도와 리그레트를 최소화하기 위해.
  • 기존의 연속 수용 및 기각(Successive Accepts and Rejects, SAR) 알고리즘을 전체 밴딧 피드백 상황에서의 조합 밴딧 설정으로 일반화하기 위해.
  • 샘플 복잡도와 리그레트에 대한 이론적 경계를 증명하여 이 문제 설정에 대해 최초의 하한선을 설정하기 위해.

제안 방법

  • 전체 밴딧 피드백 상황에서 상위-k 조합 밴딧 문제에 적용 가능한 SAR 알고리즘의 일반화로 CSAR 알고리즘을 제안한다.
  • 개별 암호 보상을 최소한의 샘플로 집합 피드백에서 추정할 수 있도록 하는 새로운 샘플링 기반 기반 기반으로 허미트 행렬을 사용한다.
  • 신뢰 구간을 기반으로 암호 값을 점진적으로 정밀하게 추정하고, 수용 또는 기각하는 순차적 정밀화 과정을 사용한다.
  • 허미트 행렬을 기반으로 한 선형 대수학적 구성 기반으로, 개별 암호 보상을 편향 없이 추정할 수 있는 샘플링 패턴을 생성한다.
  • 샘플 복잡도와 리그레트에 대한 이론적 경계를 유도하며, $k=O(1)$일 경우 경계의 날카로움을 입증한다.
  • 문제 인스턴스 간의 KL 발산을 기반으로 한 하한선 증명을 통해 $\Omega(n/\epsilon^2)$의 샘플 수에 대한 기본적인 한계를 설정한다.

실험 결과

연구 질문

  • RQ1전체 밴딧 피드백 상황에서 보상 합만 관측 가능한 상황에서 상위-k 조합 밴딧 문제에 대해 효율적인 알고리즘을 설계할 수 있는가?
  • RQ2크기가 k인 부분집합으로부터의 집합 보상만 관측 가능한 상황에서 개별 암호 보상을 정확하게 추정할 수 있는가?
  • RQ3전체 밴딧 피드백 상황에서 최적의 k개 암호 조합을 식별하기 위한 기본 샘플 복잡도 하한선은 무엇인가?
  • RQ4제안된 알고리즘이 기존 방법에 비해 샘플 복잡도와 리그레트 측면에서 어떻게 비교되는가?
  • RQ5허미트 기반 샘플링 기반은 이 설정에서 최적의 추정 효율성을 달성할 수 있는가?

주요 결과

  • CSAR 알고리즘은 $O(n/\Delta^2 \log(n/\delta))$의 샘플 복잡도를 달성하며, $k=O(1)$일 경우 경계가 날카롭고, 로그 인자 외에는 하한선과 일치한다.
  • CSAR의 리그레트는 $O(nk/\Delta \log T)$로, 로그 인자 외에는 최적이며 이전 방법보다 현저히 뛰어나다.
  • 전체 밴딧 상위-k 조합 밴딧 문제에 대해 최초의 이론적 하한선인 $\Omega(n/\epsilon^2)$의 샘플 수를 확립하였으며, 이는 샘플 복잡도가 이 순서를 초과하여 향상될 수 없음을 보여준다.
  • 실험 결과, 허미트 기반 샘플링 기반은 추정 정확도와 샘플 효율성 측면에서 랜덤 및 LOO 샘플링보다 뚜렷이 뛰어나다.
  • 리그레트 최소화 측면에서, CSAR는 Agarwal과 Aggarwal(2018)의 Sort & Merge 알고리즘보다 상당히 낮은 누적 리그레트를 달성하며, 특히 장기적인 시간 허브에서 뚜렷한 성능 향상을 보였다.
  • 알고리즘은 다항식 시간 내에 계산 가능하며, 집합 보상만 관측 가능한 상황에서도 개별 암호 보상을 효율적으로 추정할 수 있어 실세계 응용에 실용적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.