Skip to main content
QUICK REVIEW

[논문 리뷰] Polynomial-time Algorithms for Combinatorial Pure Exploration with Full-bandit Feedback

Yuko Kuroki, Liyuan Xu|arXiv (Cornell University)|2019. 01. 01.
Advanced Bandit Algorithms Research참고 문헌 20인용 수 3
한 줄 요약

이 논문은 보상의 합만 관측 가능한 전체 밴드이트 피드백 하에서 확률적 조합 순수 탐색을 위한 다항시간 알고리즘을 제안한다. 0-1 이차 최대화 문제를 위한 새로운 근사 알고리즘을 도입하고, 이론적 보장을 갖춘 증명 가능한 효율적인 표본 복잡도를 달성함으로써 조합 밴드이트 환경에서 확장 가능한 상위-k 선택을 가능하게 한다.

ABSTRACT

We study the problem of stochastic combinatorial pure exploration (CPE), where an agent sequentially pulls a set of single arms (a.k.a. a super arm) and tries to find the best super arm. Among a variety of problem settings of the CPE, we focus on the full-bandit setting, where we cannot observe the reward of each single arm, but only the sum of the rewards. Although we can regard the CPE with full-bandit feedback as a special case of pure exploration in linear bandits, an approach based on linear bandits is not computationally feasible since the number of super arms may be exponential. In this paper, we first propose a polynomial-time bandit algorithm for the CPE under general combinatorial constraints and provide an upper bound of the sample complexity. Second, we design an approximation algorithm for the 0-1 quadratic maximization problem, which arises in many bandit algorithms with confidence ellipsoids. Based on our approximation algorithm, we propose novel bandit algorithms for the top-k selection problem, and prove that our algorithms run in polynomial time. Finally, we conduct experiments on synthetic and real-world datasets, and confirm the validity of our theoretical analysis in terms of both the computation time and the sample complexity.

연구 동기 및 목표

  • 지수적 수준의 슈퍼 암집합을 가진 조합 순수 탐색에서 기존 선형 밴드이트 접근 방식의 계산 비가능성 문제를 해결하기 위해.
  • 일반적인 조합 제약 조건 하에서 전체 밴드이트 피드백을 사용하는 조합 순수 탐색을 위한 다항시간 밴드이트 알고리즘을 설계하기 위해.
  • 신뢰 타원체 기반 밴드이트 방법에서 핵심 서브루틴이 되는 0-1 이차 최대화 문제를 위한 효율적인 근사 알고리즘을 개발하기 위해.
  • 전체 밴드이트 피드백 하에서 조합 밴드이트 문제에서 확장 가능하고 증명 가능한 효율성을 갖춘 상위-k 선택을 가능하게 하기 위해.
  • 합성 및 실세계 데이터셋에서의 실험을 통해 이론적 표본 복잡도와 계산 시간을 검증하기 위해.

제안 방법

  • 일반적인 조합 제약 조건 하에서 전체 밴드이트 피드백을 사용하는 조합 순수 탐색을 위한 다항시간 밴드이트 알고리즘을 제안한다.
  • 신뢰 타원체 계산에서 발생하는 0-1 이차 최대화 문제를 위한 새로운 근사 알고리즘을 도입한다.
  • 이 근사 알고리즘을 활용해 상위-k 선택 문제를 위한 효율적인 밴드이트 알고리즘을 설계한다.
  • 신뢰 타원체와 표본 복잡도 분석을 활용하여 최적의 슈퍼 암에 수렴하도록 보장한다.
  • 부분 피드백 하에서 탐색과 이용의 균형을 이루는 샘플링 전략을 설계한다.
  • 이론적 분석을 활용해 제안된 알고리즘의 표본 복잡도에 대한 상한을 유도한다.

실험 결과

연구 질문

  • RQ1전체 밴드이트 피드백 하에서 이론적 표본 복잡도 보장을 갖춘 다항시간 알고리즘을 설계할 수 있는가?
  • RQ2신뢰 타원체 기반 밴드이트 알고리즘에서 발생하는 0-1 이차 최대화 문제를 효율적으로 해결할 수 있는가?
  • RQ3제안된 근사 알고리즘이 밴드이트 알고리즘에 통합되어 상위-k 선택에서 효율성과 정확성을 모두 확보할 수 있는가?
  • RQ4실제로 제안된 방법이 다항시간 계산을 유지하면서도 낮은 표본 복잡도를 달성하는가?
  • RQ5이론적 표본 복잡도 상한이 합성 및 실세계 데이터셋에서의 경험적 성능과 어떻게 비교되는가?

주요 결과

  • 제안된 알고리즘은 전체 밴드이트 피드백 하에서 조합 순수 탐색에 대해 증명 가능한 표본 복잡도 상한을 달성한다.
  • 0-1 이차 최대화 문제를 위한 근사 알고리즘은 정확한 해가 계산 비가능한 환경에서 다항시간 계산을 가능하게 한다.
  • 최종적으로 도출된 상위-k 선택을 위한 밴드이트 알고리즘은 다항시간 내에 실행되며 이론적 보장을 유지한다.
  • 실험 결과 이론적 표본 복잡도 상한이 합성 및 실세계 데이터셋에서의 경험적 성능와 일치함을 확인하였다.
  • 특히 고차원 조합 공간에서 기존의 난이도 높은 선형 밴드이트 접근 방식에 비해 계산 시간을 크게 감소시켰다.
  • 실제로 알고리즘이 확장 가능하고 효율적이며, 표본 복잡도와 런타임에 대한 이론적 분석을 실험적으로 검증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.