Skip to main content
QUICK REVIEW

[논문 리뷰] Nearly Optimal Sampling Algorithms for Combinatorial Pure Exploration

Lijie Chen, Anupam Gupta|arXiv (Cornell University)|2017. 06. 04.
Advanced Bandit Algorithms Research참고 문헌 21인용 수 7
한 줄 요약

이 논문은 확률적 다익선 띠(arms)에서 조합적 순수 탐색 문제 BEST-SET에 대해 거의 최적의 샘플링 알고리즘을 제안한다. 목표는 최소한의 샘플 수로 가족 F 내에서 총 평균 보상이 가장 높은 타당한 부분집합을 식별하는 것이다. 이 방법은 새로운 인스턴스별 하한값과 선형계획법 근사 및 신뢰구간 기반의 이중단계 샘플링 절차를 결합하여, 정보이론적 하한값에 비해 |F|의 로그 인자 범위 내에서 샘플 복잡도를 달성한다. 또한 볼록 최적화와 근사 파레토 곡선을 통해 매트로이드, 매칭, 경로와 같은 중요한 조합적 가족에 대해 다항시간 구현이 가능하다.

ABSTRACT

We study the combinatorial pure exploration problem Best-Set in stochastic multi-armed bandits. In a Best-Set instance, we are given $n$ arms with unknown reward distributions, as well as a family $\mathcal{F}$ of feasible subsets over the arms. Our goal is to identify the feasible subset in $\mathcal{F}$ with the maximum total mean using as few samples as possible. The problem generalizes the classical best arm identification problem and the top-$k$ arm identification problem, both of which have attracted significant attention in recent years. We provide a novel instance-wise lower bound for the sample complexity of the problem, as well as a nontrivial sampling algorithm, matching the lower bound up to a factor of $\ln|\mathcal{F}|$. For an important class of combinatorial families, we also provide polynomial time implementation of the sampling algorithm, using the equivalence of separation and optimization for convex program, and approximate Pareto curves in multi-objective optimization. We also show that the $\ln|\mathcal{F}|$ factor is inevitable in general through a nontrivial lower bound construction. Our results significantly improve several previous results for several important combinatorial constraints, and provide a tighter understanding of the general Best-Set problem. We further introduce an even more general problem, formulated in geometric terms. We are given $n$ Gaussian arms with unknown means and unit variance. Consider the $n$-dimensional Euclidean space $\mathbb{R}^n$, and a collection $\mathcal{O}$ of disjoint subsets. Our goal is to determine the subset in $\mathcal{O}$ that contains the $n$-dimensional vector of the means. The problem generalizes most pure exploration bandit problems studied in the literature. We provide the first nearly optimal sample complexity upper and lower bounds for the problem.

연구 동기 및 목표

  • 조합적 제약 조건 하에 F 내에서 총 평균 보상이 가장 높은 타당한 부분집합을 식별하는 조합적 순수 탐색 문제 BEST-SET를 다루기 위해.
  • BEST-SET에 대한 샘플 복잡도에 대해 문제에 특화된 날카운 하한값을 확립하여 문제의 고유한 어려움을 반영하기 위해.
  • 이 하한값에 대해 |F|의 로그 인자 범위 내에서 하한값을 충족하는 샘플링 알고리즘을 설계하여 거의 최적성을 확보하기 위해.
  • 매트로이드, 매칭, 경로와 같은 중요한 조합적 가족에 대해 볼록 최적화와 근사 파레토 곡선을 이용한 다항시간 구현을 제공하기 위해.
  • 기하학적 공식화를 통해 정규 분포를 가진 띠를 포함하는 순수 탐색의 일반화된 설정에 프레임워크를 확장하여, 이 일반 설정에 대해 처음으로 거의 최적의 하한값을 제공하기 위해.

제안 방법

  • 라운드로빈 샘플링을 통해 평균 추정치를 정밀화한 후 선형계획법 근사를 적용하여 최적의 샘플 비율을 결정하는 이중단계 샘플링 알고리즘인 LPSample을 제안한다.
  • 최적의 부분집합과 다른 후보들 사이의 구별 가능성(구분 가능성)을 반영하는 선형계획법을 통해 새로운 인스턴스별 샘플 복잡도 하한값을 유도한다.
  • 높은 확률로 정확한 결과를 보장하기 위해 신뢰구간과 농도 불등식(예: 허프딩 부등식)을 사용하며, 평균 추정치가 충분히 정확한 '좋은' 사건 조건 하에 기반한다.
  • 볼록 최적화에서 분리와 최적화의 등가성을 활용하여 스패닝 트리 및 매칭과 같은 복잡한 가족에 대해 샘플링 분포를 효율적으로 계산한다.
  • 지수 크기의 F를 명시적 열거 없이 처리하기 위해 다목적 최적화에서 근사 파레토 곡선의 개념을 도입한다.
  • n차원 정규 띠와 상호배타적인 결과 집합 O를 사용한 문제의 기하학적 공식화를 적용하여 이전 순수 탐색 문제들을 일반화한다.

실험 결과

연구 질문

  • RQ1조합적 순수 탐색 문제에서 최적의 부분집합을 식별하기 위해 필요한 샘플 수에 대한 인스턴스별 정보이론적 하한값은 무엇인가?
  • RQ2|F|가 n에 대해 지수적으로 증가하더라도, 이 하한값에 대해 |F|의 로그 인자 범위 내에서 하한값을 충족하는 샘플링 알고리즘을 설계할 수 있는가?
  • RQ3매트로이드, 매칭, 경로와 같은 조합적 가족에 대해 샘플링 알고리즘을 다항시간 내에 효율적으로 구현할 수 있는가?
  • RQ4일반적으로 |F|에 대한 로그 인자는 피할 수 없는가, 아니면 특정 문제 클래스에서는 이를 제거할 수 있는가?
  • RQ5정규 분포를 가진 띠와 상호배타적인 결과 영역을 포함하는 기하학적 순수 탐색 설정으로 프레임워크를 확장할 수 있는가?

주요 결과

  • 논문은 BEST-SET에 대해 새로운 인스턴스별 샘플 복잡도 하한값을 확립하였으며, 이는 이전의 하한값보다 더 날카롭고 문제의 고유한 어려움을 반영한다.
  • 제안된 LPSample 알고리즘은 유도된 하한값에 대해 O(ln |F|) 요인 내에서 샘플 복잡도를 달성하여 거의 최적임을 입증한다.
  • 매트로이드, 매칭, 경로와 같은 조합적 가족에 대해 볼록 최적화와 근사 파레토 곡선을 이용해 다항시간으로 알고리즘을 구현할 수 있다.
  • 논문은 Nisan-Wigderson 설계를 기반으로 한 비트레버설 하한값 구성으로 인해 ln |F| 요인이 일반적으로 피할 수 없다는 것을 증명한다.
  • 정규 띠를 포함하는 순수 탐색의 기하학적 공식화가 대부분의 이전 순수 탐색 문제를 일반화하며, 이 설정에 대해 논문은 처음으로 거의 최적의 샘플 복잡도 하한값을 제공한다.
  • 알고리즘의 기대 샘플 복잡도는 O(Low(I)(ln δ−1 + n³ + n ln ∆−1))이며, 여기서 Low(I)는 인스턴스별 하한값이고, ∆는 진짜 평균과 다른 타당한 해 사이의 최소 유클리드 거리이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.