Skip to main content
QUICK REVIEW

[논문 리뷰] Pure Exploration in Infinitely-Armed Bandit Models with Fixed-Confidence

Maryam Aziz, Jesse Anderton|arXiv (Cornell University)|2018. 03. 13.
Advanced Bandit Algorithms Research참고 문헌 14인용 수 6
한 줄 요약

이 논문은 저수지 분포를 가진 무한히 많은 손잡이를 가진 밴딧 문제에 대해 고정 신뢰도 순수 탐색 프레임워크를 제안하며, 높은 확률로 거의 최적의 손잡이를 식별하는 알고리즘을 제안한다. 샘플 복잡도의 하한을 확립하고, 상한이 이론적 하한에 로그 인자 범위 내에 있음을 증명하여, 이 설정에서 이중단계 알고리즘의 경우 log²(1/δ) 의존성이 피할 수 없다는 것을 보여준다.

ABSTRACT

We consider the problem of near-optimal arm identification in the fixed confidence setting of the infinitely armed bandit problem when nothing is known about the arm reservoir distribution. We (1) introduce a PAC-like framework within which to derive and cast results; (2) derive a sample complexity lower bound for near-optimal arm identification; (3) propose an algorithm that identifies a nearly-optimal arm with high probability and derive an upper bound on its sample complexity which is within a log factor of our lower bound; and (4) discuss whether our log^2(1/delta) dependence is inescapable for "two-phase" (select arms first, identify the best later) algorithms in the infinite setting. This work permits the application of bandit models to a broader class of problems where fewer assumptions hold.

연구 동기 및 목표

  • 손잡이 저수지 분포에 대한 최소한의 가정 하에 거의 최적의 손잡이 식별 문제를 해결하기 위해.
  • 무한한 설정에서 고정 신뢰도 순수 탐색을 위한 PAC 유사 프레임워크를 개발하여, 상위-α 및 ε-완화 식별 모두를 수용하기 위해.
  • 높은 확률로 거의 최적의 손잡이를 식별하기 위한 샘플 복잡도 하한을 유도하기 위해.
  • 하한에 대해 로그 인자 범위 내에 있는 샘플 복잡도 상한을 가지는 알고리즘을 설계하기 위해.
  • 이중단계 알고리즘에서 log²(1/δ) 의존성이 무한 밴딧 설정에서 피할 수 없는가를 조사하기 위해.

제안 방법

  • 확률 1−δ 이상으로 저수지의 상위-α 비율에 속하는 손잡이를 식별하기 위한 새로운 $(\alpha,\delta)$-프레임워크를 도입한다.
  • 상위-α 경계 근처에 조밀한 확률 질량을 가진 저수지를 다루기 위해 $\epsilon$-완화 프레임워크를 제안한다. 이는 실용적 관련성을 향상시킨다.
  • 이중단계 알고리즘을 설계한다: 첫 번째 단계에서는 보상 관측 없이 저수지에서 손잡이를 샘플링하고, 두 번째 단계에서는 이전에 선택된 손잡이의 보상을 샘플링하여 최고의 손잡이를 식별한다.
  • Chernoff 정보와 KL 발산을 사용하여 손잡이 평균 간의 분리 정도를 제한함으로써, 신뢰도 기반의 손잡이 선택을 가능하게 한다.
  • 샘플 복잡도에 대한 상한을 유도하며, 이는 $\mathcal{O}\left(\left(\frac{4}{\epsilon^2} + \sum_{i=2}^{m-1} \frac{1}{d^*(b_i,b_1)}\right)\log^2\frac{1}{\delta}\right)$ 의 스케일을 따른다.
  • 샘플 복잡도에 대한 하한을 증명하며, 이는 $\log\frac{1}{\delta}$ 를 포함하며, 상한이 최적성에 대해 로그 인자 범위 내에 있음을 보여준다.

실험 결과

연구 질문

  • RQ1무한 밴딧 설정에서 이중단계 알고리즘의 경우 $\log^2\frac{1}{\delta}$ 샘플 복잡도 의존성이 피할 수 없는가?
  • RQ2$\epsilon$-완화 프레임워크가 상위-α 임계값 근처에 조밀한 질량을 가진 저수지에서 강건성을 향상시킬 수 있는가?
  • RQ3제안된 알고리즘의 샘플 복잡도는 $\delta$ 에 대한 이론적 하한과 비교해 볼 때 어떤 의존성을 가지는가?
  • RQ4저수지 분포의 尾행동이 순수 탐색의 샘플 복잡도에 어떤 영향을 미치는가?
  • RQ5한 단계 알고리즘은 샘플링과 선택을 번갈아 수행함으로써 $\log^2\frac{1}{\delta}$ 인자를 피할 수 있는가?

주요 결과

  • 거의 최적의 손잡이 식별을 위한 샘플 복잡도 하한은 $\Omega\left(\left(\frac{1}{d(b_1-\epsilon,b_0+\epsilon)} + \sum_{i=3}^{m-1}\frac{1}{d(b_i,b_0+\epsilon)}\right)\log\frac{1}{\delta}\right)$ 의 스케일을 가지며, 여기서 $d$ 는 KL 발산이다.
  • 제안된 알고리즘은 $\mathcal{O}\left(\left(\frac{4}{\epsilon^2} + \sum_{i=2}^{m-1}\frac{1}{d^*(b_i,b_1)}\right)\log^2\frac{1}{\delta}\right)$ 의 상한을 달성하며, 이는 하한에 대해 로그 인자 범위 내에 있다.
  • log²(1/δ) 인자는 이중단계 알고리즘의 두 단계 모두에서 δ-정확성 요구 조건에서 기인하며, 이러한 접근 방식에 대해 피할 수 없다는 것을 시사한다.
  • 베르누이 케이스에서 KL 발산 $d(x,\mu^*)$ 와 Chernoff 정보 $d^*(x,\mu^*)$ 는 유사한 척도를 가지며, 비최적의 손잡이에 대해 $d^*(x,\mu^*)$ 는 $d(x,\mu^*)$ 를 略로 더 작게 나타낸다.
  • 첫 번째 단계는 높은 확률로 상위-α 손잡이를 식별하기 위해 최소 $\Omega\left(\frac{1}{\alpha}\log\frac{1}{\delta}\right)$ 개의 샘플을 요구하며, 이는 저수지 샘플링의 본질적 비용을 나타낸다.
  • 저자들은 한 단계 알고리즘이 $\log\frac{1}{\delta}$ 의존성을 달성할 수 있을 것이라 추측하며, 더 효율적인 경로를 제시한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.