[논문 리뷰] PAC Identification of Many Good Arms in Stochastic Multi-Armed Bandits
이 논문은 확률적 다중 손잡이 밴딧에서 최상의 $m$개 중 $k$개를 선택하는 PAC 식별 문제를 제안하며, 최고의 부분집합 선택과 단일 손잡이 식별을 일반화한다. LUCB-$k$-$m$ 알고리즘을 제안하여 상수 요소를 제외한 기존 하한선에 근접한 샘플 복잡도를 달성하며, 다항로그 간격으로 최적에 수렴하는 무한 손잡이 밴딧으로 이 프레임워크를 확장한다.
We consider the problem of identifying any $k$ out of the best $m$ arms in an $n$-armed stochastic multi-armed bandit. Framed in the PAC setting, this particular problem generalises both the problem of `best subset selection' and that of selecting `one out of the best m' arms [arcsk 2017]. In applications such as crowd-sourcing and drug-designing, identifying a single good solution is often not sufficient. Moreover, finding the best subset might be hard due to the presence of many indistinguishably close solutions. Our generalisation of identifying exactly $k$ arms out of the best $m$, where $1 \leq k \leq m$, serves as a more effective alternative. We present a lower bound on the worst-case sample complexity for general $k$, and a fully sequential PAC algorithm, \GLUCB, which is more sample-efficient on easy instances. Also, extending our analysis to infinite-armed bandits, we present a PAC algorithm that is independent of $n$, which identifies an arm from the best $ρ$ fraction of arms using at most an additive poly-log number of samples than compared to the lower bound, thereby improving over [arcsk 2017] and [Aziz+AKA:2018]. The problem of identifying $k > 1$ distinct arms from the best $ρ$ fraction is not always well-defined; for a special class of this problem, we present lower and upper bounds. Finally, through a reduction, we establish a relation between upper bounds for the `one out of the best $ρ$' problem for infinite instances and the `one out of the best $m$' problem for finite instances. We conjecture that it is more efficient to solve `small' finite instances using the latter formulation, rather than going through the former.
연구 동기 및 목표
- 단일 최적 손잡이 식별만으로는 충분하지 않은 실용적 상황, 예를 들어 분산형 커뮤니티 기반 채용 또는 약물 설계에서 여러 우수한 솔루션을 필요로 하는 경우를 다루기 위해.
- 기존 문제를 일반화하기 위해 최고 부분집합 선택 ($k=m$) 및 최고 $m$개 중 하나 선택 ($k=1$) 문제를 $n$개의 손잡이 중 상위 $m$개에서 $k$개의 손잡이를 식별하는 통합 프레임워크로 통합하기 위해.
- 유한 및 무한 손잡이 밴딧 설정 모두에서 일반화된 $(k,m,n)$ 문제에 대한 이론적 샘플 복잡도 하한선을 수립하기 위해.
- 최소한의 샘플링으로 $k$개의 우수한 손잡이를 효율적으로 식별하기 위한 완전 순차적, 적응형 PAC 알고리즘인 LUCB-$k$-$m$을 설계하기 위해.
- 무한 손잡이 밴딧에서 최상의 $\rho$ 분율에 속하는 $k$개의 서로 다른 손잡이를 식별하는 가능성과 복잡도를 분석하고, 유한 및 무한 사례 간의 감소를 통해 연관짓기 위해.
제안 방법
- 새로운 문제 정식화를 제안: 확률적 다중 손잡이 밴딧 환경에서 PAC 설정 하에 $n$개의 손잡이 중 상위 $m$개에서 $k$개의 손잡이를 식별하기 위해.
- 상한 및 하한 신뢰구간을 사용해 비효율적인 손잡이를 순차적으로 제거하는 완전 순차적, 적응형 알고리즘인 LUCB-$k$-$m$을 도입한다.
- $(k,m,n)$ 문제에 대한 최악의 경우 샘플 복잡도 하한선을 유도하며, $k=1$ 및 $k=m$의 경우 기존 하한선을 일반화한다.
- 무한 손잡이 밴딧로의 분석을 확장하기 위해 $\rho$-최적 손잡이(평균의 $\rho$-분위수에서 $\epsilon$ 이내)를 정의하고, 하한선에 대해 추가적인 다항로그 항 내에서 샘플 복잡도를 가지는 PAC 알고리즘을 제시한다.
- 특정 클래스의 잘 정의된 인스턴스를 식별하고, 이에 대해 이론적 보장을 제공하는 알고리즘을 제안한다.
- 무한 손잡이 $(k,\rho)$-문제와 유한 손잡이 $(k,m,n)$-문제 간의 감소를 수립하여, 유한 사례를 해결하는 것이 더 효율적일 수 있음을 시사한다.
실험 결과
연구 질문
- RQ1확률적 밴딧에서 $n$개의 손잡이 중 상위 $m$개에서 $k$개의 손잡이를 식별하는 데 필요한 기본 샘플 복잡도 하한선은 무엇인가요?
- RQ2일반화된 $(k,m,n)$ 문제에 대해 근사 최적의 샘플 복잡도를 달성하는 완전 순차적, 적응형 알고리즘을 설계할 수 있을까요?
- RQ3무한 손잡이 밴딧에서 최상의 $\rho$ 분율에서 $k$개의 손잡이를 식별하는 데 샘플 복잡도는 어떻게 스케일링되며, 이는 정보 이론적 하한선에 가까워질 수 있을까요?
- RQ4최상의 $[\epsilon,\rho]$-최적 손잡이 $k$개를 식별하는 문제의 조건은 무엇이며, 어떻게 효율적으로 해결할 수 있을까요?
- RQ5샘플 효율성 측면에서 유한 손잡이 $(k,m,n)$ 문제를 해결하는 데는 무한 손잡이 $(k,\rho)$ 문제를 해결하는 것보다 구조적 이점이 있는가요?
주요 결과
- LUCB-$k$-$m$ 알고리즘은 $k=1$ 및 $k=m$의 경우 기존 하한선에 상수 요소를 제외하고 정확히 일치하는 기대 샘플 복잡도를 달성한다.
- 실험적 평가에서 $n$이 증가함에 따라 $\mathcal{F}_2$와 같은 기존 알고리즘에 비해 LUCB-$k$-$m$이 샘플 효율성에서 뚜렷한 우월성을 보였다.
- 무한 손잡이 밴딧의 경우, 제안된 알고리즘은 하한선에 대해 추가적인 $O(\log^2(1/\delta))$ 항 내에서 $[\epsilon,\rho]$-최적 손잡이를 식별하며, 이는 이전 작업보다 향상된 결과이다.
- 최상의 $[\epsilon,\rho]$-최적 손잡이 $k$개를 식별하는 문제의 경우 항상 잘 정의된 것은 아니지만, 특정 클래스의 인스턴스는 잘 정의된 공식화와 증명 가능한 하한선을 가진다.
- 무한 손잡이 $(k,\rho)$-문제와 유한 손잡이 $(k,m,n)$-문제 간 감소 관계를 수립하여, 유한 사례가 더 효율적으로 해결될 수 있음을 시사한다.
- 저자들은 유한 손잡이 $(k,m,n)$ 문제를 해결하는 것이 무한 손잡이 $(k,\rho)$ 문제를 해결하는 것보다 더 샘플 효율적일 것이라 추측하며, 향후 연구를 위해 열린 문제로 남긴다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.