Skip to main content
QUICK REVIEW

[논문 리뷰] Selecting the best system, large deviations, and multi-armed bandits

Peter W. Glynn, Sandeep Juneja|arXiv (Cornell University)|2015. 07. 16.
Advanced Bandit Algorithms Research참고 문헌 23인용 수 3
한 줄 요약

이 논문은 대규모 이격도 비율 추정이 1−δ 신뢰수준에서 최상의 집단을 식별하는 데 O(log(1/δ)) 표본 복잡도를 가능하게 한다는 가정을 도전한다. 비유한 지지에서 이러한 보장을 달성하는 것은 모멘트 제약 조건이 없이 본질적으로 불가능하며, 추정된 비율 함수 자체가 대규모 이격도 원리에 따라 분포함을 보여주어 시뮬레이션 기반 선택 알고리즘에 대한 새로운 이론적 통찰을 제공한다.

ABSTRACT

Consider the problem of finding a population amongst many with the largest mean when these means are unknown but population samples can be generated via simulation. Typically, by selecting a population with the largest sample mean, it can be shown that the false selection probability decays at an exponential rate. Lately researchers have sought algorithms that guarantee that this probability is restricted to a small $\delta$ in order $\log(1/\delta)$ computational time by estimating the associated large deviations rate function via simulation. We show that such guarantees are misleading. Enroute, we identify the large deviations principle followed by the empirically estimated large deviations rate function that may also be of independent interest. Further, we show a negative result that when populations have unbounded support, under mild restrictions, any policy that asymptotically identifies the correct population with probability at least $1-\delta$ for each problem instance requires more than $O(\log(1/\delta))$ samples in making such a determination in any problem instance. This suggests that some restrictions are essential on populations to devise $O(\log(1/\delta))$ algorithms with $1 - \delta$ correctness guarantees. We note that under restriction on population moments, such methods are easily designed. We also observe that sequential methods from stochastic multi-armed bandit literature can be adapted to devise such algorithms.

연구 동기 및 목표

  • 대규모 이격도 비율 추정을 통해 1−δ 신뢰수준에서 최상의 집단을 선택하는 데 O(log(1/δ)) 표본 복잡도가 달성 가능한지 조사한다.
  • 경험적으로 추정된 대규모 이격도 비율 함수의 대규모 이격도 행동을 분석한다.
  • 이러한 효율적인 알고리즘이 존재하기 위해 모멘트 제약 조건이 필수적인지 결정한다.
  • 순차적인 다중 암머드 밴딧 방법이 O(log(1/δ)) 표본으로 1−δ 정확도를 달성하는 데 가능할지 평가한다.

제안 방법

  • 대규모 이격도 이론을 사용하여 경험적으로 추정된 대규모 이격도 비율 함수가 따르는 대규모 이격도 원리를 유도한다.
  • 비유한 집단 지지 하에서 선택 알고리즘의 渐近적 행동을 분석한다.
  • 부정적 결과를 수립: 모든 인스턴스에서 1−δ 정확도를 달성하는 정책은 지지가 비유한 경우 O(log(1/δ)) 표본을 초과해야 한다.
  • 약간의 모멘트 제약 조건을 사용하여 이러한 조건 하에서 O(log(1/δ)) 알고리즘이 가능하다는 것을 보여준다.
  • 순차적인 확률적 다중 암머드 밴딧 전략을 수정하여 모멘트 제약 조건 하에서 유효한 O(log(1/δ)) 알고리즘을 구축한다.
  • 시뮬레이션 기반으로 대규모 이격도 비율 함수를 추정하여 선택 성능과 오차 감소율을 평가한다.

실험 결과

연구 질문

  • RQ1시뮬레이션을 통한 대규모 이격도 비율 추정이 1−δ 신뢰수준에서 최상의 집단을 선택하는 데 O(log(1/δ)) 표본 복잡도를 보장할 수 있는가?
  • RQ2경험적으로 추정된 대규모 이격도 비율 함수를 지배하는 대규모 이격도 원리는 무엇인가?
  • RQ3집단의 지지가 비유한 경우 O(log(1/δ)) 표본 복잡도는 본질적으로 불가능한가?
  • RQ41−δ 정확도 보장을 갖는 O(log(1/δ)) 알고리즘을 달성하기 위해 모멘트 제약 조건이 필수적인가?
  • RQ5기존의 순차적 다중 암머드 밴딧 방법은 모멘트 제약 조건 하에서 이러한 보장을 달성하는 데 적응 가능한가?

주요 결과

  • 비유한 집단 지지와 약간의 제약 조건 하에서, 어떤 정책도 모든 문제 인스턴스에서 O(log(1/δ)) 표본으로 1−δ 정확도를 달성할 수 없다.
  • 경험적으로 추정된 대규모 이격도 비율 함수는 자체적인 대규모 이격도 원리를 따르며, 이는 별도의 이론적 관심사가 된다.
  • 집단의 모멘트가 유한할 경우, 1−δ 정확도 보장을 갖는 O(log(1/δ)) 알고리즘을 구성할 수 있다.
  • 표준 표본 추출 하에서 잘못된 선택 확률은 지수적으로 감소하지만, 이는 보장된 신뢰수준에서 O(log(1/δ)) 표본 복잡도를 의미하지는 않는다.
  • 순차적 다중 암머드 밴딧 방법은 모멘트 제약 조건 하에서 O(log(1/δ)) 표본 복잡도를 달성하는 데 적응 가능하다.
  • 이 논문은 기존의 대규모 이격도 기반 접근 방식이 비유한 지지 하에서 본질적인 한계로 인해 실무에서 오해의 소지가 있음을 드러낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.