Skip to main content
QUICK REVIEW

[논문 리뷰] Selecting the best system and multi-armed bandits

Peter W. Glynn, Sandeep Juneja|arXiv (Cornell University)|2015. 07. 16.
Advanced Bandit Algorithms Research참고 문헌 28인용 수 9
한 줄 요약

이 논문은 경미한 꼬리 분포를 가진 분포에서 지지역이 유계가 아닌 경우, 어떤 알고리즘도 기댓값으로 $O(\log(1/\delta))$ 개의 표본을 사용하여 확률 $1 - \delta$ 이상으로 최적의 시스템을 정확히 선택할 수 없음을 보여준다. 이는 필요한 기댓값 표본 수가 무한해지기 때문이다. 저자들은 모멘트 제약 조건이 없을 경우 이러한 보장을 본질적으로 오해의 소지가 있음을 증명하지만, 고차원 모멘트가 유계일 경우 $O(\log(1/\delta))$ 알고리즘이 가능하다는 것을 보여준다.

ABSTRACT

Consider the problem of finding a population or a probability distribution amongst many with the largest mean when these means are unknown but population samples can be simulated or otherwise generated. Typically, by selecting largest sample mean population, it can be shown that false selection probability decays at an exponential rate. Lately, researchers have sought algorithms that guarantee that this probability is restricted to a small $δ$ in order $\log(1/δ)$ computational time by estimating the associated large deviations rate function via simulation. We show that such guarantees are misleading when populations have unbounded support even when these may be light-tailed. Specifically, we show that any policy that identifies the correct population with probability at least $1-δ$ for each problem instance requires infinite number of samples in expectation in making such a determination in any problem instance. This suggests that some restrictions are essential on populations to devise $O(\log(1/δ))$ algorithms with $1 - δ$ correctness guarantees. We note that under restriction on population moments, such methods are easily designed, and that sequential methods from stochastic multi-armed bandit literature can be adapted to devise such algorithms.

연구 동기 및 목표

  • 모르는 평균을 가진 $d$개의 집단 중에서 최적의 시스템 선택에 대해 $O(\log(1/\delta))$ 알고리즘이 $1 - \delta$의 정확도를 보장할 수 있는지 조사하기.
  • 지지역이 오른쪽으로 무한한 경미한 꼬리 분포에서 오르막 선택 확률의 지수 감소 성질의 타당성을 분석하기.
  • $O(\log(1/\delta))$ 알고리즘과 고신뢰도 보장을 갖는 조건을 규명하기.
  • 순수 탐색 설정에서 기존의 대칭 확률 기반 접근법의 한계를 명확히 하기.
  • 이러한 알고리즘에서 기댓값 표본 복잡도가 유한해지기 위해 모멘트 제약 조건이 필수적임을 확립하기.

제안 방법

  • 독립 동일분포 표본에서 $d$개의 집단로부터의 표본을 취할 때, 오르막 선택 확률의 지수 감소율을 분석하기 위해 대칭 확률 이론을 사용하기.
  • 기댓값 표본 복잡도가 $1 - \delta$ 정확도 보장을 보장하는 어떤 정책이라도 무한해지는 것을 보여주기 위해, 지지역이 무한한 경미한 꼬리 분포의 가족을 이용한 반례를 구성하기.
  • 모멘트 제약 조건 하에서 대칭 확률 속도 함수를 최적화하기 위해 변분 접근법을 적용하기.
  • 서브-웨이불 랜덤 변수에 대한 베르누이 타입 부등식을 사용하여 잘라낸 추정량의 편향에 대한 경계 유도하기.
  • 모멘트 제약 조건 하에서 스토케스틱 다중 암 랜드마크 문제의 순차적 표본 정책을 적응적으로 적용하기.
  • 미적분과 최적화를 사용하여 유도된 제약 조건 하에서 최적의 표본 전략이 극단적 점에 질량을 집중시킴을 보여주기.

실험 결과

연구 질문

  • RQ1지지역이 무한한 집단에서 $O(\log(1/\delta))$ 표본을 사용하여 최적의 암 선택에 대해 $1 - \delta$ 정확도를 달성할 수 있는 알고리즘이 존재하는가?
  • RQ2지지역이 무한할 경우 오르막 선택 확률의 지수 감소는 기댓값 표본 복잡도가 유한함을 보장하는 데 충분한가?
  • RQ3모멘트 조건은 $O(\log(1/\delta))$ 알고리즘과 고신뢰도 보장을 가능하게 하는 데 어떤 역할을 하는가?
  • RQ4대칭 확률 기반 접근법은 모든 경미한 꼬리 분포에 대해 유효한가, 아니면 숨겨진 가정이 있는가?
  • RQ5다중 암 랜드마크 문제에서 유도된 순차적 표본 정책을 모멘트 제약 조건 하에서 $O(\log(1/\delta))$ 표본 복잡도를 달성하기 위해 적응시킬 수 있는가?

주요 결과

  • 지지역이 무한한 경미한 꼬리 분포에서는, 최적의 암 선택에 대해 $1 - \delta$ 정확도를 보장하는 어떤 정책이라도 기댓값으로 무한한 수의 표본이 필요하다.
  • 지지역이 무한할 경우 오르막 선택 확률의 지수 감소는 기댓값 표본 복잡도가 유한함을 의미하지 않는다.
  • 모멘트가 유계일 경우, $1 - \delta$ 정확도 보장을 갖는 $O(\log(1/\delta))$ 알고리즘을 구성할 수 있다.
  • 모멘트 제약 조건 하에서 최적의 표본 전략은 극단적 점에 질량을 집중시키며, 최적의 임계값은 서브-웨이불 꼬리 파라미터에 의해 결정된다.
  • 서브-웨이불 변수에 대한 베르누이 부등식은 잘라낸 추정량의 편향 제어를 가능하게 하여, 표본 수가 유한한 경우의 분석을 가능하게 한다.
  • 모멘트 제약 조건 하에서 오르막 선택 확률을 최소화하는 최적의 할당 전략은 변분 최적화를 통해 유도된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.