Skip to main content
QUICK REVIEW

[논문 리뷰] Are sample means in multi-armed bandits positively or negatively biased?

Jaehyeok Shin, Aaditya Ramdas|arXiv (Cornell University)|2019. 05. 27.
Advanced Bandit Algorithms Research참고 문헌 23인용 수 12
한 줄 요약

이 논문은 확률적 다중 손잡이 밴딧에서 표본 평균의 선택 편향을 분해하여 세 가지 적응적 요인인 샘플링, 정지, 선택의 기여를 분리한다. '낙관주의'의 형식적 개념을 도입하여 낙관적인 샘플링은 음의 편향을 유도하고, 낙관적인 정지 및 선택은 모두 양의 편향을 유도함을 보이며, 적응적 실험에서의 순 편향을 이해하기 위한 통합 프레임워크를 제공한다.

ABSTRACT

It is well known that in stochastic multi-armed bandits (MAB), the sample mean of an arm is typically not an unbiased estimator of its true mean. In this paper, we decouple three different sources of this selection bias: adaptive \emph{sampling} of arms, adaptive \emph{stopping} of the experiment, and adaptively \emph{choosing} which arm to study. Through a new notion called ``optimism'' that captures certain natural monotonic behaviors of algorithms, we provide a clean and unified analysis of how optimistic rules affect the sign of the bias. The main takeaway message is that optimistic sampling induces a negative bias, but optimistic stopping and optimistic choosing both induce a positive bias. These results are derived in a general stochastic MAB setup that is entirely agnostic to the final aim of the experiment (regret minimization or best-arm identification or anything else). We provide examples of optimistic rules of each type, demonstrate that simulations confirm our theoretical predictions, and pose some natural but hard open problems.

연구 동기 및 목표

  • 적응적 샘플링을 통해 데이터를 수집할 때 표본 평균에서 선택 편향의 부호를 이해하기 위해.
  • 적응적 샘플링, 적응적 정지, 적응적 선택의 세 가지 적응적 메커니즘의 기여를 분리하기 위해.
  • 알고리즘에서의 단조성 행동인 '낙관주의'의 형식화 및 그 편향 방향에 미치는 영향 분석을 위해.
  • 이전 연구에서 적응적 샘플링 하에 고정된 손잡이와 고정된 시간의 편향만 고려한 오해를 수정하기 위해.
  • 모든 MAB 목표(예: 손실 최소화, 최적 손잡이 식별)에 적용 가능한 일반적이고 분포에 의존하지 않는 프레임워크를 제공하기 위해.

제안 방법

  • 샘플링, 정지, 선택 규칙에 대한 단조성 조건으로서의 새로운 '낙관주의' 형식을 도입한다.
  • 공분산을 사용한 일반적인 편향 분해를 유도한다: $\mathbb{E}[\widehat{\mu}_k - \mu_k] = -\frac{\mathrm{Cov}(\widehat{\mu}_k, N_k)}{\mathbb{E}[N_k]}$.
  • 편향 분해를 적용하여 각 적응적 구성 요소의 낙관주의에 따라 편향 부호를 분류한다.
  • 이론적 분석을 통해 낙관적인 샘플링은 음의 편향을 유도하고, 낙관적인 정지 및 선택은 모두 양의 편향을 유도함을 증명한다.
  • 정규 분포를 따르는 손잡이를 사용한 그리디, UCB, 톰슨 샘플링 알고리즘에 대한 시뮬레이션을 통해 결과를 검증한다.
  • 최적 손잡이 식별을 위한 순차적 절차를 사용하여 정지 및 선택의 적응적 기법이 양의 편향을 유도하는 것을 시연한다.

실험 결과

연구 질문

  • RQ1다중 손잡이 밴딧에서 적응적 샘플링을 사용할 경우 표본 평균의 편향 부호는 무엇인가?
  • RQ2적응적 정지 및 적응적 선택 규칙는 표본 평균 추정의 편향에 어떻게 영향을 미치는가?
  • RQ3모든 세 가지 적응적 메커니즘이 동시에 존재할 경우 순 편향을 설명할 수 있는 통합 프레임워크가 가능한가?
  • RQ4이전 연구에서 적응적 샘플링만 고려한 결과가 실질적인 편향 그림을 완전히 포괄하지 못하는 이유는 무엇인가?
  • RQ5어떤 조건에서 낙관적인 샘플링, 정지, 또는 선택이 양의 또는 음의 편향을 유도하는가?

주요 결과

  • UCB, 톰슨 샘플링, 그리디와 같은 낙관적인 샘플링 규칙는 어떤 손잡이의 표본 평균에도 음의 편향을 유도한다.
  • 낙관적인 정지 및 선택 규칙는 모두 양의 편향을 유도하며, 최적 손잡이 식별을 위한 순차적 절차의 시뮬레이션을 통해 이를 입증한다.
  • 낙관적인 샘플링, 정지, 선택을 모두 포함하는 lil’UCB 알고리즘은 정지 및 선택의 기여가 지배하기 때문에 순수하게 양의 편향을 보인다.
  • 표준편차가 1인 정규 분포 손잡이 세 개(평균이 1, 2, 3)에 대해 그리디 샘플링이 모든 손잡이에서 음의 편향을 유도함을 시뮬레이션으로 확인한다.
  • 평균이 $g$, 0, $-g$인 손잡이를 대상으로 한 최적 손잡이 식별에서, 정지 시점의 가장 큰 표본 평균은 모든 갭 크기 $g=1,3,5$에 대해 양의 편향을 보인다.
  • 적응적 밴딧 설정에서의 순 편향은 낙관적인 샘플링, 정지, 선택 규칙의 균형에 따라 양의 또는 음의 편향이 될 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.