Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Inference Without Trading-off Regret in Bandits: An Allocation Probability Test for Thompson Sampling

Nina Deliu, Joseph Jay Williams|arXiv (Cornell University)|2021. 10. 29.
Advanced Bandit Algorithms Research인용 수 4
한 줄 요약

이 논문은 할당 확률 검정(AP-test)을 제안하며, 이는 톰슨 샘플링의 할당 확률을 활용하여 회귀 성능을 희생시키지 않고도 유효한 추론을 가능하게 하는 다수의 손잡이 밴딧 데이터를 위한 새로운 가설 검정 방법이다. 이 방법은 작은 표본에서도 높은 통계적 검정력(power)을 유지하며, 유의수준 오류를 통제하지만 밴딧의 탐색 행동을 제한하거나 큰 표본 크기를 요구하지 않는다.

ABSTRACT

Using bandit algorithms to conduct adaptive randomised experiments can minimise regret, but it poses major challenges for statistical inference (e.g., biased estimators, inflated type-I error and reduced power). Recent attempts to address these challenges typically impose restrictions on the exploitative nature of the bandit algorithm$-$trading off regret$-$and require large sample sizes to ensure asymptotic guarantees. However, large experiments generally follow a successful pilot study, which is tightly constrained in its size or duration. Increasing power in such small pilot experiments, without limiting the adaptive nature of the algorithm, can allow promising interventions to reach a larger experimental phase. In this work we introduce a novel hypothesis test, uniquely based on the allocation probabilities of the bandit algorithm, and without constraining its exploitative nature or requiring a minimum experimental size. We characterise our $Allocation\\ Probability\\ Test$ when applied to $Thompson\\ Sampling$, presenting its asymptotic theoretical properties, and illustrating its finite-sample performances compared to state-of-the-art approaches. We demonstrate the regret and inferential advantages of our approach, particularly in small samples, in both extensive simulations and in a real-world experiment on mental health aspects.

연구 동기 및 목표

  • 회귀 성능를 최소화하는 밴딧 알고리즘(예: 톰슨 샘플링)을 통해 수집된 데이터에 대해 유효한 통계적 추론을 수행하는 데 도전하는 것.
  • 기존 방법들이 밴딧의 탐색 행동을 제한함으로써 회귀 성능를 증가시키거나, 점진적 유효성을 확보하기 위해 큰 표본 크기를 요구함으로써 발생하는 한계를 극복하는 것.
  • 작은 표본의 프리릴리스 연구에서 높은 통계적 검정력을 유지하면서도 유의수준 오류를 통제하는 가설 검정을 개발하는 것.
  • 임상 시험 및 모바일 헬스와 같이 작은 크기의 적응형 실험을 흔히 수행하는 분야의 응용 연구자들에게 실용적이고 점진적 가정이 없는 해결책을 제공하는 것.

제안 방법

  • AP-test는 실험적 손잡이의 할당 확률이 등비 랜덤화를 반영하는 임계값(π^ER = 1/(K+1))을 초과하는 비율에 기반한다.
  • 검정 통계량은 실험적 손잡이에 할당 확률이 π^ER를 초과하는 시간 단계 T의 수로 정의된다.
  • 모의 실험을 통해 각 시간 단계에서의 할당 확률을 추정함으로써 계산의 실현 가능성을 확보한다.
  • 귀무가설 하에서 검정 통계량의 정확한 분포를 사용하여 임계값을 산정하고, 유의수준 오류를 통제하며, 점진적 정규성에 의존하지 않는다.
  • 이론적 보장은 수렴 결과를 통해 확립되며, 귀무가설 하에서는 검정 통계량이 확률적으로 유계이고, 대립가설 하에서는 T가 증가함에 따라 무한대로 발산한다.
  • 이 방법은 기저의 보상 분포에 민감하지 않으며, 배치 또는 계층화된 데이터 구조를 요구하지 않는다.

실험 결과

연구 질문

  • RQ1밴딧의 탐색 행동을 제한하지 않으면서도 작은 표본의 밴딧 실험에서 유효한 유의수준 오류 통제를 유지할 수 있는 가설 검정을 구성할 수 있는가?
  • RQ2AP-test는 BOLS나 AW-AIPW와 같은 기존 방법보다 작은 표본에서 더 높은 통계적 검정력을 달성하는가?
  • RQ3톰슨 샘플링 하에서 실험적 손잡이의 할당 확률은 어떻게 변화하며, 이를 추론에 활용할 수 있는가?
  • RQ4표준 톰슨 샘플링 하에서 AP-test는 점진적으로 유효한가, 그리고 실험적 손잡이가 열등할 경우 귀무가설을 기각으로 수렴하는가?

주요 결과

  • AP-test는 작은 표본에서 타당한 유의수준 오류 통제를 유지하며, 표본 크기가 작을 경우 type-I 오류를 과도하게 높이는 AW-AIPW와는 달리 이를 통제한다.
  • AP-test는 작은 배치 크기에서도 높은 통계적 검정력을 유지한다—반면 BOLS는 배치 크기 3일 경우 검정력이 0.1 이하에 머무른다.
  • 대립가설 하에서 AP-test 통계량은 T가 증가함에 따라 무한대로 발산함을 확인하여 일致성(consistency)을 입증한다.
  • 톰슨 샘플링 하에서 최적의 손잡이의 할당 확률은 시간이 지남에 따라 거의 확실히 1로 수렴하며, 이는 검정의 이론적 기반을 뒷받침한다.
  • 이 방법은 밴딧의 회귀 성능를 제약 없이 유지하면서도 유효한 추론을 가능하게 하여 최적의 손잡이를 완전히 탐색할 수 있도록 한다.
  • 모의 실험과 실제 정신건강 실험의 실증 결과는 AP-test가 최신 기술 대비 작은 표본 설정에서 뛰어난 성능을 보임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.