Skip to main content
QUICK REVIEW

[논문 리뷰] Post-Contextual-Bandit Inference

Aurélien Bibaut, Antoine Chambaz|PubMed|2021. 06. 01.
Advanced Bandit Algorithms Research참고 문헌 31인용 수 13
한 줄 요약

이 논문은 적응적 데이터 수집 환경에서 점점 더 정규적인 추론을 가능하게 하는 Contextual Adaptive Doubly Robust (CADR) 추정량을 소개한다. 중요도 샘플링 비율에서 유도된 적응적이고 일致한 조건부 분산 추정량을 사용해 이중 강건 추정량을 안정화시킴으로써, CADR는 57개의 OpenML 데이터셋에서 이전 방법이 실패하는 상황에서도 유효한 95% 신뢰구간을 제공한다.

ABSTRACT

Contextual bandit algorithms are increasingly replacing non-adaptive A/B tests in e-commerce, healthcare, and policymaking because they can both improve outcomes for study participants and increase the chance of identifying good or even best policies. To support credible inference on novel interventions at the end of the study, nonetheless, we still want to construct valid confidence intervals on average treatment effects, subgroup effects, or value of new policies. The adaptive nature of the data collected by contextual bandit algorithms, however, makes this difficult: standard estimators are no longer asymptotically normally distributed and classic confidence intervals fail to provide correct coverage. While this has been addressed in non-contextual settings by using stabilized estimators, the contextual setting poses unique challenges that we tackle for the first time in this paper. We propose the Contextual Adaptive Doubly Robust (CADR) estimator, the first estimator for policy value that is asymptotically normal under contextual adaptive data collection. The main technical challenge in constructing CADR is designing adaptive and consistent conditional standard deviation estimators for stabilization. Extensive numerical experiments using 57 OpenML datasets demonstrate that confidence intervals based on CADR uniquely provide correct coverage.

연구 동기 및 목표

  • 적응적 데이터 수집으로 인해 표준 신뢰구간이 무효화되는 컨텍스트 밴딧 실험에서의 유효한 추론 부족 문제를 해결하기 위해.
  • 컨텍스트에 따라 달라지는 적응적 데이터 수집 조건 하에서 점점 더 정규적인 추정량을 확보하기 위해.
  • 실제 적응적 실험에서 평균 치료 효과, 서브그룹 효과 또는 정책 가치에 대해 정확한 커버리지가 보장되는 신뢰구간을 구성하기 위해.
  • 이러한 컨텍스트 설정에서 이중 강건 추정량을 안정화하기 위한 일致적이고 적응적인 조건부 분산 추정량을 설계하는 과제를 해결하기 위해.
  • 결과 모델의 잘못된 특정화에 대해 강건성을 확보하면서도 유효한 추론을 유지하기 위해.

제안 방법

  • 기본 기울기의 가중치가 조건부 표준편차 추정치의 역수로 가중된 시간 평균으로 구성된 안정화된, 가중치가 부여된 추정량으로 Contextual Adaptive Doubly Robust (CADR) 추정량을 제안한다.
  • 각 시점에서 현재 정책과 과거 정책 간의 중요도 샘플링 비율을 사용하여 적응적인 조건부 분산 추정량을 설계한다.
  • 적응적 샘플링 하에서도 일관성을 확보하기 위해 결과 모델에 대해 교차 피팅과 플러그인 추정을 사용한다.
  • 이중 강건 추정을 통해 결과 모델이 잘못 지정되어도 점점 더 정규적인 성질을 유지한다.
  • 고분산 영역에서 높은 역확률 가중치의 영향을 줄이기 위해 분산 안정화를 적용한다.
  • 잘못 지정된 결과 모델과 잘 지정된 결과 모델 모두에서 57개의 OpenML 데이터셋을 대상으로 광범위한 실험을 통해 방법을 검증한다.

실험 결과

연구 질문

  • RQ1적응적이고 컨텍스트에 따라 달라지는 데이터 수집이 이루어지는 컨텍스트 밴딧 실험에서 정책 가치에 대해 유효한 신뢰구간을 구성할 수 있는가?
  • RQ2컨텍스트에 따라 달라지는 적응적 데이터 수집 조건 하에서 정책 가치 추정량이 점점 더 정규적인 성질을 가지는 것이 가능한가?
  • RQ3이러한 설정에서 이중 강건 추정량을 안정화시키기 위해 일치하고 적응적인 조건부 분산 추정량을 어떻게 설계할 수 있는가?
  • RQ4결과 모델이 잘못 지정되었을 때도 CADR 추정량은 정확한 커버리지 유지가 가능한가?
  • RQ5다양한 실제 세계 데이터셋에서 기존의 추정량(DR, IPW, DM, ADR)과 비교할 때 CADR의 커버리지 정확도는 어떻게 되는가?

주요 결과

  • CADR는 모든 기준선 방법(DR, IPW, DM, ADR, MRDR)이 유효한 커버리지를 유지하지 못하는 57개의 OpenML 데이터셋에서 95% 신뢰구간의 정확한 커버리지 성능을 달성한다.
  • 선형 결과 모델이 잘못 지정된 경우, CADR은 72개 데이터셋 중 38개에서 DR보다 훨씬 뛰어난 커버리지 성능을 보이며 분산 안정화 측면에서 뚜렷한 개선 효과를 보인다.
  • 결과 모델이 잘 지정된 경우(결정 트리 사용), CADR와 DR은 유사한 커버리지 성능을 보이지만, CADR은 다양한 데이터 분포에 걸쳐 더 강건한 성능을 유지한다.
  • 결과 모델 학습에 중요도 샘플링 가중치를 적용한 변형인 CAMRDR는 잘 지정된 경우 CADR보다 略적으로 더 우수한 성능을 보이며, 잘못 지정된 경우는 略적으로 열 劣하지만 여전히 모든 기준선을 능가한다.
  • CADR 추정량의 점점 더 정규적인 성질은 결과 모델의 잘못 지정에 대해 강건하여, 결과 모델이 정확하지 않은 경우에도 신뢰할 수 있는 추론이 가능하다.
  • 광범위한 실험을 통해 CADR는 잘 지정된 모델과 잘못 지정된 모델 모두에서 정확한 커버리지를 지속적으로 유지하는 唯一定의 방법임을 확인하였으며, 이는 컨텍스트 밴딧 데이터에 대한 첫 번째 유효한 추론 방법임을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.