Skip to main content
QUICK REVIEW

[논문 리뷰] Machine Learning for Variance Reduction in Online Experiments

Yongyi Guo, Dominic Coey|arXiv (Cornell University)|2021. 06. 14.
Advanced Causal Inference Techniques참고 문헌 28인용 수 9
한 줄 요약

이 논문은 온라인 A/B 테스트에서 분산을 줄이기 위해 교차적합(_cross-fitting_)과 강건한 선형 회귀를 사용하는 기계학습 회귀 조정 추정기인 MLRATE를 제안한다. 처리 효과 추정에 대해 예측 모델을 이용해 결과 변수를 공변량으로 예측함으로써, MLRATE는 차분-평균과 비교해 최대 70% 낮은 분산을 달성하며, 기계학습 예측이 열악한 경우에도 渐近적 타당성을 유지한다.

ABSTRACT

We consider the problem of variance reduction in randomized controlled trials, through the use of covariates correlated with the outcome but independent of the treatment. We propose a machine learning regression-adjusted treatment effect estimator, which we call MLRATE. MLRATE uses machine learning predictors of the outcome to reduce estimator variance. It employs cross-fitting to avoid overfitting biases, and we prove consistency and asymptotic normality under general conditions. MLRATE is robust to poor predictions from the machine learning step: if the predictions are uncorrelated with the outcomes, the estimator performs asymptotically no worse than the standard difference-in-means estimator, while if predictions are highly correlated with outcomes, the efficiency gains are large. In A/A tests, for a set of 48 outcome metrics commonly monitored in Facebook experiments the estimator has over 70% lower variance than the simple difference-in-means estimator, and about 19% lower variance than the common univariate procedure which adjusts only for pre-experiment values of the outcome.

연구 동기 및 목표

  • 기계학습 예측자를 활용한 실용적이고 확장 가능한 온라인 실험에서의 분산 감소 방법을 개발하기 위해.
  • 기계학습 예측이 결과와 상관관계가 없을 경우에도 추정기가 강건하게 유지되도록 보장하기 위해.
  • 일반 조건 하에서 점근적 정규성과 난이도 있는 신뢰구간의 타당성을 증명하기 위해.
  • 실제 48개의 Facebook 메트릭에서 A/A 테스트를 통해 상당한 분산 감소를 입증하기 위해.
  • 대규모 온라인 실험 플랫폼에 기계학습 기반 조정을 구현할 때 발생하는 확장성 및 계산적 과제를 해결하기 위해.

제안 방법

  • MLRATE는 서로 겹치지 않는 데이터 하위집합에서 기계학습 모델을 훈련시켜 예측값이 추정 샘플과 독립이 되도록 교차적합을 사용한다.
  • 다음 단계에서 선형 회귀 모델에 ML 예측 결과를 공변량으로 포함시켜 처리 효과를 조정한다.
  • 기계학습 단계에서 발생하는 추정 편향을 통제함으로써, 점근적 정규성과 난이도 있는 신뢰구간의 타당성을 확보한다.
  • 모델에 종속되지 않으며, 기계학습 모델이 진정한 조건부 평균으로 수렴하거나 결과 관계가 선형인다는 가정이 필요하지 않다.
  • 추정기는 강건하다: 기계학습 예측이 결과와 상관관계가 없을 경우, 분산은 차분-평균과 같거나 더 나쁘지 않다.
  • 네이umann 급수 전개와 고확률 경계를 사용하여 약한 규칙성 조건 하에서 점근적 분포 성질을 확립한다.

실험 결과

연구 질문

  • RQ1복잡한 기계학습 예측자를 사용할 때 편향을 유발하지 않고도 온라인 실험 추정기의 분산을 줄이기 위해 기계학습 모델을 활용할 수 있는가?
  • RQ2복잡한 기계학습 예측자를 사용할 경우, 교차적합을 어떻게 활용하여 신뢰구간의 점근적 타당성을 보장할 수 있는가?
  • RQ3기계학습 예측이 결과와 상관관계가 없을 경우 추정기의 최악의 성능은 어떠한가?
  • RQ4다변량 비선형 기계학습 예측자를 사용할 경우, 단변량 사전 실험 결과 조정과 비교해 실제로 얼마나 많은 분산 감소를 달성할 수 있는가?
  • RQ5대규모 온라인 실험 플랫폼에서 생산적 사용을 위해 이 방법을 효율적으로 확장할 수 있는가?

주요 결과

  • 48개의 일반적인 Facebook 메트릭에서 A/A 테스트를 수행한 결과, MLRATE는 표준 차분-평균 추정기 대비 분산을 70% 이상 감소시켰다.
  • 사전 실험 결과 값만을 사용한 단변량 회귀 조정과 비교해 MLRATE는 약 19% 낮은 분산을 달성했다.
  • 일부 메트릭에서는 분산 감소율이 50%를 초과하여 통계적 검정력이 크게 향상되었다.
  • 기계학습 예측이 결과와 상관관계가 없을 경우에도, MLRATE는 난이도 있는 신뢰구간의 점근적 타당성을 유지한다.
  • 이론적 분석을 통해 일반 조건 하에서 일致성과 점근적 정규성을 확인하였으며, 기계학습 성능이 열악한 경우에도 강건함을 입증했다.
  • 사전에 계산된 예측값과 효율적인 교차적합 절차를 통해 계산적 확장성이 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.