Skip to main content
QUICK REVIEW

[论文解读] Machine Learning for Variance Reduction in Online Experiments

Yongyi Guo, Dominic Coey|arXiv (Cornell University)|Jun 14, 2021
Advanced Causal Inference Techniques参考文献 28被引用 9
一句话总结

本文提出 MLRATE,一种基于机器学习回归调整的处理效应估计器,结合交叉拟合与稳健线性回归,以降低在线 A/B 测试中的方差。通过利用协变量对结果的预测模型,MLRATE 在机器学习预测效果较差的情况下仍保持渐近有效性,其方差相比差值均值法降低高达 70%,相比单变量事前调整降低 19%。

ABSTRACT

We consider the problem of variance reduction in randomized controlled trials, through the use of covariates correlated with the outcome but independent of the treatment. We propose a machine learning regression-adjusted treatment effect estimator, which we call MLRATE. MLRATE uses machine learning predictors of the outcome to reduce estimator variance. It employs cross-fitting to avoid overfitting biases, and we prove consistency and asymptotic normality under general conditions. MLRATE is robust to poor predictions from the machine learning step: if the predictions are uncorrelated with the outcomes, the estimator performs asymptotically no worse than the standard difference-in-means estimator, while if predictions are highly correlated with outcomes, the efficiency gains are large. In A/A tests, for a set of 48 outcome metrics commonly monitored in Facebook experiments the estimator has over 70% lower variance than the simple difference-in-means estimator, and about 19% lower variance than the common univariate procedure which adjusts only for pre-experiment values of the outcome.

研究动机与目标

  • 开发一种实用且可扩展的方法,利用机器学习预测器降低在线实验中的方差。
  • 确保估计器在机器学习预测与结果无关时仍具鲁棒性。
  • 在一般条件下证明估计量的渐近正态性及朴素置信区间的有效性。
  • 在 48 个 Facebook 指标的真实 A/A 测试中展示显著的方差降低效果。
  • 解决在大规模在线实验平台中部署基于机器学习的调整所面临的可扩展性与计算挑战。

提出的方法

  • MLRATE 使用交叉拟合,将机器学习模型在互不相交的数据子集上进行训练,确保预测结果与估计样本独立。
  • 在后续的线性回归模型中将机器学习预测的结果作为协变量,以调整处理效应。
  • 通过控制机器学习步骤带来的估计偏差,确保估计量的渐近正态性及朴素置信区间的有效性。
  • 该方法与模型无关,不假设机器学习模型收敛至真实条件均值,也不假设结果关系为线性。
  • 估计器具有鲁棒性:若机器学习预测与结果无关,则方差不会劣于差值均值法。
  • 通过 Neumann 级数展开与高概率界,建立在弱正则性条件下渐近分布性质。

实验结果

研究问题

  • RQ1能否在不引入偏差的前提下,利用机器学习模型降低在线实验估计器的方差?
  • RQ2如何利用交叉拟合确保在使用复杂机器学习预测器时置信区间的渐近有效性?
  • RQ3若机器学习预测与结果无关,估计器的最坏情况性能如何?
  • RQ4与单变量事前调整相比,使用多变量、非线性机器学习预测器在实际中可实现多大程度的方差降低?
  • RQ5该方法能否在大规模在线实验平台中实现高效可扩展的生产级部署?

主要发现

  • 在 48 个常见 Facebook 指标的 A/A 测试中,MLRATE 相比标准差值均值估计器将方差降低了 70% 以上。
  • MLRATE 的方差相比仅使用实验前结果值的单变量回归调整降低了约 19%。
  • 在某些指标上,方差降低超过 50%,显著提升了统计功效。
  • 即使机器学习预测与结果无关,估计器仍保持朴素置信区间的渐近有效性。
  • 理论分析证实了在一般条件下的一致性与渐近正态性,且对机器学习性能不佳具有鲁棒性。
  • 通过预计算预测与高效的交叉拟合流程,计算可扩展性是可行的。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。