Skip to main content
QUICK REVIEW

[论文解读] Statistical Inference for Heterogeneous Treatment Effects Discovered by Generic Machine Learning in Randomized Experiments

Kosuke Imai, Michael Lingzhi Li|arXiv (Cornell University)|Mar 28, 2022
Advanced Causal Inference Techniques被引用 4
一句话总结

本文为随机实验中由通用机器学习算法识别的异质处理效应构建了一个有效的统计推断框架。通过利用Neyman的重复抽样方法和基于随机化的推断,该方法在不依赖机器学习算法一致性的情况下,构建了组平均处理效应(GATES)的置信区间与非参数检验,确保在小样本且协变量较多时的稳健性。

ABSTRACT

Researchers are increasingly turning to machine learning (ML) algorithms to investigate causal heterogeneity in randomized experiments. Despite their promise, ML algorithms may fail to accurately ascertain heterogeneous treatment effects under practical settings with many covariates and small sample size. In addition, the quantification of estimation uncertainty remains a challenge. We develop a general approach to statistical inference for heterogeneous treatment effects discovered by a generic ML algorithm. We apply the Neyman's repeated sampling framework to a common setting, in which researchers use an ML algorithm to estimate the conditional average treatment effect and then divide the sample into several groups based on the magnitude of the estimated effects. We show how to estimate the average treatment effect within each of these groups, and construct a valid confidence interval. In addition, we develop nonparametric tests of treatment effect homogeneity across groups, and rank-consistency of within-group average treatment effects. The validity of our methodology does not rely on the properties of ML algorithms because it is solely based on the randomization of treatment assignment and random sampling of units. Finally, we generalize our methodology to the cross-fitting procedure by accounting for the additional uncertainty induced by the random splitting of data.

研究动机与目标

  • 解决在小样本随机实验中,通过机器学习发现的处理效应缺乏可靠统计推断的问题。
  • 开发一种方法,无论机器学习算法表现如何均保持有效性,仅依赖于随机处理分配与抽样。
  • 实现对处理效应异质性及估计效应在各组间排序一致性性的正式假设检验。
  • 考虑机器学习应用中常见的数据分割与交叉拟合程序所带来的不确定性。
  • 为应用研究人员提供一个实用的开源R包(evalITR),以实现该方法。

提出的方法

  • 将Neyman的重复抽样框架应用于基于机器学习预测的条件平均处理效应(CATE)对单位进行分组后,估计组平均处理效应(GATES)。
  • 仅基于处理的随机分配与单位的抽样,不依赖机器学习特性,构建渐近有效的GATES置信区间。
  • 开发非参数检验,用于检验:(1) 各组间处理效应的同质性;(2) 有序分组中GATES的排序一致性。
  • 通过考虑随机将数据划分为若干折所带来的额外不确定性,将方法推广至交叉拟合。
  • 使用样本分割或交叉拟合,分别在训练折上估计CATE,在验证折上估计GATES,然后汇总结果。
  • 采用基于随机化的推断原则,确保即使在机器学习算法不一致或有偏差时,推断依然有效。

实验结果

研究问题

  • RQ1我们能否在随机实验中,为机器学习算法识别的组内平均处理效应构建有效的置信区间?
  • RQ2如何检验由机器学习预测识别的各组间处理效应是否同质?
  • RQ3是否存在统计证据表明组平均处理效应(GATES)的排序与机器学习预测的CATE分数一致?
  • RQ4与简单样本分割相比,交叉拟合在小样本中如何提升推断效率?
  • RQ5该方法在机器学习算法无法一致估计CATE时,能在多大程度上确保有效推断?

主要发现

  • Causal Forest在样本分割与交叉拟合两种情况下,均识别出顶层五分位组具有统计显著的正向GATES(估计值为$20,000),且交叉拟合下的置信区间更窄。
  • 在交叉拟合下,Causal Forest在0.1%水平上拒绝了处理效应同质性的原假设,而LASSO在10%水平上拒绝,表明存在强烈的异质性证据。
  • BART在两种设定下均未能拒绝同质性原假设,表明其未检测到各组间处理效应的显著差异。
  • Causal Forest、BART与LASSO三种算法均未能拒绝GATES排序一致性的原假设,表明无强证据表明排序不可靠。
  • 交叉拟合产生的GATES估计更精确,置信区间比样本分割更窄,证实其效率更高。
  • 该方法在极简假设下依然有效——仅需随机化与抽样——即使机器学习算法不一致或校准不佳,也具有稳健性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。