Skip to main content
QUICK REVIEW

[论文解读] What Is the Value Added by Using Causal Machine Learning Methods in a Welfare Experiment Evaluation?

Anthony Strittmatter|arXiv (Cornell University)|Dec 16, 2018
Advanced Causal Inference Techniques被引用 6
一句话总结

本研究评估因果机器学习(CML)方法在分析Jobs First福利实验时是否相较于传统估计量具有额外价值。通过使用随机森林和因果森林的双重机器学习方法,研究显示当建模大量协变量和连续处理效应时,CML方法能够支持理论上的劳动供给预测,从而提供传统CATE估计量因模型限制和协变量不足而错失的证据。

ABSTRACT

Recent studies have proposed causal machine learning (CML) methods to estimate conditional average treatment effects (CATEs). In this study, I investigate whether CML methods add value compared to conventional CATE estimators by re-evaluating Connecticut's Jobs First welfare experiment. This experiment entails a mix of positive and negative work incentives. Previous studies show that it is hard to tackle the effect heterogeneity of Jobs First by means of CATEs. I report evidence that CML methods can provide support for the theoretical labor supply predictions. Furthermore, I document reasons why some conventional CATE estimators fail and discuss the limitations of CML methods.

研究动机与目标

  • 评估因果机器学习(CML)方法在评估Jobs First福利实验时是否相较于传统条件平均处理效应(CATE)估计量具有额外价值。
  • 识别为何传统CATE估计量——尤其是局部常数模型——尽管数据可用,仍无法支持既定的劳动供给理论预测。
  • 检查在Jobs First项目背景下,CATE与分位数处理效应(QTE)是否包含嵌套或等价信息。
  • 评估在CML估计中,对混杂因子的调整以及高维协变量的重要性,以实现有效的因果推断。

提出的方法

  • 采用双重机器学习(DML)方法,结合随机森林和因果森林估计器,以估计随机实验中的CATE。
  • 使用修改后的结果方法,引入“厨房水槽”协变量,以包含所有可用的外生变量,用于效应异质性建模。
  • 通过基于树的算法(如随机森林)实现数据驱动的子群划分,以避免手动选择分层,降低过拟合风险。
  • 将CML方法得到的CATE估计与Bitler、Gelbach和Hoynes(2006)的QTE进行比较,以评估信息重叠程度。
  • 实施Kolmogorov-Smirnov检验,正式检验潜在收益与模拟收益分布的相等性,评估CATE与QTE是否嵌套。
  • 在DML框架中实施混杂因子调整,以纠正高维协变量空间中的微小不平衡。
Figure 1: Earnings and welfare transfers under AFDC and Jobs First.
Figure 1: Earnings and welfare transfers under AFDC and Jobs First.

实验结果

研究问题

  • RQ1在Jobs First实验中,因果机器学习方法是否相较于传统CATE估计量,能为理论劳动供给预测提供更强的经验支持?
  • RQ2为何传统CATE估计量(如局部常数模型)尽管数据可用,仍无法检测到与劳动供给理论一致的效应异质性?
  • RQ3在本情境下,通过CML方法估计的CATE在多大程度上包含与分位数处理效应(QTE)相同的信息?
  • RQ4在使用机器学习方法进行有效CATE估计时,混杂因子调整和高维协变量的纳入有多关键?
  • RQ5CML方法能否检测到收益分布中的质量点(如零收益质量点),而QTE可以捕捉到这些点?

主要发现

  • 因果机器学习方法,特别是使用随机森林和因果森林并结合‘厨房水槽’协变量时,成功为Jobs First实验中的理论劳动供给预测提供了经验支持。
  • 传统CATE估计量失败的主要原因在于次优的子群选择、组内恒定效应假设以及协变量集不足,即使数据中存在相关异质性。
  • 即使使用随机森林估计器,未进行混杂因子调整的修改结果方法也无法支持理论预测,凸显在高维设置中混杂因子调整的必要性。
  • CATE与QTE不包含相同信息:Kolmogorov-Smirnov检验拒绝了潜在收益与模拟收益分布相等的原假设,表明CATE无法完全捕捉如零收益点等质量点。
  • CML方法无法检测结果分布中的质量点,这限制了其全面表征政策全分布影响的能力。
  • CML的价值具有条件性:仅当包含大量相关协变量并建模连续处理效应时,其优势才会显现,而非在模型假设受限时。
Figure 2: CATEs by difference between earnings and FPL (per quarter).
Figure 2: CATEs by difference between earnings and FPL (per quarter).

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。