[论文解读] What Is the Value Added by Using Causal Machine Learning Methods in a Welfare Experiment Evaluation?
本研究评估因果机器学习(CML)方法在分析Jobs First福利实验时是否相较于传统估计量具有额外价值。通过使用随机森林和因果森林的双重机器学习方法,研究显示当建模大量协变量和连续处理效应时,CML方法能够支持理论上的劳动供给预测,从而提供传统CATE估计量因模型限制和协变量不足而错失的证据。
Recent studies have proposed causal machine learning (CML) methods to estimate conditional average treatment effects (CATEs). In this study, I investigate whether CML methods add value compared to conventional CATE estimators by re-evaluating Connecticut's Jobs First welfare experiment. This experiment entails a mix of positive and negative work incentives. Previous studies show that it is hard to tackle the effect heterogeneity of Jobs First by means of CATEs. I report evidence that CML methods can provide support for the theoretical labor supply predictions. Furthermore, I document reasons why some conventional CATE estimators fail and discuss the limitations of CML methods.
研究动机与目标
- 评估因果机器学习(CML)方法在评估Jobs First福利实验时是否相较于传统条件平均处理效应(CATE)估计量具有额外价值。
- 识别为何传统CATE估计量——尤其是局部常数模型——尽管数据可用,仍无法支持既定的劳动供给理论预测。
- 检查在Jobs First项目背景下,CATE与分位数处理效应(QTE)是否包含嵌套或等价信息。
- 评估在CML估计中,对混杂因子的调整以及高维协变量的重要性,以实现有效的因果推断。
提出的方法
- 采用双重机器学习(DML)方法,结合随机森林和因果森林估计器,以估计随机实验中的CATE。
- 使用修改后的结果方法,引入“厨房水槽”协变量,以包含所有可用的外生变量,用于效应异质性建模。
- 通过基于树的算法(如随机森林)实现数据驱动的子群划分,以避免手动选择分层,降低过拟合风险。
- 将CML方法得到的CATE估计与Bitler、Gelbach和Hoynes(2006)的QTE进行比较,以评估信息重叠程度。
- 实施Kolmogorov-Smirnov检验,正式检验潜在收益与模拟收益分布的相等性,评估CATE与QTE是否嵌套。
- 在DML框架中实施混杂因子调整,以纠正高维协变量空间中的微小不平衡。

实验结果
研究问题
- RQ1在Jobs First实验中,因果机器学习方法是否相较于传统CATE估计量,能为理论劳动供给预测提供更强的经验支持?
- RQ2为何传统CATE估计量(如局部常数模型)尽管数据可用,仍无法检测到与劳动供给理论一致的效应异质性?
- RQ3在本情境下,通过CML方法估计的CATE在多大程度上包含与分位数处理效应(QTE)相同的信息?
- RQ4在使用机器学习方法进行有效CATE估计时,混杂因子调整和高维协变量的纳入有多关键?
- RQ5CML方法能否检测到收益分布中的质量点(如零收益质量点),而QTE可以捕捉到这些点?
主要发现
- 因果机器学习方法,特别是使用随机森林和因果森林并结合‘厨房水槽’协变量时,成功为Jobs First实验中的理论劳动供给预测提供了经验支持。
- 传统CATE估计量失败的主要原因在于次优的子群选择、组内恒定效应假设以及协变量集不足,即使数据中存在相关异质性。
- 即使使用随机森林估计器,未进行混杂因子调整的修改结果方法也无法支持理论预测,凸显在高维设置中混杂因子调整的必要性。
- CATE与QTE不包含相同信息:Kolmogorov-Smirnov检验拒绝了潜在收益与模拟收益分布相等的原假设,表明CATE无法完全捕捉如零收益点等质量点。
- CML方法无法检测结果分布中的质量点,这限制了其全面表征政策全分布影响的能力。
- CML的价值具有条件性:仅当包含大量相关协变量并建模连续处理效应时,其优势才会显现,而非在模型假设受限时。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。