[论文解读] Estimation of Conditional Average Treatment Effects with High-Dimensional Data
本文提出一种两阶段机器学习方法,在无混淆性假设下估计高维设置中的条件平均处理效应(CATE)。该方法通过机器学习进行高维干扰函数估计,随后采用低维局部线性回归生成降维后的CATE函数,具备理论保证,并通过乘子自展法实现统一推断,模拟和对母亲吸烟对出生体重影响的实证应用中表现出稳健性能。
Given the unconfoundedness assumption, we propose new nonparametric estimators for the reduced dimensional conditional average treatment effect (CATE) function. In the first stage, the nuisance functions necessary for identifying CATE are estimated by machine learning methods, allowing the number of covariates to be comparable to or larger than the sample size. The second stage consists of a low-dimensional local linear regression, reducing CATE to a function of the covariate(s) of interest. We consider two variants of the estimator depending on whether the nuisance functions are estimated over the full sample or over a hold-out sample. Building on Belloni at al. (2017) and Chernozhukov et al. (2018), we derive functional limit theory for the estimators and provide an easy-to-implement procedure for uniform inference based on the multiplier bootstrap. The empirical application revisits the effect of maternal smoking on a baby's birth weight as a function of the mother's age.
研究动机与目标
- 解决当协变量数量相对于样本量较大时估计异质处理效应的挑战。
- 开发一种非参数CATE估计器,将高维协变量简化为对感兴趣协变量的可管理函数。
- 即使在高维干扰参数存在的情况下,也确保CATE函数的可靠统一推断。
- 在不同数据维度和稀疏性条件下,比较全样本与交叉拟合估计器的性能。
- 提供一种实用、可实现的程序,用于构建CATE函数的统一置信带。
提出的方法
- 第一阶段:使用Lasso或其他正则化估计器等机器学习方法,估计高维干扰函数(如结果和倾向得分回归),以处理高维协变量。
- 第二阶段:对估计的干扰函数执行低维局部线性回归,以获得感兴趣变量的降维CATE函数。
- 提出两种变体:一种使用全样本进行两阶段估计,另一种使用交叉拟合(样本分割)以减少偏差并改善推断。
- 理论框架基于Belloni等(2017)和Chernozhukov等(2018)的研究,建立了估计器的功能极限理论。
- 通过乘子自展程序实现统一推断,以构建CATE函数整个函数的可靠置信带。
- 通过双重稳健性机制对模型误设具有鲁棒性,并能处理高维数据中的严格和近似稀疏性。

实验结果
研究问题
- RQ1当协变量数量较大甚至超过样本量时,如何一致地估计条件平均处理效应(CATE)?
- RQ2在高维设置中,使用机器学习进行干扰函数估计对CATE估计器的有限样本性能有何影响?
- RQ3与全样本估计相比,交叉拟合在多大程度上改善了CATE函数的有限样本性质和统一推断的有效性?
- RQ4在不同稀疏程度和数据维度下,所提出的估计器在统一置信带的覆盖概率上能保持多大程度的正确性?
- RQ5与现有双重稳健方法相比,该方法在经验覆盖概率和临界值估计方面表现如何?
主要发现
- 交叉拟合估计器在所有模拟设计中均实现了接近名义水平(如95%和99%)的经验覆盖,即使在p=30、N=500时也表现良好。
- 全样本估计器在高维设置(p=30,N=500)下经验覆盖略低,尤其在90%置信水平下,但仍接近名义水平。
- 乘子自展程序能提供准确的临界值,其平均临界值接近理论分位数,且临界值的标准差较低。
- 在高维设置中,Gumbel近似对临界值表现良好,大多数情况下覆盖概率接近1.000。
- 双重稳健方法(LOW)在高维模型中表现出严重的大小扭曲,当p=30、N=2000时,99%置信水平下的经验覆盖降至0.014。
- 对母亲吸烟与出生体重的实证应用表明,该方法生成了可解释、平滑的CATE曲线,且随母亲年龄变化明显,支持了该方法的实际应用价值。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。