Skip to main content
QUICK REVIEW

[论文解读] On the role of surrogates in the efficient estimation of treatment effects with limited outcome data

Nathan Kallus, Xiaojie Mao|arXiv (Cornell University)|Mar 27, 2020
Advanced Causal Inference Techniques参考文献 64被引用 19
一句话总结

本文提出使用代理结果来提高在主要结果数据有限时平均处理效应(ATE)估计的效率。通过利用半参数效率理论和双重稳健的机器学习估计器,作者推导出最优结合主要结果与代理结果的影响函数,即使在主要结果稀疏的情况下也能显著降低方差,尤其当代理结果丰富且具有预测力时效果更明显。

ABSTRACT

In many experimental and observational studies, the outcome of interest is often difficult or expensive to observe, reducing effective sample sizes for estimating average treatment effects (ATEs) even when identifiable. We study how incorporating data on units for which only surrogate outcomes not of primary interest are observed can increase the precision of ATE estimation. We refrain from imposing stringent surrogacy conditions, which permit surrogates as perfect replacements for the target outcome. Instead, we supplement the available, albeit limited, observations of the target outcome with abundant observations of surrogate outcomes, without any assumptions beyond unconfounded treatment assignment and missingness and corresponding overlap conditions. To quantify the potential gains, we derive the difference in efficiency bounds on ATE estimation with and without surrogates, both when an overwhelming or comparable number of units have missing outcomes. We develop robust ATE estimation and inference methods that realize these efficiency gains. We empirically demonstrate the gains by studying long-term-earning effects of job training.

研究动机与目标

  • 解决在主要结果数据昂贵或样本量有限时估计平均处理效应(ATE)的挑战。
  • 克服仅依赖代理结果的局限性,因为代理结果的非完美中介可能导致偏差或无效的因果结论。
  • 在缺失在随机(MAR)假设下,量化在ATE估计中引入代理结果所带来的效率增益。
  • 开发一种灵活的双重稳健估计框架,利用主要结果和代理结果,而无需强代理有效性条件。
  • 通过在真实世界数据中应用该方法分析职业培训对长期收入影响的实证研究,展示该方法的实用性。

提出的方法

  • 推导在有和无代理结果的设定下ATE估计的半参数效率界,建立方差降低的理论极限。
  • 在主要结果缺失在随机(MAR)假设下,制定一个结合主要结果与代理结果的高效影响函数。
  • 提出一种基于灵活机器学习方法(如随机森林、梯度提升、LASSO)的双重稳健ATE估计器,用于估计影响函数中的异质性函数。
  • 通过允许结果回归模型或倾向得分模型之一被一致估计,同时在另一模型正确设定下保持效率,确保估计的稳健性。
  • 采用两阶段估计策略:首先估计异质性参数(如结果回归、倾向得分、代理响应模型),然后使用影响函数计算高效ATE估计量。
  • 在正则条件下,建立所提估计量渐近正态性和效率的理论保证。

实验结果

研究问题

  • RQ1当主要结果数据有限时,引入代理结果可实现多大的效率增益?
  • RQ2在存在代理数据的情况下,ATE估计量方差的理论下限是什么?
  • RQ3如何最优地将稀疏主要结果与代理结果结合,以在不依赖强代理有效性假设的前提下提高估计效率?
  • RQ4代理结果的丰富程度和预测能力对效率增益大小有何影响?
  • RQ5基于机器学习的双重稳健估计器是否能在主要数据有限的有限样本中达到半参数效率界?

主要发现

  • 使用代理结果带来的效率增益可量化为有代理与无代理情况下的半参数方差界之差,其大小取决于给定协变量下代理响应模型的条件方差。
  • 当代理观测值占主导地位时,效率增益与代理对主要结果的预测能力成正比,尤其体现在估计潜在结果方差的降低上。
  • 所提出的双重稳健估计器在结果回归模型或倾向得分模型之一正确设定时,即使另一模型通过机器学习方法估计,也能达到半参数效率界。
  • 在职业培训数据上的实证结果表明,引入代理结果(如短期就业状态)相比仅使用主要结果,显著降低了ATE估计的标准误。
  • 即使代理模型通过随机森林、梯度提升或LASSO等灵活方法估计,该方法仍保持稳健与高效,展示了在不同建模方法下的实际应用价值。
  • 当代理结果对主要结果具有强预测能力,且代理观测数远超主要结果观测数时,效率提升最为显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。