Skip to main content
QUICK REVIEW

[论文解读] Long-term Causal Inference Under Persistent Confounding via Data Combination

Guido W. Imbens, Nathan Kallus|arXiv (Cornell University)|Feb 15, 2022
Advanced Causal Inference Techniques被引用 10
一句话总结

本文提出了一种新颖的识别与估计策略,利用在持续混淆(persistent confounding)条件下结合实验与观察数据来估计长期因果效应——即未观测到的因素同时影响短期结果与长期结果。通过利用多个短期结果的时序结构作为未观测混淆变量的代理变量,作者开发了具有渐近正态性保证的双重稳健估计量,即使其中一个干扰模型设定错误,也能保证有效推断。

ABSTRACT

We study the identification and estimation of long-term treatment effects when both experimental and observational data are available. Since the long-term outcome is observed only after a long delay, it is not measured in the experimental data, but only recorded in the observational data. However, both types of data include observations of some short-term outcomes. In this paper, we uniquely tackle the challenge of persistent unmeasured confounders, i.e., some unmeasured confounders that can simultaneously affect the treatment, short-term outcomes and the long-term outcome, noting that they invalidate identification strategies in previous literature. To address this challenge, we exploit the sequential structure of multiple short-term outcomes, and develop three novel identification strategies for the average long-term treatment effect. We further propose three corresponding estimators and prove their asymptotic consistency and asymptotic normality. We finally apply our methods to estimate the effect of a job training program on long-term employment using semi-synthetic data. We numerically show that our proposals outperform existing methods that fail to handle persistent confounders.

研究动机与目标

  • 解决当实验数据仅限于短期观测而观察数据受随时间持续存在的未观测变量混淆时,估计长期处理效应的挑战。
  • 在存在持续混淆(即未测量的混淆变量同时影响短期与长期结果)的情境下,利用实验与观察数据的组合,识别长期因果效应。
  • 开发利用多个短期结果的时序结构作为未观测混淆变量代理变量的识别策略。
  • 提供在弱正则性条件下具有渐近一致性和正态性的估计与推断方法,确保有效的统计推断。

提出的方法

  • 提出三种新颖的识别策略,通过将多个短期结果划分为三组,其中两组用作未观测混淆变量的代理变量。
  • 基于给定未观测混淆变量和可观测协变量的条件独立性假设,将长期结果与短期结果及处理变量关联起来。
  • 基于涉及干扰函数(包括结果回归和代理变量的倾向得分)的两个条件矩方程,构建估计量。
  • 通过结合结果回归与倾向得分模型,采用双重稳健估计,确保只要其中一个模型正确设定,估计结果即具有一致性。
  • 在正则性条件下推导出渐近正态性与一致性,从而支持有效的置信区间与假设检验。
  • 将该方法应用于来自职业培训计划的半合成数据,评估长期就业效应,结果表明在持续混淆下具有良好的稳健性。

实验结果

研究问题

  • RQ1当未观测混淆变量同时影响短期结果与长期结果,且实验数据仅限于短期观测时,能否识别长期因果效应?
  • RQ2如何利用多个短期结果的时序结构作为未观测混淆变量的代理变量,以支持长期因果推断?
  • RQ3在结合实验与观察数据并存在持续混淆的情况下,应采用何种估计与推断程序以确保渐近有效性?
  • RQ4在模型设定错误的情况下,所提方法在何种条件下能实现双重稳健性?
  • RQ5在有限样本下,该方法相较于现有方法在存在持续混淆的设定下表现如何?

主要发现

  • 所提出的识别策略通过将多个短期结果用作未观测混淆变量的代理变量,成功在持续混淆下恢复了平均长期处理效应。
  • 所得估计量在弱正则性条件下具有渐近正态性与一致性,双重稳健性确保即使两个干扰模型中有一个设定错误,推断结果依然有效。
  • 该方法优于以往假设无持续混淆或依赖于观察数据中不可检验的无混淆性条件的方法。
  • 在半合成职业培训数据上的实证评估表明,尽管存在持续的未观测混淆,该方法仍能提供准确且稳定的长期就业效应估计。
  • 利用时序短期结果作为代理变量,使得在标准方法失效的情况下仍能实现识别,尤其在未观测混淆变量同时影响短期与长期结果时表现突出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。