Skip to main content
QUICK REVIEW

[论文解读] Causal Inference: A Missing Data Perspective

Peng Ding, Fan Li|arXiv (Cornell University)|Dec 17, 2017
Advanced Causal Inference Techniques参考文献 116被引用 6
一句话总结

本文将因果推断视为一个缺失数据问题,表明潜在结果——因果分析的核心——本质上是缺失的,如同缺失数据问题中的数据一样。在可忽略处理分配的假设下,系统地将因果推断方法(例如,插补、加权、双重稳健估计)映射到缺失数据分析中的对应方法,并为有限样本和超总体估计量提供了统一的推断框架,涵盖频率学派、贝叶斯和随机化基础方法。

ABSTRACT

Inferring causal effects of treatments is a central goal in many disciplines. The potential outcomes framework is a main statistical approach to causal inference, in which a causal effect is defined as a comparison of the potential outcomes of the same units under different treatment conditions. Because for each unit at most one of the potential outcomes is observed and the rest are missing, causal inference is inherently a missing data problem. Indeed, there is a close analogy in the terminology and the inferential framework between causal inference and missing data. Despite the intrinsic connection between the two subjects, statistical analyses of causal inference and missing data also have marked differences in aims, settings and methods. This article provides a systematic review of causal inference from the missing data perspective. Focusing on ignorable treatment assignment mechanisms, we discuss a wide range of causal inference methods that have analogues in missing data analysis, such as imputation, inverse probability weighting and doubly-robust methods. Under each of the three modes of inference--Frequentist, Bayesian, and Fisherian randomization--we present the general structure of inference for both finite-sample and super-population estimands, and illustrate via specific examples. We identify open questions to motivate more research to bridge the two fields.

研究动机与目标

  • 通过突出其在处理缺失潜在结果方面的共同基础,建立因果推断与缺失数据分析之间的概念和方法论桥梁。
  • 阐明标准因果推断方法(如逆概率加权、插补和双重稳健估计)在缺失数据文献中是否存在直接对应方法。
  • 统一因果推断中有限样本和超总体估计量的频率学派、贝叶斯和费希尔随机化方法的推断框架。
  • 识别可进一步整合因果推断与缺失数据方法论的开放研究问题,特别是在敏感性分析和处理不可忽略机制方面。
  • 倡导使用稳健的开源软件工具(例如,R 包、Stan)来在实际研究中实现和传播这些整合方法。

提出的方法

  • 通过将未观测到的潜在结果视为缺失数据,将因果推断形式化为缺失数据框架,其中观测结果对应于分配的处理。
  • 在可忽略处理分配下,应用标准缺失数据技术——插补、逆概率加权和双重稳健估计——来估计平均处理效应(ATE)。
  • 在三种推断范式(频率学派、贝叶斯和费希尔随机化)下,推导超总体(PATE)和有限样本(SATE)估计量的推断程序。
  • 在 SUTVA(稳定单位处理值假设)下使用潜在结果框架,将因果效应定义为潜在结果的对比,其中每个单位仅观测到一个结果。
  • 引入敏感性分析技术,以评估因果估计对无混淆性假设违反的稳健性,类似于不可忽略缺失数据建模中的方法。
  • 提出结合外部数据源和多重插补策略,以在协变量、处理或结果中存在非故意缺失数据的情境下改善推断。

实验结果

研究问题

  • RQ1在可忽略分配机制下,因果推断方法(如插补、加权和双重稳健估计)如何映射到缺失数据分析中的对应方法?
  • RQ2因果推断中的推断框架(频率学派、贝叶斯、费希尔随机化)与缺失数据分析中的推断框架之间存在哪些结构性类比?
  • RQ3有限样本(SATE)与超总体(PATE)估计量之间的区别如何影响因果推断和缺失数据情境下的推断策略?
  • RQ4不可忽略处理分配或缺失数据机制的含义是什么?如何将缺失数据中的敏感性分析方法适应到因果推断情境中?
  • RQ5如何处理协变量、处理或结果中的非故意缺失数据,以保持因果推断的有效性?

主要发现

  • 因果推断本质上是一个缺失数据问题,因为每个单位仅能观测到一个潜在结果,而另一个始终是反事实且缺失的。
  • 因果推断中的插补、逆概率加权和双重稳健方法在缺失数据分析中具有直接对应方法,二者具有共享的理论基础和推断结构。
  • SATE(有限样本)与PATE(超总体)估计量之间的区别导致即使在相同的识别假设下,也会产生不同的推断和计算策略。
  • 因果推断中的敏感性分析——特别是围绕无混淆性——与不可忽略缺失数据中的方法(如选择模型和模式混合模型)具有类比性,尽管实现方式和关注重点有所不同。
  • 协变量、处理或结果中的非故意缺失数据可能显著影响因果推断,且插补方法的选择必须与缺失性的本质仔细匹配。
  • 开源软件工具(如 R 包,例如 twang、MatchIt、lme4)和 Stan 对于在实际研究中实现和传播这些整合方法至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。