Skip to main content
QUICK REVIEW

[论文解读] MissDeepCausal: Causal Inference from Incomplete Data Using Deep Latent Variable Models

Imke Mayer, Julie Josse|arXiv (Cornell University)|Feb 25, 2020
Advanced Causal Inference Techniques参考文献 40被引用 6
一句话总结

MissDeepCausal 提出了一种基于变分自编码器的深度潜在变量模型,用于在缺失协变量的观察数据中估计因果效应,通过潜在混杂因素后验样本的多重插补方法实现。在缺失在随机(MAR)假设下,通过与双重稳健估计器结合,该方法在偏差和均方误差方面达到最先进性能,尤其在非线性数据生成机制下表现优异。

ABSTRACT

Inferring causal effects of a treatment, intervention or policy from observational data is central to many applications. However, state-of-the-art methods for causal inference seldom consider the possibility that covariates have missing values, which is ubiquitous in many real-world analyses. Missing data greatly complicate causal inference procedures as they require an adapted unconfoundedness hypothesis which can be difficult to justify in practice. We circumvent this issue by considering latent confounders whose distribution is learned through variational autoencoders adapted to missing values. They can be used either as a pre-processing step prior to causal inference but we also suggest to embed them in a multiple imputation strategy to take into account the variability due to missing values. Numerical experiments demonstrate the effectiveness of the proposed methodology especially for non-linear models compared to competitors.

研究动机与目标

  • 解决现有因果推断方法在真实世界观察数据中无法处理协变量缺失的关键缺陷。
  • 开发一种灵活的非线性因果效应估计方法,考虑缺失数据带来的不确定性,且不依赖于强参数假设。
  • 将深度潜在变量模型与多重插补及双重稳健估计相结合,提升处理效应估计的稳健性与准确性。
  • 提供一种可扩展且模块化的框架,超越线性模型,能够处理复杂且高维的缺失数据模式。

提出的方法

  • 在 MAR 假设下,使用改进似然函数的变分自编码器(VAEs),将不完整的协变量建模为潜在混杂因素的噪声代理。
  • 通过随机抽样利用潜在变量的完整后验分布,而非仅使用点估计,以捕捉缺失数据带来的不确定性。
  • 提出一种多重插补策略:从潜在混杂因素的后验样本中抽取多个样本,并将其作为下游双重稳健估计器的输入。
  • 将潜在混杂因素的插补结果与双重稳健估计器(如 DR log-linear 和 DR 随机森林)结合,确保在模型误设情况下的一致性。
  • 应用重要性抽样以校正插补过程中的选择偏差,增强对缺失机制的鲁棒性。
  • 采用受贝叶斯倾向得分方法启发的模块化设计,支持与现有因果推断流程的即插即用式集成。

实验结果

研究问题

  • RQ1深度潜在变量模型能否有效从未完整协变量中恢复潜在混杂因素,从而改善因果效应估计?
  • RQ2在非线性数据生成机制下,MissDeepCausal 在偏差和均方误差方面与最先进方法相比表现如何?
  • RQ3通过多重插补方式利用潜在变量的完整后验分布,是否能获得比点估计更稳健、更准确的处理效应估计?
  • RQ4当真实数据生成模型为非线性时,MissDeepCausal 在缺失程度逐渐增加的情况下,其性能保持程度如何?

主要发现

  • 在 IHDP 基准测试中,MissDeepCausal 在所有缺失水平下均达到最低的平均绝对误差(Δ),当使用 DR rf 估计器时,在 50% 缺失水平下 Δ = 0.18 ± 0.01。
  • 该方法显著优于对比方法,如 MI(在 50% 缺失水平下 Δ = 1.54 ± 0.03)和 CEVAE(在 50% 缺失水平下 Δ = 0.38 ± 0.02)。
  • MissDeepCausal 在不同缺失水平(0%、10%、30%、50%)下均保持稳定性能,展现出对数据不完整性具有强鲁棒性。
  • 基于潜在混杂因素后验样本的多重插补策略,其估计精度优于单重插补或完整案例分析。
  • 与 CEVAE 和 MI 相比,MissDeepCausal 表现更优,尤其在底层数据生成过程为非线性时,凸显其在复杂真实场景中的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。