[论文解读] Causal Discovery from Incomplete Data: A Deep Learning Approach
本文提出了一种名为生成因果学习(Imputated Causal Learning, ICL)的深度学习框架,通过迭代地结合生成对抗网络(GANs)和变分自编码器(VAEs)进行缺失数据填补与因果结构发现。ICL 在 MCAR 和 MAR 缺失机制下均优于当前最先进方法,在合成数据和真实世界数据(包括 AutoMPG 数据集,SHD=9)上实现了更低的结构汉明距离(Structural Hamming Distance, SHD)。
As systems are getting more autonomous with the development of artificial intelligence, it is important to discover the causal knowledge from observational sensory inputs. By encoding a series of cause-effect relations between events, causal networks can facilitate the prediction of effects from a given action and analyze their underlying data generation mechanism. However, missing data are ubiquitous in practical scenarios. Directly performing existing casual discovery algorithms on partially observed data may lead to the incorrect inference. To alleviate this issue, we proposed a deep learning framework, dubbed Imputated Causal Learning (ICL), to perform iterative missing data imputation and causal structure discovery. Through extensive simulations on both synthetic and real data, we show that ICL can outperform state-of-the-art methods under different missing data mechanisms.
研究动机与目标
- 为解决缺失数据存在时因果发现的挑战,因为这会损害标准因果发现算法的性能。
- 开发一种联合学习框架,同时优化数据填补与因果结构估计,而非将二者视为独立步骤。
- 处理在现实世界观察性数据中常见的缺失完全随机(Missing Completely at at Random, MCAR)和缺失随机(Missing at Random, MAR)机制。
- 通过迭代填补与骨架学习后利用因果对之间的不对称性,提高因果发现的准确性。
- 减少基于删除法的填补策略所带来的偏差与信息损失,这些策略会丢弃不完整的样本。
提出的方法
- ICL 使用结合变分自编码器(Variational Autoencoders, VAEs)与生成对抗网络(Generative Adversarial Networks, GANs)的深度生成模型,以建模不完整数据的联合分布。
- 该框架执行迭代优化:首先使用 VAE-GAN 填补缺失值,然后通过可微分的因果发现模块优化因果骨架。
- 因果骨架学习识别变量之间的全局依赖结构,表示为无向边的DAG(有向无环图)。
- 随后利用功能因果模型(Functional Causal Models, FCMs)中因果对的不对称性,进行成对因果方向识别,利用原因与结果具有不同统计特性的事实。
- 迭代过程在填补与因果结构优化之间交替进行,使数据恢复与因果推断相互促进。
- 该框架通过复合损失函数端到端训练,该损失函数平衡重建误差、因果结构一致性与因果方向准确性。
实验结果
研究问题
- RQ1是否能够通过深度学习框架联合优化缺失数据填补与因果结构发现,从而在性能上超越顺序处理方法?
- RQ2在 MCAR 与 MAR 缺失机制下,填补与因果发现的迭代耦合如何影响准确性?
- RQ3在数据不完整的情况下,利用因果对之间的不对称性是否能提升因果方向识别的性能?
- RQ4ICL 在结构汉明距离(Structural Hamming Distance, SHD)方面与当前最先进方法(如 GAN-DAG、LD-DAG 和基于 GES 的算法)相比表现如何?
- RQ5数据删除或单独进行填补与因果发现处理,在不完整数据上对因果发现性能的损害程度有多大?
主要发现
- 在 MCAR 与 MAR 机制下,ICL 在包含 10%、30% 和 50% 缺失数据的合成数据集上,SHD 显著低于所有基线方法。
- 在 AutoMPG 数据集上,当缺失率为 10% 且为 MAR 机制时,ICL 的 SHD 为 9,优于 GAN-DAG(SHD=11)。
- GAN-DAG 采用非迭代方式先填补后进行因果发现,其性能劣于 ICL,表明迭代优化至关重要。
- 基于删除法的填补方法(如删除含缺失值的样本)会导致模型偏差,且随着缺失率超过 5% 时性能显著下降。
- MMPC 方法在非线性数据上表现良好,而 LiNGAM 方法在数据为线性时更有效,凸显了根据数据结构选择方法的重要性。
- 结果表明,将填补与因果发现分开处理(如 GAN-DAG)可能不如联合学习方法,因为填补误差会传播至因果推断过程。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。