[论文解读] Sample-Specific Root Causal Inference with Latent Variables
该论文提出了一种名为基于潜在变量的误差提取(Extract Errors with Latents, EEL)的方法,用于在存在潜在混杂因子的线性非高斯无环模型(LiNGAM)中进行样本特定的根因推断。EEL 能够在有向诱导路径的污染下恢复误差项,并利用稀疏依赖图高效计算 Shapley 值,在存在混杂的合成数据和真实世界数据集上,其准确性和鲁棒性均优于以往方法。
Root causal analysis seeks to identify the set of initial perturbations that induce an unwanted outcome. In prior work, we defined sample-specific root causes of disease using exogenous error terms that predict a diagnosis in a structural equation model. We rigorously quantified predictivity using Shapley values. However, the associated algorithms for inferring root causes assume no latent confounding. We relax this assumption by permitting confounding among the predictors. We then introduce a corresponding procedure called Extract Errors with Latents (EEL) for recovering the error terms up to contamination by vertices on certain paths under the linear non-Gaussian acyclic model. EEL also identifies the smallest sets of dependent errors for fast computation of the Shapley values. The algorithm bypasses the hard problem of estimating the underlying causal graph in both cases. Experiments highlight the superior accuracy and robustness of EEL relative to its predecessors.
研究动机与目标
- 解决以往根因推断方法假设无潜在混杂的局限性。
- 开发一种系统性方法,用于在未观测到的共同原因影响观测变量时,识别样本特定的根因。
- 在存在潜在混杂因子的情况下,实现对误差项的准确且高效地计算 Shapley 值。
- 在不进行因果图恢复的前提下,保持在混杂条件下的高性能。
- 在具有真实因果结构的合成数据以及临床和流式细胞术数据集上验证该方法。
提出的方法
- EEL 通过将观测变量建模为线性结构方程模型(SEM)中的残差,即使在未观测变量导致混杂的情况下,也能恢复误差项。
- 它识别有向诱导路径——即潜在混杂因子影响误差项的路径——从而考虑误差恢复中的污染问题。
- EEL 构建一个稀疏无向依赖图,总结恢复后的误差项之间的统计关系。
- 该依赖图通过在小范围局部依赖邻域内取平均,实现 Shapley 值的高效计算。
- 该方法利用 LiNGAM 模型中非高斯性和无环性的假设,确保在混杂条件下误差项的可识别性。
- 该方法避免了完整的因果图估计,转而专注于误差项提取和局部依赖结构的建模。
实验结果
研究问题
- RQ1我们能否在存在潜在混杂因子的情况下,利用结构方程模型中的误差项,准确识别样本特定的根因?
- RQ2混杂如何影响误差项的恢复?我们能否量化由此产生的污染程度?
- RQ3当依赖关系由潜在变量引起时,我们能否高效计算误差项的 Shapley 值?
- RQ4在存在混杂的情况下,EEL 是否在排名准确率和均方误差方面优于现有方法?
- RQ5该方法在现实生物和临床数据中,对不同混杂程度和样本量是否具有鲁棒性?
主要发现
- 在 n = 100,000 且混杂比例为 20% 的合成数据上,EEL 达到了 0.980 的最高平均 Rank-Biased Overlap (RBO) 值,显著优于其他竞争方法。
- 在 100,000 个样本和 20% 混杂条件下,EEL 在 RBO 上比第二好的算法高出 15.6%,展现出强大的可扩展性和鲁棒性。
- 在 Pima 印第安糖尿病数据集上,EEL 的平均 RBO 比其最近似竞争对手高出 10.7 个百分点,MSE 降低了 57.8%。
- 在流式细胞术数据集上,EEL 的 RBO 比次优方法高出 8.3 个百分点,MSE 减少了 59.3%。
- 在糖尿病数据集上,EEL 平均耗时 9.2 秒;在流式细胞术数据集上为 64.6 秒,显示出实际运行效率。
- 即使在无混杂条件下,EEL 仍保持了具有竞争力的性能,尽管其表现被专门针对无混杂场景的方法(如 RCI)超越,证实了其重点针对混杂场景的设计目标。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。