Skip to main content
QUICK REVIEW

[论文解读] Latent Causal Invariant Model

Xinwei Sun, Tao Wu|arXiv (Cornell University)|Nov 4, 2020
Domain Adaptation and Few-Shot Learning参考文献 70被引用 10
一句话总结

该论文提出潜在因果不变模型(LaCIM),一种因果表征学习框架,通过变分贝叶斯推断将因果因子(S)与虚假共变因子(Z)解耦。通过强制条件分布 P(Y|do(S)) 和 P(X|do(S),do(Z)) 在不同领域间保持不变,LaCIM 实现了对分布外(OOD)数据的鲁棒泛化,其在 OOD 基准测试中表现优于先前方法,并提升了模型可解释性。

ABSTRACT

Current supervised learning can learn spurious correlation during the data-fitting process, imposing issues regarding interpretability, out-of-distribution (OOD) generalization, and robustness. To avoid spurious correlation, we propose a Latent Causal Invariance Model (LaCIM) which pursues causal prediction. Specifically, we introduce latent variables that are separated into (a) output-causative factors and (b) others that are spuriously correlated to the output via confounders, to model the underlying causal factors. We further assume the generating mechanisms from latent space to observed data to be causally invariant. We give the identifiable claim of such invariance, particularly the disentanglement of output-causative factors from others, as a theoretical guarantee for precise inference and avoiding spurious correlation. We propose a Variational-Bayesian-based method for estimation and to optimize over the latent space for prediction. The utility of our approach is verified by improved interpretability, prediction power on various OOD scenarios (including healthcare) and robustness on security.

研究动机与目标

  • 解决监督学习中虚假相关性导致的分布外(OOD)泛化性能下降问题。
  • 形式化一个因果模型,其中观测输入 X 由未观测到的因果因子 S 和虚假共变因子 Z 生成,领域差异由 S–Z 相关性的变化驱动。
  • 在足够多领域多样性下,建立因果不变性的理论可识别性,从而实现 S 与 Z 的解耦推断。
  • 开发一种变分贝叶斯方法,学习不变表征以实现对 OOD 数据的鲁棒预测。
  • 在视觉、医疗健康和合成基准数据集上,展示改进的 OOD 泛化性能以及解耦且可解释的特征。

提出的方法

  • 将数据生成过程建模为 X ← f_x(S, Z, ε_x) 和 Y ← f_y(S, ε_y),其中 f_x 和 f_y 假设在所有领域中保持不变。
  • 引入领域变量 D 以捕捉 S 与 Z 之间的领域相关虚假共变关系,形式化领域分布偏移。
  • 将因果不变性定义为 P(Y|do(S)) 和 P(X|do(S),do(Z)) 在不同领域间保持稳定,确保对分布偏移的鲁棒性。
  • 提出一种变分贝叶斯框架,通过在不变性约束下最大化联合似然的下界,学习潜在因子 S 和 Z。
  • 在推理阶段,对解耦的潜在空间 S 进行优化,以在 do(S) 干预下预测 Y,实现 OOD 泛化。
  • 采用改进的 VAE 框架,结合领域特定的推理网络与解耦的潜在先验,以强化可识别性与不变性。

实验结果

研究问题

  • RQ1我们能否在虚假相关性随领域变化的潜在变量模型中,正式定义并识别因果不变性?
  • RQ2在何种条件下,可从观测数据中识别出因果因子 S 与虚假共变因子 Z 的解耦?
  • RQ3我们能否设计一种变分推断方法,以学习用于 OOD 泛化的不变表征?
  • RQ4强制实施因果不变性是否能相比标准深度学习方法与基于不变性的基线方法,提升在分布外测试集上的预测性能?
  • RQ5所学习的潜在因子 S 是否可被解释为解耦且具有语义意义的表征?

主要发现

  • 在足够多领域多样性下,建立了因果不变性的理论可识别性,证明 S 可被解耦于 Z 之外,仅受排列与逐点变换的影响。
  • LaCIM 在 CMNIST、NICO 和 ADNI 数据集上实现了 SOTA 的 OOD 泛化性能,优于包括 DANN 和领域泛化方法在内的各类基线模型。
  • 该模型学习到了解耦且可解释的语义特征——例如,物体轮廓与纹理被成功与背景及上下文分离——经由定性分析验证。
  • 在存在混淆与选择偏差的情况下,LaCIM 仍能在 OOD 领域保持高预测准确率,展现出对分布偏移的强鲁棒性。
  • 变分推断框架成功学习到了不变表征,消融实验确认了不变性目标对 OOD 性能的必要性。
  • 实证结果表明,在潜在空间中对 do(S) 干预进行优化可显著提升 OOD 准确率,验证了因果不变性原理的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。