[论文解读] Interventional Sum-Product Networks: Causal Inference with Tractable Probabilistic Models
本文提出干预型求和-乘积网络(iSPNs),一种可处理的概率模型,通过神经网络门控参数化直接引入Pearl的do算子,无需编译为贝叶斯网络即可学习干预分布。该方法在多种因果结构和干预类型下估计干预分布方面达到最先进性能,展现出强大的表达能力与因果充分性。
While probabilistic models are an important tool for studying causality, doing so suffers from the intractability of inference. As a step towards tractable causal models, we consider the problem of learning interventional distributions using sum-product networks (SPNs) that are over-parameterized by gate functions, e.g., neural networks. Providing an arbitrarily intervened causal graph as input, effectively subsuming Pearl's do-operator, the gate function predicts the parameters of the SPN. The resulting interventional SPNs are motivated and illustrated by a structural causal model themed around personal health. Our empirical evaluation on three benchmark data sets as well as a synthetic health data set clearly demonstrates that interventional SPNs indeed are both expressive in modelling and flexible in adapting to the interventions.
研究动机与目标
- 通过利用求和-乘积网络(SPNs)的可处理性,解决传统概率模型中因果推断的不可处理性问题。
- 克服SPN编译为贝叶斯网络所导致的因果结构退化问题,以及在因果推理中失效的问题。
- 开发一种方法,通过可学习门控函数对do算子进行条件化,直接建模干预分布P(Y|do(X))。
- 实现干预效应在因果层级中的忠实传播,捕捉干预的下游后果。
- 证明iSPNs具有表达能力与因果充分性,可在无需结构重新编译的情况下建模任意干预。
提出的方法
- 使用神经网络作为门控函数,根据do算子对SPN的参数进行条件化,实现基于干预的动态参数化。
- 构建iSPNs,使得每个干预(如do(X=x))作为门网络的输入,进而输出对应的SPN参数。
- 确保SPN结构保留因果图的拓扑结构,以支持干预效应在变量层级中的传播。
- 使用观测数据和干预数据进行端到端训练,通过最大似然估计优化干预分布的对数似然。
- 利用神经网络的通用逼近能力,建模复杂非线性干预分布,同时保持SPN的可处理性。
- 采用以个人健康为主题的结构因果模型,在具有混杂因素和非平凡因果依赖关系的现实高影响力领域验证该方法。
实验结果
研究问题
- RQ1可处理的概率模型(如SPNs)能否在无需编译为贝叶斯网络的情况下,直接建模干预分布?
- RQ2神经网络门控SPN架构能否有效捕捉因果层级中所有类型的干预效应,包括下游后果?
- RQ3iSPNs在拟合多样化数据分布下的干预分布时,与强生成模型(如MDN、MADE)相比表现如何?
- RQ4iSPNs能否处理复杂因果场景(如混杂与辛普森悖论),而这些场景下标准回归方法会失效?
- RQ5iSPNs在无需微调的情况下,对不同类型干预(如连续型、离散型、原子型、非连续型)的泛化能力如何?
主要发现
- iSPNs在四个基准数据集上对干预分布的估计接近完美,其拟合精度和适应性均优于MDN和MADE。
- 在估计因果效应方面,iSPNs的性能与因果推断基线(CausalML、DoWhy)相当或更优,尤其在混杂设置和辛普森悖论场景中表现突出。
- iSPNs的训练时间显著短于对比方法,平均在超过50次数据遍历后的运行时间远低于基线模型。
- iSPNs成功建模了多种干预类型,包括均匀分布和伽马分布的干预,展现出对干预分布的鲁棒性与泛化能力。
- 模型在ASIA数据集和个人健康因果模型上均准确捕捉了干预效应在整个因果层级中的传播。
- 补充材料中的解析推导证实,iSPNs在合成设置下能正确恢复真实的ATE(平均处理效应),验证了其因果正确性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。