[论文解读] Bayesian network structure learning with causal effects in the presence of latent variables
该论文提出CCHM,一种混合贝叶斯网络结构学习算法,结合约束法(cFCI)与评分法(BIC优化的爬山法),并引入Pearl的do-演算,以在因果不充分条件下对祖先图中的边进行定向。该方法在合成数据和真实世界高斯贝叶斯网络上均优于现有最先进方法,显著提升了真实祖先图的重建准确率。
Latent variables may lead to spurious relationships that can be misinterpreted as causal relationships. In Bayesian Networks (BNs), this challenge is known as learning under causal insufficiency. Structure learning algorithms that assume causal insufficiency tend to reconstruct the ancestral graph of a BN, where bi-directed edges represent confounding and directed edges represent direct or ancestral relationships. This paper describes a hybrid structure learning algorithm, called CCHM, which combines the constraint-based part of cFCI with hill-climbing score-based learning. The score-based process incorporates Pearl s do-calculus to measure causal effects and orientate edges that would otherwise remain undirected, under the assumption the BN is a linear Structure Equation Model where data follow a multivariate Gaussian distribution. Experiments based on both randomised and well-known networks show that CCHM improves the state-of-the-art in terms of reconstructing the true ancestral graph.
研究动机与目标
- 为解决贝叶斯网络结构学习中的因果不充分性问题,即未观测到的混淆因子导致虚假依赖关系。
- 开发一种混合算法,结合约束法与评分法,以在潜变量存在条件下提升祖先图的重建效果。
- 将Pearl的do-演算融入结构学习过程,用于定向标准约束法中仍保持无向的边。
- 在不同潜变量影响水平下,评估算法在随机和真实世界高斯贝叶斯网络上的性能表现。
提出的方法
- 该算法使用cFCI约束法构建骨架,并识别v-结构与表示混淆的双箭头边。
- 采用爬山法评分搜索以最小化贝叶斯信息准则(BIC),从而优化网络结构。
- 应用Pearl的do-演算计算干预分布并估计因果效应,从而实现原本无法确定方向的边的定向。
- 该方法假设线性结构方程模型(SEM),且数据服从多元正态分布。
- 利用do-演算效应对边定向进行优化,以解决祖先图中因潜变量混淆导致的定向模糊性。
- 通过标准指标(包括结构汉明距离(SHD)、精确率、召回率和BSF)对算法进行评估,涵盖多种网络类型。
实验结果
研究问题
- RQ1结合约束法与评分法的混合结构学习算法,是否能在因果不充分条件下提升祖先图的重建效果?
- RQ2当仅依靠观测数据无法确定方向时,Pearl的do-演算在祖先图中定向边方面的有效性如何?
- RQ3在存在潜变量的情况下,通过do-演算引入因果效应估计,是否能带来优于纯约束法或纯评分法的性能提升?
- RQ4结果对超参数选择(如条件独立性检验中的显著性水平α)的敏感性如何?
主要发现
- 在测试的四个真实世界高斯贝叶斯网络中,CCHM在其中两个网络中实现了最低的结构汉明距离(SHD),表明其具有更优的重建准确率。
- 在真实世界网络中,CCHM在所有案例研究中均稳定位列前三名,尤其在α = 0.01时表现尤为突出。
- 该算法对超参数变化具有鲁棒性,优于cFCI和GSPo,后者对α值表现出高度敏感性。
- 随着潜变量比例的增加,CCHM保持了较强的性能,SHD仅出现微弱上升,表明其对混淆因子具有较强抗性。
- 结果表明,将do-演算整合到评分法学习中,可显著提升边定向的准确性,超越仅使用约束法的效果。
- 在合成与真实世界实验中,CCHM均优于当前最先进算法(如GFCI、M3HC和GSPo),尤其在复杂、高维场景下表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。