[论文解读] Comparative Benchmarking of Causal Discovery Techniques
本文在三个性能维度——结构准确性、预测准确性与反事实推理准确性——上对因果发现算法进行了全面基准测试。基于不同规模的真实与模拟数据集,研究发现结构准确性并不能一致地预测推断性能,且PC算法在大型线性高斯数据集中表现优于其他算法,而GES虽在结构学习方面表现不佳,但在预测准确性方面表现卓越。
In this paper we present a comprehensive view of prominent causal discovery algorithms, categorized into two main categories (1) assuming acyclic and no latent variables, and (2) allowing both cycles and latent variables, along with experimental results comparing them from three perspectives: (a) structural accuracy, (b) standard predictive accuracy, and (c) accuracy of counterfactual inference. For (b) and (c) we train causal Bayesian networks with structures as predicted by each causal discovery technique to carry out counterfactual or standard predictive inference. We compare causal algorithms on two pub- licly available and one simulated datasets having different sample sizes: small, medium and large. Experiments show that structural accuracy of a technique does not necessarily correlate with higher accuracy of inferencing tasks. Fur- ther, surveyed structure learning algorithms do not perform well in terms of structural accuracy in case of datasets having large number of variables.
研究动机与目标
- 评估并比较最先进因果发现算法在多个性能指标上的表现。
- 探究结构准确性与推断性能(预测与反事实)之间的关系。
- 评估数据类型(观测、干预、主动学习)与数据集规模对算法性能的影响。
- 识别在不同条件下(尤其是高维场景下)最有效的算法。
- 评估现有方法在学习大规模网络因果结构方面的局限性。
提出的方法
- 将因果发现算法分为两大类:无环/无潜变量与有环/允许潜变量的方法。
- 进一步将算法划分为三个子类:仅观测、观测+干预与主动学习。
- 将算法应用于三个数据集——两个真实数据集与一个模拟数据集——涵盖小、中、大样本规模。
- 使用三项指标评估性能:结构汉明距离(SHD)、结构干预距离(SID)、F-score、AUC与归一化均方根误差(NRMSE)。
- 基于学习到的结构训练因果贝叶斯网络,以评估预测与反事实推理的准确性。
- 采用统一的实验框架,在所有指标下以相同条件比较各算法。
实验结果
研究问题
- RQ1因果发现中更高的结构准确性是否意味着更好的预测或反事实推理性能?
- RQ2在不同数据集规模下,仅观测、干预辅助与主动学习算法在推断准确性方面如何比较?
- RQ3在大型高维数据集中,哪种算法在结构、预测与反事实准确性方面表现最佳?
- RQ4现有因果发现方法在处理具有大量变量的数据集时,其失败程度如何?
- RQ5底层数据生成模型(如线性高斯模型)在多大程度上影响算法性能?
主要发现
- 在大型线性高斯数据集中,PC算法在所有性能指标上均优于其他算法,尤其在结构与推断准确性方面表现突出。
- 在小样本数据集中,基于主动学习的算法在AUC与F-score方面表现最佳,而MMHC与PC在SHD与SID方面表现最优。
- GES在结构准确性方面表现较差,这是由于过拟合所致,但其预测准确性最高,表明结构质量与推断质量之间存在脱节。
- 同时使用观测与干预数据的算法(如GIES)优于仅使用观测数据的算法(如GES),尤其在中型与大型数据集中表现更优。
- 目前最先进的算法均未能成功捕捉具有大量变量的数据集中的因果结构,凸显了当前方法的关键局限性。
- 结构准确性并非推断性能的可靠预测指标:即使SHD/SID较低,某些算法仍可能实现较高的预测与反事实准确性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。