[论文解读] Iterative Causal Discovery in the Possible Presence of Latent Confounders and Selection Bias
本文提出了迭代因果发现(ICD),这是一种在存在隐性混杂因素和选择偏差情况下的部分祖先图(PAG)学习的可靠且完备的算法。ICD通过逐步增加节点对之间最小分离集合的搜索半径,迭代地优化图结构,确保了任意时刻的正确性,并显著减少了与FCI、FCI+和RFCI相比所需的条件独立性(CI)检验次数,同时实现了更高的结构准确性。
We present a sound and complete algorithm, called iterative causal discovery (ICD), for recovering causal graphs in the presence of latent confounders and selection bias. ICD relies on the causal Markov and faithfulness assumptions and recovers the equivalence class of the underlying causal graph. It starts with a complete graph, and consists of a single iterative stage that gradually refines this graph by identifying conditional independence (CI) between connected nodes. Independence and causal relations entailed after any iteration are correct, rendering ICD anytime. Essentially, we tie the size of the CI conditioning set to its distance on the graph from the tested nodes, and increase this value in the successive iteration. Thus, each iteration refines a graph that was recovered by previous iterations having smaller conditioning sets -- a higher statistical power -- which contributes to stability. We demonstrate empirically that ICD requires significantly fewer CI tests and learns more accurate causal graphs compared to FCI, FCI+, and RFCI algorithms (code is available at https://github.com/IntelLabs/causality-lab).
研究动机与目标
- 开发一种即使在早期中断也能保持正确的因果发现算法,确保在存在隐性混杂因素和选择偏差时具备任意时刻正确性。
- 与现有方法如FCI、FCI+和RFCI相比,减少学习因果图所需的条件独立性(CI)检验次数。
- 在存在隐性变量和选择偏差的情况下,提高恢复因果骨架和边方向的结构准确性。
- 通过在过程中优先处理条件集较小的CI检验,利用更高的统计功效,确保算法的稳定性。
提出的方法
- ICD从一个完全图开始,通过逐步增加每个节点对的搜索半径,测试条件独立性(CI)关系,迭代地优化图结构。
- 该算法在每次迭代中,对距离目标节点对逐渐增加的节点集合进行条件化,从局部邻域开始,逐步扩展到全局范围。
- 它对所有可能的分离集合一视同仁,不同于FCI和FCI+,后者会区分相邻和非相邻的分离集合。
- 在每次迭代中,仅当在当前半径下找到有效的分离集合时才移除边,从而确保所有蕴含的独立性和因果关系的正确性。
- 搜索半径逐步增加,使算法能够逐步优化结果并保持稳定性。
- 该方法在大样本极限下是可靠且完备的,在忠实性和马尔可夫假设下可恢复正确的PAG等价类。
实验结果
研究问题
- RQ1能否设计一种因果发现算法,使其即使在任意阶段被中断也能保持正确,从而确保在存在隐性混杂因素和选择偏差时具备任意时刻正确性?
- RQ2在存在隐性混杂因素的情况下,如何减少条件独立性(CI)检验次数,同时保持或提升结构准确性?
- RQ3通过迭代方式逐步增加分离集合的搜索半径,是否能带来比现有方法更稳定和高效的因果发现?
- RQ4一种在搜索早期就考虑非局部节点的算法,能否避免FCI的高计算成本,同时保持完备性?
主要发现
- ICD在所有图大小和条件集大小下,所需的条件独立性(CI)检验次数显著少于FCI、FCI+和RFCI。
- 对于大小为35的图,ICD相比FCI+和RFCI将CI检验次数减少了最多50%,且随着图大小的增加,优势进一步扩大。
- ICD在骨架恢复方面取得了最高的F1分数,假阴性率(遗漏边)更低,且边方向判断的精确度高于基线方法。
- 即使在小样本数据下,该算法仍保持高准确性,这得益于早期迭代中优先处理小条件集,从而表现出良好的稳定性。
- ICD的方向判断准确性超过FCI、FCI+和RFCI,尤其在大图和较大条件集大小下表现更优。
- 随着图复杂度的增加,ICD的每种条件集大小下的CI检验次数增长速度慢于FCI+和RFCI,表明其在可扩展性方面更具优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。