[论文解读] Causal Structure Learning Supervised by Large Language Model
本文提出 ILS-CSL,一种迭代框架,通过利用大语言模型(LLMs)验证和修正数据驱动的DAG中的边,从而改进因果结构学习(CSL)。通过迭代应用LLM推断的结构约束——聚焦于边级别的准确性——ILS-CSL 在更大数据集上显著优于先前方法,实现显著的SHD降低和高质量的约束对齐。
Causal discovery from observational data is pivotal for deciphering complex relationships. Causal Structure Learning (CSL), which focuses on deriving causal Directed Acyclic Graphs (DAGs) from data, faces challenges due to vast DAG spaces and data sparsity. The integration of Large Language Models (LLMs), recognized for their causal reasoning capabilities, offers a promising direction to enhance CSL by infusing it with knowledge-based causal inferences. However, existing approaches utilizing LLMs for CSL have encountered issues, including unreliable constraints from imperfect LLM inferences and the computational intensity of full pairwise variable analyses. In response, we introduce the Iterative LLM Supervised CSL (ILS-CSL) framework. ILS-CSL innovatively integrates LLM-based causal inference with CSL in an iterative process, refining the causal DAG using feedback from LLMs. This method not only utilizes LLM resources more efficiently but also generates more robust and high-quality structural constraints compared to previous methodologies. Our comprehensive evaluation across eight real-world datasets demonstrates ILS-CSL's superior performance, setting a new standard in CSL efficacy and showcasing its potential to significantly advance the field of causal discovery. The codes are available at \url{https://github.com/tyMadara/ILS-CSL}.
研究动机与目标
- 解决现有LLM增强型因果结构学习方法存在的不可靠约束和高计算成本问题。
- 通过以目标化、迭代化的方式整合LLM反馈,提升从观测数据中学习到的因果DAG的质量与鲁棒性。
- 通过利用LLM作为可扩展的知识型因果推理来源,减少对专家提供约束的依赖。
- 通过仅验证数据驱动学习所提出的边,而非应用全局约束,从而最小化LLM推断中的误差传播。
- 在多样化的真实世界数据集上展示一致的性能提升,尤其在变量数量增加时表现更优。
提出的方法
- ILS-CSL 通过查询LLM来验证当前结构中每条边的方向和存在性,迭代优化从数据中学习到的因果DAG。
- 在每次迭代中,LLM基于变量对之间的因果推理,提供边级别的约束——指示某条边是否应存在或方向是否应反转。
- 该框架将LLM推导出的约束作为硬或软先验,用于重新训练CSL算法(例如,使用BDeu或BIC的HC),从而改进DAG结构。
- 该过程持续进行直至收敛或达到最大迭代次数,反馈用于纠正错误的边并优化因果图。
- 采用硬约束策略严格实施LLM推断结果,同时通过投票机制降低LLM输出不一致带来的噪声。
- 通过仅关注当前数据学习得到的DAG中存在的边,避免全对分析,显著降低LLM推理成本。

实验结果
研究问题
- RQ1LLM推断的因果知识能否被有效且高效地整合到因果结构学习中,以提升DAG质量?
- RQ2使用LLM反馈进行迭代优化,是否能比单次约束应用带来更好的因果结构恢复效果?
- RQ3LLM监督的CSL性能如何随变量数量增加和数据稀疏性提升而变化?
- RQ4LLM错误在多大程度上会损害或改善最终的因果结构?该框架能否缓解此类风险?
- RQ5LLM约束的整合是否能带来超越约束本身的结构准确性提升,表明发现了未知的因果机制?
主要发现
- ILS-CSL 显著降低了结构汉明距离(SHD),在Cancer数据集中平均SHD降低75%,在Barley数据集中降低50%,相比基线CSL。
- 首次LLM监督迭代带来的改进最为显著,某些情况下SHD降低高达80%,表明初始影响强烈。
- 在Barley数据集(48个变量)上,仅使用数据时ILS-CSL的SHD为33.7,而使用GPT-4约束时SHD升至54.5(表明先前方法出现退化),而ILS-CSL实现52.0,表现出强鲁棒性。
- 在Child数据集(20个变量,2000个样本)上,ILS-CSL在两次迭代内将SHD从12降至3,表现出强劲的收敛性与准确性提升。
- 该框架通过约束直接纠正了5条边,另间接纠正了3条未被约束覆盖的边,表明其具备发现未知因果机制的能力。
- 在总共9条LLM约束中仅有2条错误(蓝色箭头),且该框架有效缓解了其影响,显示出对LLM噪声的强韧性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。