[论文解读] Causal Graph Discovery with Retrieval-Augmented Generation based Large Language Models
该论文提出 LACR,一种基于检索增强生成(RAG)的方法,利用科学文献在不依赖统计数据的情况下发现因果图。通过检索相关研究片段并使用大语言模型提取和聚合关联关系,LACR 构建出高质量的因果图,在 SACHS 和 BIOLOGIST 等基准数据集上的表现优于现有的统计方法和基于 LLM 的方法。
Causal graph recovery is traditionally done using statistical estimation-based methods or based on individual's knowledge about variables of interests. They often suffer from data collection biases and limitations of individuals' knowledge. The advance of large language models (LLMs) provides opportunities to address these problems. We propose a novel method that leverages LLMs to deduce causal relationships in general causal graph recovery tasks. This method leverages knowledge compressed in LLMs and knowledge LLMs extracted from scientific publication database as well as experiment data about factors of interest to achieve this goal. Our method gives a prompting strategy to extract associational relationships among those factors and a mechanism to perform causality verification for these associations. Comparing to other LLM-based methods that directly instruct LLMs to do the highly complex causal reasoning, our method shows clear advantage on causal graph quality on benchmark datasets. More importantly, as causality among some factors may change as new research results emerge, our method show sensitivity to new evidence in the literature and can provide useful information for updating causal graphs accordingly.
研究动机与目标
- 解决传统因果发现方法依赖于有偏见或低质量观测数据的局限性。
- 通过将推理建立在外部文献基础上,克服现有基于 LLM 的因果推断对模型内在推理能力的依赖。
- 开发一种通用的、数据驱动的因果图恢复方法,无需任务特定提示或知识库。
- 通过系统性地聚合来自大规模科学文献语料的证据,提高因果图构建的可靠性和准确性。
- 证明经过科学文献检索增强的大语言模型可在复杂生物系统中实现专家水平的因果推理。
提出的方法
- 使用密集向量检索从大规模、精心整理的科学文献语料库中检索相关文本片段。
- 采用大语言模型(LLM)识别并标注检索文本中因素之间的关联关系。
- 在多份文献间聚合提取的关联关系,以推断潜在的因果联系。
- 构建因果图,其中节点代表因素,有向边代表推断出的因果关系。
- 利用 RAG 框架通过将 LLM 推理扎根于事实性科学文献来增强其推理能力,减少幻觉和偏见。
- 应用多步提示策略,引导 LLM 在无需微调的情况下提取和验证关系。
实验结果
研究问题
- RQ1LLM 是否能在不依赖统计数据或领域特定提示的情况下,有效从科学文献中提取因果关系?
- RQ2在真实世界生物数据集上,LACR 的性能与基于统计估计的因果发现方法相比如何?
- RQ3使用更广泛的文献池是否会提高或降低因果图恢复的质量,原因是什么?
- RQ4LLM 的推理能力在多大程度上限制了因果方向推断的准确性,相较于关联关系检测?
- RQ5检索增强生成能否提升 LLM 的因果推理能力,使其在因果图构建中达到专家水平的性能?
主要发现
- 在 SACHS 因果图上,LACR 达到了 75.00% 的 F1 分数,优于统计基线方法如 FASK(F1:51.61%)和 Sachs’s Model(F1:75.00%)。
- 在 BIOLOGIST 共识图上,当使用 P+S+F 池时,LACR 的 F1 分数达到 70.97%,显著优于 FASK(F1:64.86%)和其他基线方法。
- 在检测关联关系方面,LACR 表现更高精度和召回率(例如,P+S+F(SQ) 的精度为 50.00%,召回率为 60.00%),优于因果方向推断任务。
- 当使用更大的文献池时,性能下降,可能由于分布偏移以及模型对较新或不常见文献来源缺乏接触。
- 因果存在性验证(识别关联)的表现优于因果方向推断(推断方向性),表明 LLM 在复杂因果推理方面仍存在困难。
- LACR 在不同文献池中表现稳健,最佳结果来自 PubMed、SACHS 和 BIOLOGIST 文献的平衡组合。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。