[论文解读] Causal Discovery with Language Models as Imperfect Experts
本文提出一种贪心、具一致性意识的方法,通过整合不完善的专家知识(如大语言模型提供的知识),在因果发现中精炼马尔可夫等价类(MECs),同时以高概率确保真实因果图保留在精炼后的等价类中。该方法利用无环性和条件独立性约束来纠正错误的专家定向,显著减小了 MEC 的规模和真实数据集上的结构汉明距离(SHD)。
Understanding the causal relationships that underlie a system is a fundamental prerequisite to accurate decision-making. In this work, we explore how expert knowledge can be used to improve the data-driven identification of causal graphs, beyond Markov equivalence classes. In doing so, we consider a setting where we can query an expert about the orientation of causal relationships between variables, but where the expert may provide erroneous information. We propose strategies for amending such expert knowledge based on consistency properties, e.g., acyclicity and conditional independencies in the equivalence class. We then report a case study, on real data, where a large language model is used as an imperfect expert.
研究动机与目标
- 解决现有因果发现方法仅能识别因果图至马尔可夫等价类(MECs)程度所带来的局限性,导致干预估计存在不确定性。
- 开发一个框架,整合专家知识(尤其是来自不完善专家如大语言模型(LLMs)的知识),以精炼 MEC 并减少不确定性。
- 即使专家反馈包含错误,也确保真实因果图以高概率保留在精炼后的 MEC 中。
- 通过合成噪声专家和基于 LLM 的专家,在真实世界数据集上评估该方法的有效性。
- 评估专家可靠性与不确定性校准对因果精炼性能的影响。
提出的方法
- 将不完善专家的使用形式化为一个优化问题,目标是最小化 MEC 的规模,同时以高概率保留真实图。
- 提出一种贪心算法,通过在 MEC 中测试与无环性及条件独立性约束的一致性,逐步整合专家反馈。
- 提出两种策略:$S_{\text{size}}$(最小化 MEC 规模)和 $S_{\text{risk}}$(使用贝叶斯推断控制排除真实图的风险)。
- 使用噪声模型模拟专家错误,其中每个专家定向正确的概率为 $1 - \varepsilon$,并相应地拒绝不一致的图。
- 将该方法应用于真实世界贝叶斯网络(如 Insurance、Asia、ALARM),首先从真实 DAG 提取 MEC,然后通过专家查询进行精炼。
- 使用 MEC 规模、与真实图的 SHD,以及真实图包含于 $p(G^\star \in \mathcal{M}^{E,S})$ 的经验概率来评估性能。
实验结果
研究问题
- RQ1不完善的专家知识(如来自 LLM 的知识)是否能有效用于在马尔可夫等价类之外减少因果发现的不确定性?
- RQ2当专家反馈可能包含错误时,如何确保真实因果图保留在精炼后的等价类中?
- RQ3在精炼 MEC 时,不同专家策略(如风险控制型与规模优化型)之间的性能权衡是什么?
- RQ4LLMs 的可靠性与不确定性校准如何影响因果精炼的质量?
- RQ5LLMs 是否能提供有助于改进因果发现性能的因果相关知识,相较于朴素的专家整合方式?
主要发现
- 当使用误差率受控的 $\varepsilon$-专家时,所提方法在所有测试网络(Insurance、Asia、ALARM)中均成功减小了 MEC 规模和 SHD,同时保持 $p(G^\star \in \mathcal{M}^{E,S}) \geq 1 - \eta$。
- 当 $\eta = 1$ 时,该方法的 SHD 低于朴素 LLM 整合方法(Long et al., 2023),表明其在准确性和控制性方面均有提升。
- 在除 ALARM 外的所有数据集上,基于 LLM 的专家表现与至少一个 $\varepsilon$-专家相当,表明从 LLM 中有效提取了因果知识。
- 在 ALARM 网络中,即使 $\eta$ 较小,真实图仍被排除在 $\mathcal{M}^{E,S}$ 之外,原因在于元数据模糊和专家困惑。
- text-davinci-003 模型表现出较差的不确定性校准,常高估置信度,导致即使在低 $\eta$ 情况下也错误地拒绝真实图。
- 随着专家可靠性下降,该方法性能下降,凸显了在使用 LLM 作为专家时,对更优噪声模型和不确定性校准的迫切需求。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。