Skip to main content
QUICK REVIEW

[论文解读] Can Foundation Models Talk Causality?

Moritz Willig, Matej Zečević|arXiv (Cornell University)|Jun 14, 2022
Semantic Web and Ontologies被引用 8
一句话总结

本文研究基础模型(如 GPT-3、LLaMA、OPT)是否能通过自然语言提示捕捉因果推理能力,评估其回答基于因果问题的能力。作者提出一个系统性基准,发现尽管部分模型表现出部分因果推理能力,但在传递性和反事实因果任务上常出现失败,表明尽管存在强大的相关性学习,其内部因果表征仍有限。

ABSTRACT

Foundation models are subject to an ongoing heated debate, leaving open the question of progress towards AGI and dividing the community into two camps: the ones who see the arguably impressive results as evidence to the scaling hypothesis, and the others who are worried about the lack of interpretability and reasoning capabilities. By investigating to which extent causal representations might be captured by these large scale language models, we make a humble efforts towards resolving the ongoing philosophical conflicts.

研究动机与目标

  • 通过探究基础模型在因果推理方面的能力,解决其向通用人工智能(AGI)发展的持续争议。
  • 检验基础模型是否学习因果表征,还是仅学习相关模式,回应“规模扩展 vs. 可解释性”争论的核心。
  • 开发并应用一个基准,系统性地评估基础模型在自然语言提示下的因果推理能力。
  • 挑战朱迪亚·珀尔(Judea Pearl)所提出的观点,即基础模型是缺乏因果基础的“空中楼阁”。
  • 提供实证证据,说明因果结构在大语言模型权重中编码的程度。

提出的方法

  • 作者设计了一个包含 126 个独特因果推理问题的因果推理基准,围绕因果链、干预和反事实推理构建。
  • 使用零样本提示(zero-shot prompting)评估多个基础模型(GPT-3、LLaMA、OPT、Luminous)在因果推理任务上的表现。
  • 评估重点包括传递性因果(例如,A→B→C ⇒ A→C)、干预效应(例如,do-演算)和反事实推理。
  • 通过自然语言问题提示模型,如“如果 A 导致 B 且 B 导致 C,那么 A 是否导致 C?”以测试其逻辑一致性。
  • 基准涵盖对称与非对称因果链,以及模糊或非传递性案例,以检验模型的鲁棒性。
  • 通过测量不同问题类型和模型变体的准确率,对结果进行定量分析。

实验结果

研究问题

  • RQ1基础模型在多大程度上能正确推断传递性因果关系(例如,A→B→C ⇒ A→C)?
  • RQ2基础模型能否基于 do-演算原则推理干预效应(例如,“如果我们执行 X,会发生什么?”)?
  • RQ3与事实推理相比,模型在反事实推理(例如,“如果 A 没有发生,会怎样?”)方面表现如何?
  • RQ4模型是否将因果关系视为一种逻辑结构,还是仅将其视为相关模式的集合?
  • RQ5模型规模与因果推理表现之间是否存在相关性?

主要发现

  • GPT-3 和 LLaMA 在传递性因果任务上表现中等,准确率约为 60%-70%,但在复杂因果链上表现不佳。
  • OPT 和 Luminous 等模型频繁产生逻辑不一致的答案,例如在 A→B→C 链中声称“C 导致 A”。
  • 反事实推理尤其薄弱:模型常无法区分事实依赖与反事实依赖。
  • 尽管在相关性任务上表现优异,但模型并未可靠地编码因果结构,表明其学习的是因果之上的相关性。
  • 结果表明,基础模型并未将因果逻辑内化为一致的框架,支持其缺乏因果基础的观点。
  • 模型规模与因果推理准确率之间无明显相关性,表明规模本身无法解决因果推理缺陷。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。