Skip to main content
QUICK REVIEW

[论文解读] CRASS: A Novel Data Set and Benchmark to Test Counterfactual Reasoning of Large Language Models

Jörg Frohberg, Frank Binder|arXiv (Cornell University)|Dec 22, 2021
Topic Modeling被引用 9
一句话总结

本文提出了CRASS,一种新颖的基准测试,通过使用问题化的反事实条件句来评估大语言模型(LLMs)的常识推理能力。该研究提供了经众包验证的人类基线,并表明即使是最先进的LLMs在反事实推理任务上的表现也比人类低超过25%,凸显了其在反事实推理能力上的显著差距。

ABSTRACT

We introduce the CRASS (counterfactual reasoning assessment) data set and benchmark utilizing questionized counterfactual conditionals as a novel and powerful tool to evaluate large language models. We present the data set design and benchmark that supports scoring against a crowd-validated human baseline. We test six state-of-the-art models against our benchmark. Our results show that it poses a valid challenge for these models and opens up considerable room for their improvement.

研究动机与目标

  • 为解决当前缺乏用于评估大语言模型(LLMs)高级常识推理能力的稳健基准的问题。
  • 开发一种基于问题化反事实条件句(QCC)的新评估框架,以测试因果推理和假设推理能力。
  • 建立一个由人类标注、经众包验证的基线,用于衡量LLMs在反事实推理任务上的表现。
  • 通过暴露当前SOTA LLMs在推理非实际事件、替代情境方面的局限性,对其提出挑战。
  • 通过提供一个设计严谨、已被认可的基准任务,为BIG-bench计划做出贡献。

提出的方法

  • CRASS基准采用问题化反事实条件句(QCC),其中反事实情境以问题形式呈现,例如:'如果那棵树没有倒下,会发生什么?'。
  • 每个QCC均基于真实世界事件序列,前提部分描述一个非实际的原因,结果部分描述一个潜在的影响。
  • 该基准旨在通过要求模型推断未发生事件的可能结果,来测试因果推理能力。
  • 隐含地假设了一个因果模型,即模型必须根据反事实前提,使用概率最大化原则(o* = argmaxₒ P(o|a))推断最可能的结果。
  • 数据集通过人工标注答案构建,以确保与人类常识一致,形成金标准基线。
  • 该基准已集成至BIG-bench套件中,支持在多个LLMs上进行标准化评估。

实验结果

研究问题

  • RQ1最先进的大语言模型在推理未发生的反事实情境方面表现如何?
  • RQ2LLMs在多大程度上无法将因果推理泛化到观测数据之外,尤其是在假设性、非实际情境中?
  • RQ3LLMs在反事实推理任务上的表现与人类基线相比如何?
  • RQ4基于问题化反事实条件句的基准是否能有效暴露LLM推理在标准NLP基准之外的局限性?
  • RQ5人类与模型在反事实推理上的性能差距是多少?该差距在不同模型架构间是否保持一致?

主要发现

  • CRASS基准表明,即使是最先进的大语言模型在反事实推理任务上的表现也显著落后于人类表现。
  • 平均而言,LLMs与经人类验证的基线相比存在超过25%的性能差距,表明仍有巨大的改进空间。
  • 该基准成功识别出因果推理中的系统性失败,尤其是在处理与已知事实相矛盾的假设事件时。
  • 当推理未发生事件时,模型常常无法保持逻辑一致性,尤其是在因果依赖关系复杂的情况下。
  • 结果证实,当前LLMs在推理替代因果路径方面存在困难,表明其内部因果世界模型存在局限。
  • 该基准已被纳入BIG-bench套件,验证了其作为标准化、社区公认评估工具的实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。