[论文解读] WikiWhy: Answering and Explaining Cause-and-Effect Questions
WikiWhy 引入了一个新颖的问答数据集,专注于因果推理,包含超过 9,000 个基于 Wikipedia 的 '为什么' 问题-答案-推理三元组。该数据集通过要求明确的自然语言推理过程,为评估大语言模型(LLM)的推理能力设立了基准。GPT-3 在端到端的答案与解释任务中仅达到 38.7% 的正确率,凸显了在记忆化之外的常识推理方面仍有巨大提升空间。
As large language models (LLMs) grow larger and more sophisticated, assessing their "reasoning" capabilities in natural language grows more challenging. Recent question answering (QA) benchmarks that attempt to assess reasoning are often limited by a narrow scope of covered situations and subject matters. We introduce WikiWhy, a QA dataset built around a novel auxiliary task: explaining why an answer is true in natural language. WikiWhy contains over 9,000 "why" question-answer-rationale triples, grounded on Wikipedia facts across a diverse set of topics. Each rationale is a set of supporting statements connecting the question to the answer. WikiWhy serves as a benchmark for the reasoning capabilities of LLMs because it demands rigorous explicit rationales for each answer to demonstrate the acquisition of implicit commonsense knowledge, which is unlikely to be easily memorized. GPT-3 baselines achieve only 38.7% human-evaluated correctness in the end-to-end answer & explain condition, leaving significant room for future improvements.
研究动机与目标
- 为解决当前缺乏评估大语言模型深层推理能力(超越事实检索)的基准问题。
- 探究大语言模型是否能够基于真实世界知识,为因果关系生成有效且可解释的说明。
- 通过分析解释质量并识别如循环推理等模式,诊断大语言模型的推理失败原因。
- 开发可扩展的人工标注推理过程,在 11 个广泛主题之间实现深度与多样性的平衡。
- 为自由形式解释生成在推理任务中的评估建立基线性能与度量标准。
提出的方法
- 从维基百科文章中构建数据集,提取因果关系,并据此形成‘为什么’问题及其对应答案。
- 每个条目均包含由多个支持性陈述组成的推理过程,明确连接原因与结果,确保可解释性与推理深度。
- 通过高通过率的众包标注员生成推理过程,确保在多样化主题下的质量与一致性。
- 设计了包含四项标准的人工评估框架:正确性、简洁性、流畅性与有效性,采用胜/负/平比较方式与标准答案进行对比。
- 实验在三种设置下评估了 GPT-2 和 GPT-3 的表现:端到端(同时生成答案与解释)、仅答案、以及在提供标准答案前提下的答案与解释生成。
- 引入自动度量指标,并与人工判断结果进行相关性分析,以验证其在衡量解释质量方面的有效性。
实验结果
研究问题
- RQ1大语言模型能否基于维基百科中的事实内容,为因果关系生成准确且无重复的解释?
- RQ2即使提供了正确答案,当前的大语言模型在多大程度上仍无法生成有效的推理链?
- RQ3自动度量指标在自由形式推理任务中,与人工对解释质量的判断有多高的相关性?
- RQ4与流水线设置相比,要求模型同时生成答案与推理过程是否会降低性能?
- RQ5哪些错误模式(如循环推理)表明大语言模型缺乏真正的常识理解?
主要发现
- 在端到端的答案与解释条件下,GPT-3 的人工评估正确率仅为 38.7%,表明其在推理生成方面存在显著局限。
- GPT-3 的一个主要失败模式是逐字重复因果关系(例如,'因为 A 所以 B'),表明其推理深度不足,仅停留在记忆层面。
- 即使许多解释具有高流畅性评分,仍被标记为无效或错误,表明问题出在推理能力本身,而非语言生成能力。
- 流水线设置(即仅需生成解释,答案已提供)的表现显著优于端到端生成,凸显答案生成是错误的主要来源。
- 参考文本相似度与解释正确性高度相关,验证了使用相似度指标作为质量代理的有效性。
- 所提出的流畅性、有效性和简洁性度量指标与人工判断结果表现出强相关性,支持其在后续评估中的应用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。