[论文解读] Assessing the Reasoning Capabilities of LLMs in the context of Evidence-based Claim Verification
本文提出了一种新颖的逻辑推理框架,将事实核查与谣言验证分解为原子化的推理步骤,利用两个手动标注的数据集——维基百科事实与推特谣言——评估 GPT-3.5-Turbo 和 GPT-4。主要发现表明,尽管模型在演绎推理方面表现优异,但在现实世界谣言的归纳推理方面存在显著困难,且思维链(Chain-of-Thought)提示显著提升了零样本方法的解释质量。
Although LLMs have shown great performance on Mathematics and Coding related reasoning tasks, the reasoning capabilities of LLMs regarding other forms of reasoning are still an open problem. Here, we examine the issue of reasoning from the perspective of claim verification. We propose a framework designed to break down any claim paired with evidence into atomic reasoning types that are necessary for verification. We use this framework to create RECV, the first claim verification benchmark, incorporating real-world claims, to assess the deductive and abductive reasoning capabilities of LLMs. The benchmark comprises of three datasets, covering reasoning problems of increasing complexity. We evaluate three state-of-the-art proprietary LLMs under multiple prompt settings. Our results show that while LLMs can address deductive reasoning problems, they consistently fail in cases of abductive reasoning. Moreover, we observe that enhancing LLMs with rationale generation is not always beneficial. Nonetheless, we find that generated rationales are semantically similar to those provided by humans, especially in deductive reasoning cases.
研究动机与目标
- 开发一种系统性框架,将事实与谣言验证分解为原子化的、可解释的推理步骤。
- 解决大语言模型在现实世界复杂谣言验证任务中推理能力缺乏结构化评估的问题。
- 探究类似 ChatGPT 的大语言模型在归纳推理中的表现是否可靠,而归纳推理对病毒式传播的虚假信息至关重要。
- 比较零样本、零样本思维链(Zero-Shot Chain-of-Thought)与人工思维链(Manual Chain-of-Thought)提示在提升推理质量方面的有效性。
- 提供实证证据,揭示大语言模型在高风险验证任务中的局限性,超越炒作,聚焦可测量的能力。
提出的方法
- 提出一种逻辑推理框架,将事实与证据分解为推理路径、推理模式(演绎/归纳)及推理过程。
- 构建两个手动标注的数据集:一个来自维基百科(基于封闭世界假设的事实),另一个来自 PHEME 数据集(具有开放世界复杂性的现实世界谣言)。
- 按推理模式对任务进行分层:演绎(如数学、时间关系)与归纳(如因果推断、合理性估计)。
- 在三种提示范式下评估 GPT-3.5-Turbo 和 GPT-4:零样本(ZS)、零样本思维链(ZS CoT)与人工思维链(Manual CoT)。
- 采用三分类评估(真实、虚假、未验证),使用专家标注的推理路径作为真实标签。
- 通过解释的定性分析评估推理质量,尤其关注归纳案例中模型推理依据的重要性。

实验结果
研究问题
- RQ1能否设计一种系统性的逻辑推理框架,将事实与谣言验证分解为原子化、可解释的推理步骤?
- RQ2与简单事实核查相比,GPT-3.5-Turbo 和 GPT-4 在验证现实世界谣言时表现如何?
- RQ3与零样本推理相比,思维链提示是否能提升归纳推理任务中的推理质量与准确性?
- RQ4在证据模糊或不完整的情况下,大语言模型在归纳推理中在多大程度上依赖启发式方法或虚假相关性?
- RQ5大语言模型在验证任务中的推理过程是否反映人类推理方式,还是表现出系统性缺陷(如‘聪明汉斯’行为)?
主要发现
- 在维基百科数据集上,GPT-4 在人工思维链提示下达到 97.4% 的准确率,但在 PHEME 谜题数据集的谣言验证任务中仅达到 52.6%,表明在现实世界复杂性面前性能显著下降。
- 在归纳推理任务中,GPT-4 在零样本提示下的准确率仅为 33.3%,通过零样本思维链提示提升至 44.4%,但在复杂、多部分谣言任务中仍表现不佳。
- 人工思维链生成的解释质量高于零样本或零样本思维链提示,尤其在归纳案例中,推理链条更连贯、逻辑更扎实。
- GPT-3.5-Turbo 表现出类似趋势:在演绎任务中准确率达 76.7%,但在零样本提示下的归纳任务中仅 33.3%,表明其在处理非演绎推理方面存在根本性局限。
- 模型常因过度依赖看似合理但缺乏支持的推断,将未验证的声明误判为真实或虚假,尤其在缺乏强证据时。
- 即使使用思维链提示,模型仍无法稳定生成正确归纳推理路径,表明当前大语言模型并未执行类人归纳推理,而是依赖基于模式的启发式方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。