[论文解读] LM vs LM: Detecting Factual Errors via Cross Examination
该论文提出 LMvLM,一种零样本事实性检测方法,通过一个语言模型(审查者)对另一个语言模型(被审查者)进行多轮提问,以揭露其陈述中的不一致之处。该方法在多个语言模型和基准测试中,实现了超过 70% 的事实错误检测率,且精确率超过 80%,显著优于强基线模型。
A prominent weakness of modern language models (LMs) is their tendency to generate factually incorrect text, which hinders their usability. A natural question is whether such factual errors can be detected automatically. Inspired by truth-seeking mechanisms in law, we propose a factuality evaluation framework for LMs that is based on cross-examination. Our key idea is that an incorrect claim is likely to result in inconsistency with other claims that the model generates. To discover such inconsistencies, we facilitate a multi-turn interaction between the LM that generated the claim and another LM (acting as an examiner) which introduces questions to discover inconsistencies. We empirically evaluate our method on factual claims made by multiple recent LMs on four benchmarks, finding that it outperforms existing methods and baselines, often by a large gap. Our results demonstrate the potential of using interacting LMs for capturing factual errors.
研究动机与目标
- 为解决现代语言模型中事实幻觉这一关键问题,该问题会损害其可靠性与可用性。
- 开发一种无需依赖外部知识或微调的零样本、交互式事实错误检测方法。
- 探究通过语言模型之间的多轮交互进行自我一致性检查,是否能有效揭示事实性错误。
- 在多种语言模型和事实性问答基准测试中评估该方法的有效性。
- 分析审查者语言模型在交叉质询过程中用于检测不一致性的策略。
提出的方法
- 该方法使用两个语言模型:一个(被审查者)生成陈述,另一个(审查者)通过多轮交叉质询检测其中的不一致之处。
- 审查者被提示生成能检验陈述真实性的提问,包括改写、验证推论、分解问题以及要求提供证据。
- 交互过程分为三个阶段:准备、提问和结论,每次提示均包含之前轮次的上下文。
- 审查者评估被审查者的回答,并对原始陈述是否在事实上正确作出最终判断。
- 该方法在零样本设置下实现,通过提示工程为同一或不同语言模型分配不同角色。
- 该方法基于假设:事实错误的陈述在受到严格审查时会产生不一致的回答,从而暴露出内部矛盾。

实验结果
研究问题
- RQ1语言模型能否通过多轮提问有效检测另一语言模型陈述中的事实错误?
- RQ2审查者语言模型在揭露被审查者回答中的不一致性时,采用哪些类型的提问策略?
- RQ3LMvLM 在多种语言模型和基准测试中,与现有事实性检测基线相比表现如何?
- RQ4逻辑不一致(如对改写问题给出矛盾的回答)在多大程度上能作为事实错误的信号?
- RQ5为何该方法在某些语言模型(如 ChatGPT)上表现优于其他模型(如 GPT-3)?推理能力在此过程中起到什么作用?
主要发现
- LMvLM 在多个基准测试中检测到超过 70% 的事实错误,且精确率超过 80%,显著优于强基线模型。
- 该方法在零样本设置下仍能实现高性能检测,无需微调或外部知识。
- 审查者语言模型频繁采用逻辑分解(在 ChatGPT 案例中占 75%)、推论验证(在 ChatGPT 正确检测中占 87.5%)以及问题改写等策略,以暴露不一致性。
- 在被审查者陈述正确的情况下,不一致情况(如对改写问题给出矛盾回答)出现在 14% 的案例中;而在陈述错误且被检测到的情况下,该比例超过 50%。
- 失败案例通常源于被审查者生成了一组内部自洽的虚假事实,使得不一致性难以被察觉。
- ChatGPT 表现优于 GPT-3,部分原因在于其在交叉质询过程中更频繁地使用逻辑分解和验证策略。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。