[论文解读] Complex Claim Verification with Evidence Retrieved in the Wild
本文提出首个完全自动化的流水线,用于在政治主张发布前,利用从网络检索到的原始证据,验证复杂的政治主张。该方法结合主张分解、多阶段检索和基于大语言模型(LLM)的摘要生成。实验表明,与基线方法相比,该方法在真实性分类任务上表现更优,并且即使在现实世界中证据覆盖不全的情况下,人工标注的摘要依然保持忠实且相关。
Evidence retrieval is a core part of automatic fact-checking. Prior work makes simplifying assumptions in retrieval that depart from real-world use cases: either no access to evidence, access to evidence curated by a human fact-checker, or access to evidence available long after the claim has been made. In this work, we present the first fully automated pipeline to check real-world claims by retrieving raw evidence from the web. We restrict our retriever to only search documents available prior to the claim's making, modeling the realistic scenario where an emerging claim needs to be checked. Our pipeline includes five components: claim decomposition, raw document retrieval, fine-grained evidence retrieval, claim-focused summarization, and veracity judgment. We conduct experiments on complex political claims in the ClaimDecomp dataset and show that the aggregated evidence produced by our pipeline improves veracity judgments. Human evaluation finds the evidence summary produced by our system is reliable (it does not hallucinate information) and relevant to answering key questions about a claim, suggesting that it can assist fact-checkers even when it cannot surface a complete evidence set.
研究动机与目标
- 为填补自动事实核查中的空白,通过在主张提出前从网络检索真实世界证据,而非依赖已整理或事后补充的事实核查来源。
- 开发一个完全自动化的流水线,通过将证据检索限制在主张发布前发布的文档中,以模拟现实中的事实核查工作流程。
- 评估基于检索证据生成的聚焦主张摘要的可靠性与相关性,尤其在完整证据不可用的情况下。
- 探究主张分解在提升复杂、多维度政治主张证据检索质量方面的有效性。
- 识别证据检索中的主要失败模式,并提出一种人机协同系统,以迭代方式改进事实核查结果。
提出的方法
- 将复杂政治主张分解为多个是/否子问题,以提高检索精度并覆盖隐含方面。
- 使用商业搜索引擎(Bing)检索与每个子问题相关的文档,且仅限于主张发布日期之前的文档。
- 应用第二阶段细粒度检索模型,从检索到的文档中提取最相关的段落。
- 基于检索到的证据,使用最先进的大语言模型(LLM)生成聚焦主张的摘要,以支持真实性判断。
- 在生成的摘要上训练真实性分类器,以预测主张的真实性,并与专业事实核查员的标注结果进行比较。
- 开展人工评估,通过幻觉、与主张各方面的相关性等标准,评估摘要的忠实度与全面性。
实验结果
研究问题
- RQ1能否通过完全自动化的流水线,在不依赖事实核查网站或已整理语料库的前提下,检索到与复杂政治主张相关的、发布前的网络证据?
- RQ2主张分解在提升从开放网络检索复杂主张证据质量方面有多有效?
- RQ3大语言模型生成的聚焦主张摘要在多大程度上忠实反映了检索到的证据,并能支持准确的真实性判断?
- RQ4在仅依赖发布前网络文档的情况下,证据检索的主要失败模式是什么?
- RQ5当初始自动化结果不足时,人机协同系统能否通过迭代方式改进证据检索与摘要生成?
主要发现
- 与无证据基线相比,该流水线在真实性分类任务上表现更优,证明了网络证据检索的价值。
- 第一阶段检索对36.0%的子问题失败,表明相关发布前证据在网页上常不可用。
- 与仅使用原始主张相比,主张分解显著提升了检索质量,体现在真实性分类性能更高。
- 人工评估确认,生成的摘要大多忠实且相关,14个可完整回答的主张中仅发现一处重大事实错误。
- 检索到的证据通常仅覆盖主张的部分方面,凸显了现实世界事实核查中证据不完整的核心挑战。
- 本研究识别出检索失败的两个主要原因:发布前信息缺失和子问题质量差,提示在问题生成与去上下文化处理方面仍有改进空间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。