[论文解读] AVeriTeC: A Dataset for Real-world Claim Verification with Evidence from the Web
AVeriTeC 引入了一个包含 4,568 个来自 50 家事实核查组织的真实世界声明的新数据集,这些声明均附有网络检索到的证据、问题-答案对以及对判断结果的详细论证。该数据集通过多轮标注流程,解决了现有事实核查基准中的关键局限性——上下文依赖性、证据不足和时间泄漏问题,实现了较高的标注者间一致性(κ = 0.619),并为使用搜索和上下文学习进行检索增强的事实核查提供了基线。
Existing datasets for automated fact-checking have substantial limitations, such as relying on artificial claims, lacking annotations for evidence and intermediate reasoning, or including evidence published after the claim. In this paper we introduce AVeriTeC, a new dataset of 4,568 real-world claims covering fact-checks by 50 different organizations. Each claim is annotated with question-answer pairs supported by evidence available online, as well as textual justifications explaining how the evidence combines to produce a verdict. Through a multi-round annotation process, we avoid common pitfalls including context dependence, evidence insufficiency, and temporal leakage, and reach a substantial inter-annotator agreement of $κ=0.619$ on verdicts. We develop a baseline as well as an evaluation scheme for verifying claims through several question-answering steps against the open web.
研究动机与目标
- 解决现有自动化事实核查数据集中存在的关键局限性,包括人为构造的声明、证据标注不足以及时间数据泄漏问题。
- 通过来自开放网络的证据,创建一个真实、可扩展的基准,用于现实世界声明的验证。
- 通过声明标准化和证据充分性检查,减轻上下文依赖性,确保高质量标注。
- 通过将证据限制在声明日期之前发布的文档,并强制训练/开发/测试划分的时间顺序,防止时间泄漏。
- 通过问题-答案分解和人工论证推理,提供一种结构化、可解释的验证框架。
提出的方法
- 声明通过 Google FactCheck Claim Search API 从 50 家事实核查组织获取,确保其现实世界的相关性。
- 多轮标注流程包括声明标准化、问题-答案对生成以及证据充分性检查,以减少上下文依赖性和证据不足问题。
- 通过‘盲测’质量控制步骤重新标注证据不足的声明,确保结果的稳健性和一致性。
- 时间约束确保仅使用声明日期之前发布的证据,从而消除各划分之间的时序泄漏。
- 开发了一个基于检索的基线模型,结合 Google 搜索、BM25 检索、上下文提示和立场检测模型。
- 标注者生成论证以解释推理过程,包括比较、四舍五入和冲突检测,确保可解释性。
实验结果
研究问题
- RQ1能否在避免上下文依赖性的前提下,使用真实世界声明和网络检索证据构建事实核查数据集?
- RQ2如何通过迭代式标注和质量控制最小化自动化事实核查数据集中的证据不足问题?
- RQ3通过时间顺序划分和证据来源约束,能在多大程度上防止基准数据集中的时间泄漏?
- RQ4问题-答案分解在自动化声明验证中能否提升可解释性和性能?
- RQ5使用开放网络证据和上下文学习的检索增强基线在真实世界声明上的表现如何?
主要发现
- AVeriTeC 包含来自 50 家事实核查组织的 4,568 个真实世界声明,声明通过 Google FactCheck Claim Search API 获取。
- 该数据集包含每个判断结果的问题-答案对和详细论证,支持可解释的验证。
- 标注者间对判断结果的一致性达到 0.619 的自由边际加权 Cohen's kappa,表明一致性较强。
- 通过利用事实核查文章中的信息对声明进行标准化,标注流程成功减轻了上下文依赖性。
- 通过多轮标注和盲测质量控制步骤(重新标注证据不足的声明),证据不足问题得到显著减少。
- 通过将证据限制在声明日期之前发布的文档,并强制训练/开发/测试划分的时间顺序,成功防止了时间泄漏。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。