[论文解读] Evidence-based Verification for Real World Information Needs.
本文提出一个大规模、真实世界的事实核查数据集,包含从实际搜索查询中提取的10,987个声明,并在章节和句子层面进行了细粒度的维基百科证据标注。结果表明,先进行证据抽取再进行蕴含识别的方法在准确率上与立场分类相当,从而实现了可解释性强、具备推理过程的事实核查。
Claim verification is the task of predicting the veracity of written statements against evidence. Previous large-scale datasets model the task as classification, ignoring the need to retrieve evidence, or are constructed for research purposes, and may not be representative of real-world needs. In this paper, we introduce a novel claim verification dataset with instances derived from search-engine queries, yielding 10,987 claims annotated with evidence that represent real-world information needs. For each claim, we annotate evidence from full Wikipedia articles with both section and sentence-level granularity. Our annotation allows comparison between two complementary approaches to verification: stance classification, and evidence extraction followed by entailment recognition. In our comprehensive evaluation, we find no significant difference in accuracy between these two approaches. This enables systems to use evidence extraction to summarize a rationale for an end-user while maintaining the accuracy when predicting a claim's veracity. With challenging claims and evidence documents containing hundreds of sentences, our dataset presents interesting challenges that are not captured in previous work -- evidenced through transfer learning experiments. We release code and data to support further research on this task.
研究动机与目标
- 为填补现有数据集的空白,创建一个基于真实世界信息需求(源自实际搜索查询)的事实核查基准。
- 构建一个高质量、细粒度的证据标注数据集,证据来源为完整的维基百科文章,包含章节级和句子级引用。
- 支持对两种互补的验证方法进行评估:立场分类与证据抽取后接蕴含识别。
- 提供一个具有挑战性的迁移学习基准,反映复杂、长篇幅的证据文档,具备真实世界适用性。
- 通过发布代码和数据,支持未来研究的可复现性与进一步发展。
提出的方法
- 从真实搜索引擎查询日志中收集声明,以确保与真实用户的信息需求保持一致。
- 为每个声明标注来自完整维基百科文章的证据,精确指定章节和句子级别的引用。
- 设计双评估框架,用于比较立场分类与证据抽取+蕴含识别两种流程。
- 使用人工标注的证据训练并评估两种验证范式下的模型,确保结果的一致性与可靠性。
- 在该数据集上开展迁移学习实验,评估模型的泛化能力,并与先前基准相比衡量其挑战程度。
- 发布完整数据集和代码,以支持社区研究和可复现性。
实验结果
研究问题
- RQ1在真实世界事实核查中,证据抽取后接蕴含识别的方法是否能达到与立场分类相当的准确率?
- RQ2与合成或人工筛选的数据集相比,基于真实用户搜索查询的声明,其模型表现如何?
- RQ3长篇、多句的证据文档的复杂性在多大程度上挑战了现有验证模型?
- RQ4采用证据抽取的系统是否能在不牺牲事实预测准确率的前提下,提供可解释的推理过程?
- RQ5该数据集的真实世界特性如何影响不同模型架构之间的迁移学习性能?
主要发现
- 在所提出的数据集中,立场分类与证据抽取后接蕴含识别在准确率上无显著差异。
- 由于证据文档长度长、内容复杂,包含数百个句子,该数据集构成了有意义的挑战,其复杂度超过以往基准。
- 迁移学习实验表明,基于该数据集训练的模型面临此前数据集未捕捉到的独特挑战,表明其具有更高的真实世界保真度。
- 细粒度的证据标注使系统能够在保持高预测准确率的同时,生成可解释的推理过程。
- 数据集与代码的发布,为未来可解释、基于证据的事实核查研究提供了支持。
- 研究结果验证了证据抽取可作为端到端立场分类在真实世界应用中的可行且透明的替代方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。