Skip to main content
QUICK REVIEW

[论文解读] MultiFC: A Real-World Multi-Domain Dataset for Evidence-Based Fact Checking of Claims

Isabelle Augenstein, Christina Lioma|arXiv (Cornell University)|Sep 7, 2019
Topic Modeling参考文献 36被引用 9
一句话总结

本文提出了 MultiFC,这是目前公开可用的最大规模真实世界数据集,用于基于证据的主张验证,包含来自 26 个事实核查网站的 34,918 个自然发生的主张,以及对应的证据页面和丰富的元数据。该研究提出了一种新颖的联合模型,用于证据排序与真实性预测,取得了 49.2% 的 Macro F1,表明证据编码和元数据显著提升了基线模型的性能。

ABSTRACT

We contribute the largest publicly available dataset of naturally occurring factual claims for the purpose of automatic claim verification. It is collected from 26 fact checking websites in English, paired with textual sources and rich metadata, and labelled for veracity by human expert journalists. We present an in-depth analysis of the dataset, highlighting characteristics and challenges. Further, we present results for automatic veracity prediction, both with established baselines and with a novel method for joint ranking of evidence pages and predicting veracity that outperforms all baselines. Significant performance increases are achieved by encoding evidence, and by modelling metadata. Our best-performing model achieves a Macro F1 of 49.2%, showing that this is a challenging testbed for claim veracity prediction.

研究动机与目标

  • 通过从多样化的事实核查来源收集自然发生的主张,解决自动主张真实性预测中缺乏大规模真实世界数据集的问题。
  • 分析真实世界主张验证的特征与挑战,包括实体多样性、标签分布和元数据的实用性。
  • 开发并评估利用证据文档和元数据的最先进真实性预测模型。
  • 证明联合建模证据排序与真实性预测可优于独立处理这些任务的模型。

提出的方法

  • 通过从 Politifact 和 Snopes 等 26 个事实核查网站收集主张、相关证据页面以及丰富的元数据(如发言者、标签、发布日期)构建数据集。
  • 提出一种新颖的联合模型(crawled_ranked + meta),利用共享表示的神经网络,同时对证据页面进行排序并预测主张的真实性。
  • 使用基于 BERT 的编码器对主张、证据页面和元数据(如发言者、标签)进行编码,并应用标签嵌入以提升分类性能。
  • 采用多任务学习(MTL)框架,同时在多个领域上训练模型,以提升泛化能力和性能。
  • 通过消融实验评估证据编码、元数据和标签嵌入对模型性能的贡献。
  • 使用多个领域的 Micro 和 Macro F1 分数对模型进行训练与评估,并对预测混淆和失败案例进行详细分析。

实验结果

研究问题

  • RQ1真实世界证据页面和元数据的引入如何影响主张真实性预测模型的性能?
  • RQ2能否通过一个联合模型同时完成证据页面排序与真实性预测,从而优于将两项任务分开处理的模型?
  • RQ3不同类型元数据(如发言者、标签和类别)对真实性预测性能的相对贡献如何?
  • RQ4主张长度、实体具体性以及证据重叠程度如何影响模型的准确率和混淆模式?
  • RQ5当前模型在真实世界主张验证中的主要失败模式是什么,特别是在处理模糊或复杂主张时?

主要发现

  • 所提出的联合模型 crawled_ranked + meta 实现了 49.2% 的 Macro F1,显著优于所有已建立的基线模型。
  • 证据页面的编码对性能有显著贡献,最佳模型相比仅使用主张的基线模型表现大幅提升。
  • 元数据,尤其是主题标签,显著提升了性能,完整元数据编码的模型 Macro F1 高于无元数据的情况。
  • 模型在证据重叠度高且标签具体、信息丰富的主张上表现最佳,而在长而复杂的主张以及模糊证据上表现较差。
  • 混淆最常发生在语义相近的标签之间,如 '大部分真实' 与 '一半真实',表明细粒度真实性分类存在挑战。
  • 标签数量较多的领域(如 tron、snes)性能较低,而部分小规模领域因主张表述明确而达到完美得分。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。