[论文解读] A Survey on Automated Fact-Checking
本论文提供了一个全面的、统一的自动化事实核查综述,提出了一个三阶段框架(claim detection,evidence retrieval,claim verification with verdict and justification),回顾数据集与建模方法,并强调未来的挑战。
Fact-checking has become increasingly important due to the speed with which both information and misinformation can spread in the modern media ecosystem. Therefore, researchers have been exploring how fact-checking can be automated, using techniques based on natural language processing, machine learning, knowledge representation, and databases to automatically predict the veracity of claims. In this paper, we survey automated fact-checking stemming from natural language processing, and discuss its connections to related tasks and disciplines. In this process, we present an overview of existing datasets and models, aiming to unify the various definitions given and identify common concepts. Finally, we highlight challenges for future research.
研究动机与目标
- 为自动化事实核查定义一个统一的三阶段框架:主张检测、证据检索和主张核查(裁决与理由)。
- 在各领域与模态上审查数据集与建模策略,以符合该框架。
- 识别可扩展、可解释的自动化事实核查的挑战与未来方向。
- 提供关于数据集类型(主张、证据、裁决)及如何用于训练和评估系统的指南。
提出的方法
- 提出一个三阶段的NLP框架用于自动化事实核查:主张检测、证据检索、以及主张核查(裁决预测和理由生成)。
- 将主张检测回顾为可检查价值的检查与谣言检测,包含二元与排序形式;讨论神经网络与图模型。
- 调查证据检索方法,包括文本、半结构化、知识库来源,以及检索策略和再排序方法。
- 将裁决预测视为二元或多类分类,以及证据在支持裁决中的作用;覆盖数据集与标注方案。
- 讨论理由生成策略,包括基于注意力的解释、基于逻辑的推理、以及基于摘要的解释;解决可读性、可信度与忠实性等标准。
- 总结跨输入类型(文本、知识图、表格等)、领域(新闻、政治、科学、健康)及证据是否明确的数据显示;强调人工与自然主张数据集的差异。
实验结果
研究问题
- RQ1自动化事实核查的一个全面框架应包含哪些要素,如何将现有工作统一到该框架之下?
- RQ2用于评估自动化事实核查系统的常见数据集、输入、证据与裁决/理由格式有哪些?
- RQ3每个组件(主张检测、证据检索、核查与理由)有哪些建模策略,它们如何整合?
- RQ4自动化事实核查的主要挑战与未来研究方向是什么?
主要发现
- 三阶段框架(主张检测、证据检索、主张核查)有效地构建了自动化事实核查研究的结构。
- 证据检索常依赖异质来源(文本、元数据、表格、知识图谱),并可随后进行立场检测或RTE风格的核查。
- 真实性标签范围从二元到多类,有时需要事后规范化;许多数据集将主张与证据配对,有时还附带合理的解释。
- 理由生成在透明性方面越来越受重视,策略包括基于注意力的高亮、逻辑推导、以及基于摘要的解释,强调可读性、可信度和忠实性。
- 存在广泛的数据集,覆盖多语言和领域,包括自然与人工生成的主张,显示了该领域的广度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。