Skip to main content
QUICK REVIEW

[论文解读] A Coarse-to-fine Cascaded Evidence-Distillation Neural Network for Explainable Fake News Detection

Zhiwei Yang, Jing Ma|arXiv (Cornell University)|Sep 29, 2022
Misinformation and Its Impacts被引用 10
一句话总结

本文提出 CofCED,一种从原始报告中直接检测虚假新闻并生成可信度解释的粗粒度到细粒度级联证据提炼神经网络——无需依赖人工事实核查。通过利用陈述相关性、信息丰富度、显著性及非冗余性,CofCED 在两个新构建的数据集上优于最先进基线模型,实现了更高的检测准确率以及来自多样化证据源的高质量、可解释性说明。

ABSTRACT

Existing fake news detection methods aim to classify a piece of news as true or false and provide veracity explanations, achieving remarkable performances. However, they often tailor automated solutions on manual fact-checked reports, suffering from limited news coverage and debunking delays. When a piece of news has not yet been fact-checked or debunked, certain amounts of relevant raw reports are usually disseminated on various media outlets, containing the wisdom of crowds to verify the news claim and explain its verdict. In this paper, we propose a novel Coarse-to-fine Cascaded Evidence-Distillation (CofCED) neural network for explainable fake news detection based on such raw reports, alleviating the dependency on fact-checked ones. Specifically, we first utilize a hierarchical encoder for web text representation, and then develop two cascaded selectors to select the most explainable sentences for verdicts on top of the selected top-K reports in a coarse-to-fine manner. Besides, we construct two explainable fake news datasets, which are publicly available. Experimental results demonstrate that our model significantly outperforms state-of-the-art baselines and generates high-quality explanations from diverse evaluation perspectives.

研究动机与目标

  • 为解决现有虚假新闻检测方法严重依赖人工核查报告的局限性,这些报告覆盖有限且存在延迟。
  • 开发一种可泛化的、可解释的虚假新闻检测框架,利用原始媒体报告中的群体智慧。
  • 通过显式建模四个关键特征——陈述相关性、信息丰富度、显著性与非冗余性——生成高质量、语义连贯的解释。
  • 构建两个真实、公开可用的数据集——RAWFC 和 LIAR-RAW——包含每条新闻陈述的原始报告。
  • 证明从原始报告中提炼的证据可在可信度预测与解释生成两方面均达到最先进性能。

提出的方法

  • 使用分层编码器表示来自原始报告的网络文本,捕捉句子级与文档级语义。
  • 设计两级级联选择器,采用粗粒度到细粒度的方式:首先筛选出最值得核查的 K 篇报告,然后从中提炼最具解释力的句子。
  • 模型显式优化四种语义特征:陈述相关性(句子支持陈述的程度)、信息丰富度(信息密度)、显著性(对预测的重要性)以及非冗余性(跨句子的独特性)。
  • 采用多任务自适应加权(MAW)机制,动态平衡可信度预测与解释生成之间的权衡,避免手动网格搜索。
  • 模型使用软阈值机制(ε),基于总句数自动确定每篇报告的相关句子数量。
  • 端到端联合训练框架结合可信度分类与解释生成目标,实现两者之间的相互增强。

实验结果

研究问题

  • RQ1神经网络能否仅使用原始报告有效检测虚假新闻并生成准确、可解释的说明,而无需依赖已核查文章?
  • RQ2陈述相关性、句子信息丰富度、显著性与非冗余性在选择高质量证据句子用于解释生成方面分别起到何种作用?
  • RQ3与单阶段基线相比,粗粒度到细粒度的级联选择机制在多大程度上提升了解释质量与检测准确率?
  • RQ4所提出的多任务自适应加权(MAW)机制与固定参数或网格搜索策略相比,在平衡解释与检测性能方面表现如何?
  • RQ5该模型能否在多样化的真实世界陈述中泛化,尤其是针对细粒度可信度标签中词重叠较少的情况?

主要发现

  • CofCED 在 RAWFC 与 LIAR-RAW 两个数据集上的可信度预测任务中显著优于最先进基线模型,展现出更优的检测性能。
  • 模型生成的解释质量高、语义连贯,在人工评估中被一致评为更准确、更具可解释性。
  • 消融实验证明,四个特征——相关性、信息丰富度、显著性与非冗余性——均对解释质量有显著贡献,其中非冗余性在过滤低价值句子方面尤为有效。
  • 多任务自适应加权(MAW)机制优于固定参数或网格搜索策略,无需人工调参即可持续平衡解释与检测目标。
  • 当在 RAWFC 数据集中选择 12 篇报告、在 LIAR-RAW 数据集中选择 18 篇报告时,模型表现最佳,表明最优报告选择数量依赖于数据集,且对报告数量敏感。
  • 案例研究证实,模型的注意力机制正确对齐于反驳虚假陈述的关键证据句子,特征得分的可视化也清晰揭示了驱动分类决策的主要因素。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。