Skip to main content
QUICK REVIEW

[论文解读] Network-based Fake News Detection: A Pattern-driven Approach

Xinyi Zhou, Reza Zafarani|arXiv (Cornell University)|Jun 10, 2019
Misinformation and Its Impacts参考文献 41被引用 17
一句话总结

本文提出一种基于模式驱动的、网络化的方法,用于检测虚假新闻,该方法利用多层次网络结构(节点、自我中心、三元组、社区及整体网络)中的传播模式,以可解释且稳健的方式检测虚假新闻。实验结果表明,该方法在F1值最高达0.93的情况下优于当前最先进的方法,且在早期传播数据有限时仍保持稳定性能。

ABSTRACT

Fake news gains has gained significant momentum, strongly motivating the need for fake news research. Many fake news detection approaches have thus been proposed, where most of them heavily rely on news content. However, network-based clues revealed when analyzing news propagation on social networks is an information that has hardly been comprehensively explored or used for fake news detection. We bridge this gap by proposing a network-based pattern-driven fake news detection approach. We aim to study the patterns of fake news in social networks, which refer to the news being spread, spreaders of the news and relationships among the spreaders. Empirical evidence and interpretations on the existence of such patterns are provided based on social psychological theories. These patterns are then represented at various network levels (i.e., node-level, ego-level, triad-level, community-level and the overall network) for being further utilized to detect fake news. The proposed approach enhances the explainability in fake news feature engineering. Experiments conducted on real-world data demonstrate that the proposed approach can outperform the state of the arts.

研究动机与目标

  • 为解决现有虚假新闻检测方法中对基于网络的传播线索利用不全面的问题,特别是超越内容分析的局限。
  • 基于社会心理学理论,探究并验证虚假新闻传播中存在差异的模式,如更广范围的传播、更多传播者、更强的互动性以及更紧密的传播者间连接。
  • 设计可解释的、多层次的网络特征(节点、自我中心、三元组、社区、网络),以捕捉这些传播模式,从而提升检测效果。
  • 通过最少的传播数据实现虚假新闻的早期检测,减少对内容的依赖,增强对风格操纵的鲁棒性。
  • 在真实世界数据集上,证明该方法在性能上优于当前最先进的基于内容和混合模型的检测方法。

提出的方法

  • 该方法识别出四种关键的虚假新闻传播模式:更广范围的传播、更多的传播者、更强的互动性以及传播者之间更紧密的连接,其理论基础源于社会心理学理论。
  • 在五个抽象层次上构建网络级特征:节点级(如度数、介数)、自我中心级(局部网络结构)、三元组级(团块模式)、社区级(模块度、密度)以及网络级(全局指标)。
  • 特征来源于真实社交网络中新闻传播的数据,聚焦于结构模式而非文本内容。
  • 采用监督学习框架,利用这些基于模式的特征将新闻分类为虚假或真实,通过显式表示网络模式提升模型可解释性。
  • 引入网络相似性度量以提升性能,尤其在传播数据稀疏的早期检测场景中表现更优。
  • 在两个真实世界数据集(PolitiFact 和 BuzzFeed)上评估该方法,包括对特征贡献的消融研究,以及对数据稀疏性和类别不平衡的鲁棒性分析。

实验结果

研究问题

  • RQ1与真实新闻相比,虚假新闻在社交网络中是否表现出独特的传播模式,且这些模式能否通过实证方法验证?
  • RQ2能否系统性地提取并利用网络级结构模式(如传播者密度和互动性)来检测虚假新闻?
  • RQ3不同网络抽象层次(节点、自我中心、三元组、社区、网络)对虚假新闻检测性能的贡献如何?
  • RQ4该方法能否在传播数据有限的早期阶段有效检测虚假新闻?
  • RQ5与基于内容和当前最先进的检测模型相比,该基于模式的方法在准确性和鲁棒性方面表现如何?

主要发现

  • 当使用所有传播模式和网络相似性特征时,该方法在 BuzzFeed 数据集上达到最高 0.93 的 F1 分数,在 PolitiFact 数据集上达到 0.90 的 F1 分数。
  • 即使训练数据有限,性能依然稳定,仅使用少量训练文章时,准确率仍保持在约 0.73 至约 0.90 之间。
  • 在早期检测场景中,该方法保持高性能,当仅提供部分节点或边的子网络时,准确率和 F1 分数均在约 0.80 至约 0.90 的范围内。
  • 训练集中虚假与真实新闻的分布对性能的影响大于新闻文章总数,表明对类别不平衡较为敏感。
  • 引入网络相似性特征显著提升了检测性能,尤其对“更多传播者模式”和“更强互动性模式”的提升效果明显。
  • 该方法对内容操纵具有鲁棒性,因其对文本特征的依赖极低,因而更难被恶意行为者通过风格混淆手段所干扰。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。