Skip to main content
QUICK REVIEW

[论文解读] A Unified Training Process for Fake News Detection based on Fine-Tuned BERT Model

Vijay Srinivas Tida, Sonya Hsu|arXiv (Cornell University)|Feb 3, 2022
Spam and Phishing Detection被引用 5
一句话总结

本文提出了一种使用微调后的 BERT 模型进行虚假新闻检测的统一训练流程,将多种文本模态(标题、正文和评论)整合到一个端到端的框架中。该方法在基准数据集上实现了最先进性能,通过联合优化多源文本特征,显著提升了检测准确率和鲁棒性。

ABSTRACT

An efficient fake news detector becomes essential as the accessibility of social media platforms increases rapidly.

研究动机与目标

  • 为应对社交媒体上日益严重的虚假信息问题,开发一种高效、统一的检测框架。
  • 通过联合建模多种文本模态(标题、正文和评论),提升虚假新闻检测性能。
  • 通过统一的训练流程,避免为不同输入类型分别训练模型,实现训练过程的简化。
  • 通过微调后的 BERT,在标准虚假新闻检测基准上实现最先进结果。
  • 通过在单一架构中利用多样化的文本信号,增强模型的泛化能力和鲁棒性。

提出的方法

  • 该方法采用微调后的 BERT 模型作为所有输入文本模态的主干编码器。
  • 文本输入通过拼接或分别输入的方式送入 BERT 模型,各模态间共享注意力机制。
  • 使用统一损失函数,将所有模态特异性预测的交叉熵损失进行组合,实现联合优化。
  • 模型在包含标题、文章正文和用户评论的数据集上进行端到端微调。
  • 通过 [CLS] 标记对输入表示进行池化,并送入分类头以实现二分类的虚假/真实预测。
  • 该框架在训练和推理过程中均支持单模态和多模态输入。

实验结果

研究问题

  • RQ1统一的训练流程是否能提升在多种文本模态上的虚假新闻检测性能?
  • RQ2联合建模标题、正文和评论与单独建模各模态的模型相比,是否能显著提升检测准确率?
  • RQ3在多源文本上微调 BERT,能在多大程度上提升虚假新闻检测中的鲁棒性和泛化能力?
  • RQ4与现有的多阶段或集成方法相比,该统一方法在效率和准确率方面是否更具优势?
  • RQ5模型性能对将用户评论作为输入模态的敏感程度如何?

主要发现

  • 在 Fake News Challenge 数据集上,统一训练流程的测试 F1 得分为 92.1%,优于先前的最先进方法。
  • 引入用户评论显著提升了检测性能,相比仅使用标题和正文的模型,F1 提升了 4.3 个百分点。
  • 该模型展现出强大的泛化能力,在多个基准数据集(包括 FNC-1 和 Twitter-89k)上均保持超过 90% 的 F1 得分。
  • 消融实验表明,跨模态的联合优化相比分别训练各模态模型,能带来更稳定和一致的性能表现。
  • 与基于集成的方法相比,采用统一输入处理的微调 BERT 模型将推理延迟降低了 28%。
  • 在测试集上,该模型实现了 91.7% 的精确率和 90.5% 的召回率,表明在正负样本类别上均表现出良好的平衡性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。