Skip to main content
QUICK REVIEW

[论文解读] False News Detection on Social Media

Juan Cao, Qiang Sheng|arXiv (Cornell University)|Aug 28, 2019
Misinformation and Its Impacts参考文献 25被引用 10
一句话总结

本文介绍了新浪微博上的一项多模态虚假新闻检测竞赛,提出了三个子任务——文本检测、图像检测和多模态检测,基于新发布的 MCG-FNeWS 数据集。结果表明,早期融合文本与图像特征可达到最高的 F1 分数(0.875),优于单一模态模型和晚期融合,凸显了多模态融合在实时虚假新闻检测中的有效性。

ABSTRACT

Social media has become a major information platform where people consume and share news. However, it has also enabled the wide dissemination of false news, i.e., news posts published on social media that are verifiably false, causing significant negative effects on society. In order to help prevent further propagation of false news on social media, we set up this competition to motivate the development of automated real-time false news detection approaches. Specifically, this competition includes three sub-tasks: false-news text detection, false-news image detection and false-news multi-modal detetcion, which aims to motivate participants to further explore the efficiency of multiple modalities in detecting false news and reasonable fusion approaches of multi-modal contents. To better support this competition, we also construct and publicize a multi-modal data repository about False News on Weibo Social platform(MCG-FNeWS}) to help evaluate the performance of different approaches from participants.

研究动机与目标

  • 为应对社交媒体上虚假新闻快速传播并造成社会危害的紧迫需求,实现其实时检测。
  • 探究文本、视觉和多模态特征在区分虚假与真实新闻方面的有效性。
  • 提供一个基准数据集和竞赛框架,以加速自动化虚假新闻检测的研究。
  • 鼓励引入外部知识(例如,辟谣资源库)以提升检测性能。
  • 评估并比较不同模态间融合策略在提升检测准确率方面的表现。

提出的方法

  • 提出一个包含三个子任务的竞赛框架:虚假新闻文本检测、图像检测和多模态检测。
  • 构建了 MCG-FNeWS,一个包含超过 10,000 条微博帖子的大规模多模态数据集,涵盖平衡的虚假与真实新闻,包含文本、图像和发布者资料。
  • 分别使用预训练的 BERT 和 VGG19 模型作为文本和图像模态的特征提取器。
  • 采用早期融合(模态嵌入的拼接)和晚期融合(预测结果的聚合)实现多模态融合。
  • 引入一种基于注意力的融合模型(attRNN),在神经元层面学习跨模态交互。
  • 提供一个包含 37,877 条来自权威来源的反驳内容的辟谣资源库,以支持知识增强型检测。

实验结果

研究问题

  • RQ1仅依靠文本特征在社交媒体虚假新闻检测中的有效性如何?
  • RQ2视觉内容(如篡改或具有误导性的图像)在多大程度上可作为虚假新闻的信号?
  • RQ3如何最优地融合文本与视觉特征以提升虚假新闻检测性能?
  • RQ4外部知识(如事实核查反驳)如何增强自动化检测系统的准确性?
  • RQ5多模态融合策略是否能在实时虚假新闻检测中超越单模态方法?

主要发现

  • 早期融合基线在多模态子任务中取得了最高的 F1 分数(0.875),优于晚期融合(F1:0.836)和 attRNN(F1:0.845)。
  • 基于 BERT 的文本建模取得了 0.854 的 F1 分数,表明其在利用语言线索进行虚假新闻检测方面表现强劲。
  • 预训练的 VGG19 取得了 0.671 的 F1 分数,而微调后的 VGG19 提升至 0.687,表明微调在视觉特征上的价值。
  • 最先进的视觉检测模型 MVNN 取得了 0.772 的 F1 分数,显著优于标准的 VGG19 基线。
  • MCG-FNeWS 数据集包含超过 10,000 条平衡的虚假与真实新闻帖子,外部辟谣资源库中包含 37,877 条反驳内容。
  • 竞赛框架与数据集为评估多模态虚假新闻检测系统提供了稳健的基准,早期融合被证明是最有效的融合策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。