[论文解读] Multimodal Fusion with BERT and Attention Mechanism for Fake News Detection
该论文提出了一种多模态虚假新闻检测模型,通过一种新颖的缩放点积注意力机制,将 BERTweet 提取的文本特征与 VGG-19 提取的视觉特征进行融合,以捕捉跨模态关系。该方法在 MediaEval 2016 数据集上实现了 81.2% 的准确率和 80.8% 的 F1 分数,相比最先进方法在准确率上高出 3.1%,在宏平均 F1 上高出 4.4%。
Fake news detection is an important task for increasing the credibility of information on the media since fake news is constantly spreading on social media every day and it is a very serious concern in our society. Fake news is usually created by manipulating images, texts, and videos. In this paper, we present a novel method for detecting fake news by fusing multimodal features derived from textual and visual data. Specifically, we used a pre-trained BERT model to learn text features and a VGG-19 model pre-trained on the ImageNet dataset to extract image features. We proposed a scale-dot product attention mechanism to capture the relationship between text features and visual features. Experimental results showed that our approach performs better than the current state-of-the-art method on a public Twitter dataset by 3.1% accuracy.
研究动机与目标
- 通过利用多模态数据提升检测准确率,应对社交媒体传播虚假新闻带来的日益严重的社会威胁。
- 通过融合文本与视觉特征,克服单模态方法的局限性,以捕捉虚假新闻中互补的信号。
- 通过引入一种新颖的缩放点积注意力机制,增强特征融合,以建模文本与图像之间的跨模态依赖关系。
- 通过在推文上进行领域特定的预训练,证明 BERTweet 相较于通用领域 BERT 模型在社交媒体文本处理中的优势。
- 验证注意力机制在识别虚假新闻中文本与图像内容不一致方面的有效性。
提出的方法
- 利用 BERTweet(一种在 8.5 亿条英文推文上微调的 BERT 变体)从文本内容中提取上下文相关的句子嵌入。
- 从在 ImageNet 上微调的预训练 VGG-19 模型中提取视觉特征,以捕捉高层次的图像表征。
- 实现一种缩放点积注意力机制,计算文本特征与视觉特征之间的动态注意力权重,实现自适应融合。
- 对图像特征应用自注意力机制,以建模其内部的空间关系,提升视觉表征学习能力。
- 将跨模态注意力与自注意力的输出结果,与原始的文本和视觉特征进行拼接,用于最终分类。
- 将融合后的特征表示通过全连接层,再经 Sigmoid 激活函数,实现二元虚假新闻分类。
实验结果
研究问题
- RQ1与单模态模型相比,结合基于 BERT 的文本嵌入与基于 VGG-19 的图像特征的多模态方法是否能提升虚假新闻检测的准确率?
- RQ2新颖的缩放点积注意力机制是否能有效捕捉虚假新闻中文本与图像内容之间的跨模态依赖关系?
- RQ3在 Twitter 数据集上,经过社交媒体数据预训练的 BERTweet 相较于通用领域 BERT 模型,在虚假新闻检测中表现如何?
- RQ4注意力热图在多大程度上能揭示虚假新闻中文本与图像内容之间的不一致性?这些不一致性能否与检测性能建立定量关联?
- RQ5对图像特征应用自注意力机制,是否能提升模型检测图像篡改或内容误导的能力?
主要发现
- 所提出的模型在 MediaEval 2016 数据集上实现了 81.2% 的准确率和 80.8% 的 F1 分数,相比之前最先进方法(Spotfake)在准确率上高出 3.1%,在宏平均 F1 上高出 4.4%。
- BERTweet 在同一数据集上优于 BERT base 和 BERT large,达到 81.2% 的准确率,表明在社交媒体文本上进行领域特定预训练具有显著优势。
- 注意力热图直观表明,虚假新闻图像的区域间注意力相关性较低,表明存在图像篡改或图文不匹配的情况,而真实新闻则表现出连贯的跨模态注意力模式。
- 模型对图像特征应用的自注意力机制成功捕捉了空间关系,提升了对非修图但语境具有误导性的图像的检测能力。
- 消融实验证实,跨模态注意力与自注意力的结合显著提升了性能,完整模型优于所有基线模型,包括 EANN、MVAE 和 att-RNN。
- 该模型在虚假新闻上的精确率为 84.3%,召回率为 81.0%,F1 得分为 76.7%,表明其在识别欺骗性内容方面具有强大的泛化能力与鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。