Skip to main content
QUICK REVIEW

[论文解读] GAME-ON: Graph Attention Network based Multimodal Fusion for Fake News Detection

Mudit Dhawan, Shakshi Sharma|arXiv (Cornell University)|Feb 25, 2022
Misinformation and Its Impacts被引用 19
一句话总结

该论文提出 GAME-ON,一种基于图注意力网络的端到端多模态融合框架,用于虚假新闻检测,通过为文本和视觉模态构建全连接图,建模细粒度的模态内与模态间交互。在 Twitter 数据集上,其平均性能相比 SOTA 提升 11%,且参数量比最佳可比基线减少 65%,展现出在多模态虚假新闻检测任务中卓越的效率与鲁棒性。

ABSTRACT

Social media in present times has a significant and growing influence. Fake news being spread on these platforms have a disruptive and damaging impact on our lives. Furthermore, as multimedia content improves the visibility of posts more than text data, it has been observed that often multimedia is being used for creating fake content. A plethora of previous multimodal-based work has tried to address the problem of modeling heterogeneous modalities in identifying fake content. However, these works have the following limitations: (1) inefficient encoding of inter-modal relations by utilizing a simple concatenation operator on the modalities at a later stage in a model, which might result in information loss; (2) training very deep neural networks with a disproportionate number of parameters on small but complex real-life multimodal datasets result in higher chances of overfitting. To address these limitations, we propose GAME-ON, a Graph Neural Network based end-to-end trainable framework that allows granular interactions within and across different modalities to learn more robust data representations for multimodal fake news detection. We use two publicly available fake news datasets, Twitter and Weibo, for evaluations. Our model outperforms on Twitter by an average of 11% and keeps competitive performance on Weibo, within a 2.6% margin, while using 65% fewer parameters than the best comparable state-of-the-art baseline.

研究动机与目标

  • 解决先前多模态虚假新闻检测模型采用简单拼接方式进行晚期融合所导致的信息损失问题,以及模态间异质性差距无法有效处理的问题。
  • 通过降低模型复杂度,在保持性能的同时缓解在小规模、复杂真实世界多模态数据集上训练深层模型时的过拟合风险。
  • 通过统一的图结构架构,实现文本与视觉模态的早期、细粒度融合,同时建模模态内与模态间关系。
  • 开发一种轻量化但强大的框架,在包括 Twitter 和 Weibo 在内的多样化多模态数据集上实现良好泛化能力,且参数量极少。

提出的方法

  • 该框架为文本和视觉模态分别构建全连接图,其中节点表示语义与句法嵌入(文本)或检测到的物体特征(图像),边表示节点之间的关系。
  • 在每个模态图上应用图注意力网络(GATs),以自适应地学习邻近节点的注意力权重,捕捉每个模态内的局部与全局依赖关系。
  • 在文本图与视觉图的对应节点之间引入跨模态连接,实现直接与间接的跨模态信息传递,从而减小模态间的异质性差距。
  • 通过在模态内图与跨模态图上联合训练 GAT,实现早期融合,使网络从一开始就学习联合表示。
  • 最终通过平均池化操作对节点表示进行聚合,再接分类头完成二分类的虚假新闻检测任务。
  • 整个框架端到端可训练,使用标准交叉熵损失函数,联合优化准确率与 F1 分数。

实验结果

研究问题

  • RQ1能否通过同时建模模态内与模态间关系的图基多模态融合框架,在虚假新闻检测任务中超越晚期融合基线?
  • RQ2图注意力机制是否能通过自适应聚焦于多模态图中的相关节点与边,提升表征学习效果?
  • RQ3轻量级 GNN 框架能否在显著减少参数量的前提下,实现与现有复杂模型相当甚至更优的 SOTA 性能?
  • RQ4通过统一图架构实现的早期融合,在多大程度上能减小文本与视觉模态之间的异质性差距?

主要发现

  • 在 Twitter 数据集上,GAME-ON 在所有评估指标(准确率与 F1 分数)上相比当前 SOTA 模型 CALM 平均提升 11%。
  • 在 Weibo 数据集上,GAME-ON 的性能与最佳复杂 SOTA 模型相差仅 2.6%,展现出强大的泛化能力。
  • 该模型参数量仅约 100 万,相比最佳可比基线 MCAN(290 万参数)减少了约 65%。
  • 消融实验表明,若移除跨模态连接,准确率平均下降 4.6%,F1 分数平均下降 5.7%,证实了跨模态交互的重要性。
  • 将 GAT 层替换为 GCN 层(GCN-Fusion 变体)导致 F1 分数下降 2.1%,准确率下降 2.7%,凸显注意力机制的优势。
  • 单模态视觉模型在 Twitter 上达到 86.2% 的准确率,表明视觉特征本身具有高度预测能力,但通过 GAME-ON 实现的多模态融合可显著提升性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。