Skip to main content
QUICK REVIEW

[論文レビュー] GAME-ON: Graph Attention Network based Multimodal Fusion for Fake News Detection

Mudit Dhawan, Shakshi Sharma|arXiv (Cornell University)|Feb 25, 2022
Misinformation and Its Impacts被引用数 19
ひとこと要約

本稿では、テキストおよび視覚的モダリティの完全連結グラフを用いて、細粒度なモダリティ内およびモダリティ間の相互作用をモデル化する、グラフ自己注意ネットワークに基づくエンドツーエンドのマルチモーダル統合フレームワークであるGAME-ONを提案する。この手法は、TwitterにおいてSOTAを11%上回る平均的な性能向上を達成し、最も類似したベースライン比で65%少ないパラメータを用いることで、マルチモーダルフェイクニュース検出における優れた効率性とロバスト性を示している。

ABSTRACT

Social media in present times has a significant and growing influence. Fake news being spread on these platforms have a disruptive and damaging impact on our lives. Furthermore, as multimedia content improves the visibility of posts more than text data, it has been observed that often multimedia is being used for creating fake content. A plethora of previous multimodal-based work has tried to address the problem of modeling heterogeneous modalities in identifying fake content. However, these works have the following limitations: (1) inefficient encoding of inter-modal relations by utilizing a simple concatenation operator on the modalities at a later stage in a model, which might result in information loss; (2) training very deep neural networks with a disproportionate number of parameters on small but complex real-life multimodal datasets result in higher chances of overfitting. To address these limitations, we propose GAME-ON, a Graph Neural Network based end-to-end trainable framework that allows granular interactions within and across different modalities to learn more robust data representations for multimodal fake news detection. We use two publicly available fake news datasets, Twitter and Weibo, for evaluations. Our model outperforms on Twitter by an average of 11% and keeps competitive performance on Weibo, within a 2.6% margin, while using 65% fewer parameters than the best comparable state-of-the-art baseline.

研究の動機と目的

  • 単純な連結による後期統合を用いる従来のマルチモーダルフェイクニュース検出モデルの限界、すなわち情報損失とモダリティ間の非均質性ギャップを解消すること。
  • 小規模で複雑な現実世界のマルチモーダルデータセット上で学習される深層モデルの過学習リスクを軽減するため、性能を維持しつつモデルの複雑さを低減すること。
  • 統一されたグラフベースのアーキテクチャを用いて、テキストおよび視覚的モダリティの早期かつ細粒度の統合を可能にし、同時にモダリティ内およびモダリティ間の関係をモデル化すること。
  • 最小限のパラメータ数で、Twitter や Weibo を含む多様なマルチモーダルデータセットに一般化しやすい、軽量でありながら強力なフレームワークの開発

提案手法

  • テキストおよび視覚的モダリティの両方に対して完全連結グラフを構築し、ノードは意味的・構文的埋め込み(テキスト)または検出されたオブジェクト特徴(画像)を表し、エッジはノード間の関係を表す。
  • グラフ自己注意ネットワーク(GAT)を各モダリティのグラフに適用し、隣接ノードに対する適応的注意重みを学習することで、各モダリティ内での局所的およびグローバルな依存関係を捉える。
  • テキストおよび視覚的グラフの対応するノード間にモダリティ間接続を導入し、直接的および間接的なクロスモダリティ情報伝達を可能にし、非均質性ギャップを低減する。
  • GATをモダリティ内およびモダリティ間の両方のグラフ上で同時に学習することで、ネットワークが初期段階から共同表現を学習できるように、早期統合を実現する。
  • 最終的なノード表現を平均プーリングにより集約し、二値フェイクニュース検出用の分類器ヘッドを追加する。
  • フレームワーク全体がエンドツーエンドで学習可能であり、標準的な交差エントロピー損失を用いて精度およびF1スコアの最適化が行われる。

実験結果

リサーチクエスチョン

  • RQ1同時にモダリティ内およびモダリティ間の関係をモデル化するグラフベースのマルチモーダル統合フレームワークは、フェイクニュース検出において後期統合ベースラインを上回ることができるか?
  • RQ2グラフ自己注意メカニズムの使用により、マルチモーダルグラフ内の関連するノードおよびエッジに適応的に注目することで、表現学習が向上するか?
  • RQ3軽量なGNNベースのモデルは、既存の複雑なモデルと比較して顕著に少ないパラメータ数でSOTA性能を達成できるか?
  • RQ4統一されたグラフアーキテクチャによる早期統合は、テキストおよび視覚的モダリティ間の非均質性ギャップをどの程度低減できるか?

主な発見

  • Twitterデータセットでは、GAME-ONは現在のSOTAモデルCALMを、すべての評価指標(精度およびF1スコア)で平均11%上回った。
  • Weiboデータセットでは、GAME-ONは最良の性能を示した複雑なSOTAモデルと2.6%以内の差で競合し、優れた一般化性能を示した。
  • MCANという最も類似したベースライン比で、約65%少ないトレーニング可能なパラメータを用いており、MCANの290万対100万程度(約100万)にまで削減された。
  • アブレーションスタディの結果、モダリティ間接続を削除すると、精度で平均4.6%、F1スコアで平均5.7%の性能低下が生じ、クロスモダリティ相互作用の重要性が確認された。
  • GATレイヤーをGCNレイヤーに置き換えた(GCN-Fusionバージョン)場合、F1スコアで2.1%低下し、精度で2.7%低下した。これは、自己注意メカニズムの利点が顕著であることを示している。
  • 単一モダリティの視覚モデルは、Twitterで86.2%の精度を達成しており、視覚特徴そのものが予測に非常に有効であることが示されたが、GAME-ONによるマルチモーダル統合により性能が顕著に向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。