Skip to main content
QUICK REVIEW

[論文レビュー] Bootstrapping Multi-view Representations for Fake News Detection

Qichao Ying, Xiaoxiao Hu|arXiv (Cornell University)|Jun 12, 2022
Misinformation and Its Impacts被引用数 5
ひとこと要約

本稿では、テキスト、画像パターン、画像意味表現の3つの視点から特徴を抽出し、改善されたマルチゲート混合エキスパート(iMMoE)を用いてそれを精錬・統合し、単一視点の予測とクロスマodal整合性に基づいて特徴を自己適応的に再重み付けする、フェイクニュース検出の新規フレームワークであるBootstrapping Multi-view Representations(BMR)を提案する。BMRはWeiboで91.8%の正解率、GossipCopで90.4%のF1スコアを達成し、学習された再重み付け機構による解釈可能な特徴重要度の提供も可能である。

ABSTRACT

Previous researches on multimedia fake news detection include a series of complex feature extraction and fusion networks to gather useful information from the news. However, how cross-modal consistency relates to the fidelity of news and how features from different modalities affect the decision-making are still open questions. This paper presents a novel scheme of Bootstrapping Multi-view Representations (BMR) for fake news detection. Given a multi-modal news, we extract representations respectively from the views of the text, the image pattern and the image semantics. Improved Multi-gate Mixture-of-Expert networks (iMMoE) are proposed for feature refinement and fusion. Representations from each view are separately used to coarsely predict the fidelity of the whole news, and the multimodal representations are able to predict the cross-modal consistency. With the prediction scores, we reweigh each view of the representations and bootstrap them for fake news detection. Extensive experiments conducted on typical fake news detection datasets prove that the proposed BMR outperforms state-of-the-art schemes.

研究の動機と目的

  • 既存のマルチモーダルフェイクニュース検出手法における解釈可能性の欠如と特徴の分離性の不足に対処すること。
  • 単モーダル(テキスト、画像パターン、画像意味)とマルチモーダル表現の、個別および統合的な役割を調査すること。
  • 各特徴の予測的信頼度とクロスマodal整合性に基づいて、マルチビュー特徴を自己適応的に再重み付けすることで検出性能を向上させること。
  • 最終意思決定にどのモーダルが最も寄与しているかを理解するための透明なメカニズムを提供し、モデルの解釈性を高めること。

提案手法

  • 事前学習済みエンコーダーを用いて、ニュースアイテムからテキスト(T)、画像パターン(IP)、画像意味(IS)という3つの異なる表現を抽出する。
  • モーダル固有の情報を保持しつつ、マルチビュー表現を統合的に精錬・統合するため、改善されたマルチゲート混合エキスパート(iMMoE)ネットワークを採用する。
  • 各モーダルの粗い信頼度スコアを生成するための単一視点予測ヘッドを用い、それらを基に表現の自己適応的再重み付け係数を計算する。
  • モーダル間の整合性を学習する専用のクロスマodal整合性(CC)ヘッドを導入し、最終意思決定を支配することなく、マルチモーダル表現の精錬を支援する。
  • 単一視点予測と整合性予測の信頼度スコアを反復的に用いて、表現を再重み付け・再精錬するブートストラップ機構を適用する。
  • 画像表現の事前学習にはマスクド自己オートエンコーダー(MAE)を、特徴精錬にはビジョントランスフォーマー(ViT)ブロックを統合し、設計選択の妥当性をアブレーションスタディで検証する。

実験結果

リサーチクエスチョン

  • RQ1単一モーダル表現(テキスト、画像パターン、画像意味)はフェイクニュース検出にどのように寄与しているか。また、その重要性は定量的に測定可能か?
  • RQ2クロスマodal整合性はマルチモーダルフェイクニュース検出において果たす役割は何か。主信号として機能するのか、あるいは補助的制約として機能するのか?
  • RQ3単一視点予測の信頼度に基づいてマルチビュー特徴を自己適応的に再重み付けすることは、検出性能の向上に寄与するか?
  • RQ4個別の予測ヘッドと整合性学習による単一モーダルおよびマルチモーダル特徴の分離化は、モデルのロバストネスと解釈性をどの程度向上させるか?

主な発見

  • BMRはWeiboデータセットで91.8%の正解率、90.4%のF1スコアを達成し、最先端手法を大きく上回る性能を示した。
  • アブレーションスタディの結果、単一視点予測を無効化すると正解率が2.3%低下し、これは正則化バイアスとしての価値を裏付けた。
  • クロスマodal整合性学習を無効化すると性能が1.3%低下し、これは整合性学習が検出に有益ではあるが、必須要因ではないことを示唆した。
  • 学習された再重み付け関数が逆V字型のパターンを示しており、モデルが整合性スコアが約0.5(曖昧な状態)に近い表現を抑制することを学習していることが示された。
  • MAEをViTに置き換えると正解率が0.8%低下し、このタスクにおいてMAEが表現学習において優位であることを示した。
  • iMMoEを個別のViTブロックに置き換えると性能が1.3%向上し、パラメータ共有と統合的特徴学習の利点が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。