Skip to main content
QUICK REVIEW

[論文レビュー] GAMC: An Unsupervised Method for Fake News Detection using Graph Autoencoder with Masking

Shu Yin, Chao Gao|arXiv (Cornell University)|Dec 10, 2023
Misinformation and Its Impacts被引用数 4
ひとこと要約

GAMCは、ノードマスキングとエッジドロップを用いたグラフオートエンコーダーと対照学習を組み合わせた自己教師信号(データ拡張によるノードマスキングとエッジドロップ)を活用することで、ラベル付きデータに依存せずに不審なニュース検出を実現する非教師付き手法を提案する。PolitiFact(82.8%の正確度、82.3%のF1スコア)およびGossipCop(94.1%の正確度、93.7%のF1スコア)で最先端の性能を達成し、手動でのアノテーションが不要であるにもかかわらず高い頑健性を示した。

ABSTRACT

With the rise of social media, the spread of fake news has become a significant concern, potentially misleading public perceptions and impacting social stability. Although deep learning methods like CNNs, RNNs, and Transformer-based models like BERT have enhanced fake news detection, they primarily focus on content, overlooking social context during news propagation. Graph-based techniques have incorporated this social context but are limited by the need for large labeled datasets. Addressing these challenges, this paper introduces GAMC, an unsupervised fake news detection technique using the Graph Autoencoder with Masking and Contrastive learning. By leveraging both the context and content of news propagation as self-supervised signals, our method negates the requirement for labeled datasets. We augment the original news propagation graph, encode these with a graph encoder, and employ a graph decoder for reconstruction. A unique composite loss function, including reconstruction error and contrast loss, is designed. The method's contributions are: introducing self-supervised learning to fake news detection, proposing a graph autoencoder integrating two distinct losses, and validating our approach's efficacy through real-world dataset experiments.

研究の動機と目的

  • 高価で時間がかかるラベル付きデータセットに依存せずに、ソーシャルメディアにおける不審なニュース検出の課題に対処すること。
  • ニュースをグラフとしてモデル化することで、社会的文脈と拡散ダイナミクスを不審なニュース検出に統合すること。
  • コンテンツと構造的特徴の両方を活用した自己教師学習フレームワークを構築し、ラベルなしで表現学習を可能にすること。
  • データ拡張を自己教師信号として用いることで、手動でのアノテーションの必要性を排除すること。
  • 再構成と対照学習を統合した複合損失関数を用いて、検出性能を向上させること。

提案手法

  • 本手法は、元のニュース拡散グラフに対してランダムなノード特徴マスキングとエッジドロップを実行し、2つの強化された視覚を生成する。
  • グラフエンコーダーは拡張されたグラフを処理し、グローバル構造と拡散ダイナミクスを捉えたグラフレベルの表現ベクトルを出力する。
  • グラフデコーダーは表現ベクトルから元のグラフを再構成し、再構成誤差を最小化することで構造的および意味的パターンを保持する。
  • 複合損失関数は、再構成損失(元のグラフと再構成グラフのL2距離)と対照損失(同じグラフから生成された拡張ビューの表現間の距離を最小化)を統合する。
  • モデルは複合損失を用いてエンドツーエンドで訓練され、ラベルなしで自己教師学習による表現学習が可能になる。
  • 訓練後、最終的なグラフレベル表現は直接的に不審なニュース分類に使用される。

実験結果

リサーチクエスチョン

  • RQ1自己教師学習は、ラベル付きデータを一切必要とせずに、不審なニュース検出において教師信号を効果的に置き換えることができるか?
  • RQ2コンテンツと拡散文脈の両方を統合することで、テキストのみのモデルに比べて不審なニュース検出性能がどのように向上するか?
  • RQ3データ拡張(マスキングとエッジドロップ)は、モデルの頑健な表現学習能力にどのような影響を及えるか?
  • RQ4再構成損失と対照損失は、どのように共同して検出性能の向上に寄与するか?
  • RQ5実世界のデータセットにおいて、マスキングと対照学習を組み合わせたグラフトオエンコーダーは、教師ありベースラインと比較して競争力のある結果を達成できるか?

主な発見

  • PolitiFactデータセットにおいて、GAMCは82.8%の正確度と82.3%のF1スコアを達成し、BiGCN や GACL を含むすべての比較された教師あり手法を上回った。
  • GossipCopデータセットでは、GAMCは94.1%の正確度と93.7%のF1スコアを達成し、次に優れた手法(GACL)と比較して正確度で3.4ポイントも優勢だった。
  • アブレーションスタディの結果、データ拡張を削除した場合(GAMC-Aug)はPolitiFactで正確度が79.3%に低下し、表現学習におけるその重要性が裏付けられた。
  • 再構成損失を削除した場合(GAMC-Lrec)はPolitiFactでF1スコアが75.8%に低下し、構造的整合性の維持におけるその重要性が示された。
  • 対照損失のコンponentは不可欠であった。1つの拡張ビューのみを用いた場合、性能が低下したため、対照学習が識別性を向上させていることが明らかになった。
  • 最適なハイパーパrameterは、マスキング率0.5およびエッジドロップ率0.2であり、両方のデータセットでモデル性能がピークに達した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。