Skip to main content
QUICK REVIEW

[論文レビュー] It's Always April Fools' Day! On the Difficulty of Social Network Misinformation Classification via Propagation Features

Mauro Conti, Daniele Lain|IMT Institutional Repository (IMT School for Advanced Studies Lucca)|Jan 16, 2017
Misinformation and Its Impacts参考文献 36被引用数 4
ひとこと要約

本稿は、SNSのコンテンツの構造的伝播特徴(例:カスケードトポロジー、ユーザー相互作用パターン)が、Facebook上での誤情報の分類に信頼性を持って使えるかどうかを調査している。強固で操作に強い特徴を用いても、分類性能は依然として低く(伝播中ではF1スコア ≤ 0.65、完了時では <0.70)、誤情報と事実に基づく科学的コンテンツの拡散ダイナミクスが区別できないことが示唆され、純粋に伝播に基づく検出システムの実現可能性に疑問を呈する。

ABSTRACT

Given the huge impact that Online Social Networks (OSN) had in the way people get informed and form their opinion, they became an attractive playground for malicious entities that want to spread misinformation, and leverage their effect. In fact, misinformation easily spreads on OSN and is a huge threat for modern society, possibly influencing also the outcome of elections, or even putting people's life at risk (e.g., spreading "anti-vaccines" misinformation). Therefore, it is of paramount importance for our society to have some sort of "validation" on information spreading through OSN. The need for a wide-scale validation would greatly benefit from automatic tools. In this paper, we show that it is difficult to carry out an automatic classification of misinformation considering only structural properties of content propagation cascades. We focus on structural properties, because they would be inherently difficult to be manipulated, with the the aim of circumventing classification systems. To support our claim, we carry out an extensive evaluation on Facebook posts belonging to conspiracy theories (as representative of misinformation), and scientific news (representative of fact-checked content). Our findings show that conspiracy content actually reverberates in a way which is hard to distinguish from the one scientific content does: for the classification mechanisms we investigated, classification F1-score never exceeds 0.65 during content propagation stages, and is still less than 0.7 even after propagation is complete.

研究の動機と目的

  • SNSにおけるコンテンツ伝播カスケードの構造的特徴が、誤情報の分類に信頼性を持って使えるかどうかを評価すること。
  • 攻撃者が操作しにくいとされるこれらの特徴が、効果的な自動誤情報検出を可能にするかどうかを評価すること。
  • Facebook上での陰謀論投稿と検証済み科学的ニュースの伝播ダイナミクスを比較すること。
  • 初期段階の伝播特徴と最終段階の伝播特徴のどちらが、実用的な分類性能をもたらすかを特定すること。
  • エコーチャンバーとユーザーの極化が、コンテンツタイプ間の構造的差異を曇らせる程度を調査すること。

提案手法

  • 研究は、イタリアの科学的・陰謀論的ページからのFacebook投稿を、公開済みのデータをFacebook Graph APIを介して取得して分析した。
  • トポロジー的性質(例:深さ、幅、分岐率)やユーザー相互作用パターンを含む28の構造的特徴を伝播カスケードから抽出した。
  • アンバランスなデータセットとアンダーサンプリングによるバランス化済みデータセットの両方を用いて、線形判別(LD)、ランダムフォレスト(RF)、マルチレイヤーパーセプトロン(MLP)の3つの分類器を訓練した。
  • AUC、CohenのKappa、精度、再現率、正答率、F1スコアなどの指標を用い、5分割交差検証で性能を評価した。
  • 初期伝播段階と最終伝播完了段階の両方で、分類性能を比較した。
  • データセットのバランスを保ち、バイアスを低減するためにアンダーサンプリングを用い、分類器の性能を公正に評価した。

実験結果

リサーチクエスチョン

  • RQ1構造的伝播特徴のみで、Facebook上での誤情報と事実に基づく科学的コンテンツを区別できるか?
  • RQ2陰謀論コンテンツの伝播ダイナミクスは、科学的コンテンツのカスケードトポロジーにおいて顕著に異なるか?
  • RQ3初期段階の伝播特徴は、コンテンツが完全に広がる前でも、信頼性のある誤情報検出を可能にするか?
  • RQ4エコーチャンバーとユーザーの極化は、コンテンツ拡散における構造的差異をどの程度曇らせるか?
  • RQ5伝播ベースの分類器の性能は、ランダムベースライン分類よりも顕著に優れているか?

主な発見

  • 初期伝播段階では、すべての分類器で最高のF1スコアが0.65にとどまり、構造的特徴のみで誤情報を分類する能力に限界があることが示された。
  • 伝播完了後でさえ、最高のF1スコアは0.70未満であり、ランダム分類よりほとんど改善がなかった。
  • AUCとCohenのKappa指標は0.75未満にとどまり、ROC曲線はランダムベースラインに近く、識別性能が著しく低いことが示された。
  • ランダムフォレスト(RF)とマルチレイヤーパーセプトロン(MLP)は線形判別(LD)を上回ったが、依然として実用的な分類性能に至らなかった。
  • 結果から、陰謀論的コンテンツと科学的コンテンツは、エコーチャンバーのダイナミクスによって類似した伝播パターンを示す可能性が示唆された。
  • 本研究は、コンテンツ関連の特徴やユーザーの極化度指標を組み込まない限り、伝播ベースの検出は不十分であると結論づけた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。