[論文レビュー] FACTOID: A New Dataset for Identifying Misinformation Spreaders and Political Bias
本稿では、4,150名以上のユーザーと340万件以上の投稿を含む、Redditに基づく新規データセットFACTOIDを紹介する。このデータセットは、ユーザーの長期的投稿行動、信頼性水準(極めて低いから極めて高いまで)および政治的バイアス(極左から極右まで)を捉えている。本稿では、社会的相互作用と心理言語的特徴(特に感情的認知プロセスと経験への開放性)を活用するグラフ自己注意ネットワーク(GAT)モデルを提案し、誤情報拡散者を検出する上で最先端の性能を達成した。GATモデルは、すべてのベースラインを上回った。
Proactively identifying misinformation spreaders is an important step towards mitigating the impact of fake news on our society. In this paper, we introduce a new contemporary Reddit dataset for fake news spreader analysis, called FACTOID, monitoring political discussions on Reddit since the beginning of 2020. The dataset contains over 4K users with 3.4M Reddit posts, and includes, beyond the users' binary labels, also their fine-grained credibility level (very low to very high) and their political bias strength (extreme right to extreme left). As far as we are aware, this is the first fake news spreader dataset that simultaneously captures both the long-term context of users' historical posts and the interactions between them. To create the first benchmark on our data, we provide methods for identifying misinformation spreaders by utilizing the social connections between the users along with their psycho-linguistic features. We show that the users' social interactions can, on their own, indicate misinformation spreading, while the psycho-linguistic features are mostly informative in non-neural classification settings. In a qualitative analysis, we observe that detecting affective mental processes correlates negatively with right-biased users, and that the openness to experience factor is lower for those who spread fake news.
研究の動機と目的
- 誤情報検出における長期的ユーザー行動、信頼性、政治的バイアスを統合したユーザーレベルのデータセットの不足に対処すること。
- 偽ニュース拡散者と信頼できるニュースを拡散するユーザーを識別するためのベンチマークデータセットを構築すること。信頼性と政治的バイアスの細分化スコアを含む。
- 社会的ネットワーク構造と心理言語的特徴が、誤情報拡散者行動を予測するのにはどの程度寄与するかを調査すること。
- 感情的認知プロセスや経験への開放性といった心理的特徴と、誤情報共有における政治的バイアスの関係を調査すること。
提案手法
- FACTOIDデータセットは、2020年1月から2021年4月にかけて政治的議論に参加した4,150人のユーザーのReddit投稿を収集し、スレッド構造を保持することでグラフモデリングを可能にした。
- ユーザーは、偽ニュース拡散者状態(二値ラベル)、細分化された信頼性(1〜5段階)、政治的バイアス(−3から+3、極左から極右)でラベル付けされた。
- 社会的相互作用をモデル化するためにグラフ自己注意ネットワーク(GAT)が用いられ、ネットワーク構造そのものが誤情報行動を予測できるかを評価した。
- LIWC(感情的認知プロセスの抽出)とBFM(人格特徴の抽出)を用いて心理言語的特徴を抽出し、経験への開放性や統合性(schizotypy)を含む。
- コンテンツ特徴(LIWC、BFM)のみ、組み合わせ特徴、グラフベースのモデル(GAT)を用いたモデルを比較し、性能を評価した。
- 5分割交差検証を用いたアブレーションスタディにより、各特徴セットが検出性能に与える寄与度を評価した。
実験結果
リサーチクエスチョン
- RQ1コンテンツ特徴とは独立して、社会的ネットワーク相互作用のみで、ユーザーが誤情報拡散者かどうかを予測できるか?
- RQ2感情的認知プロセスや経験への開放性といった心理言語的特徴は、政治的バイアスおよび誤情報共有とどの程度相関するか?
- RQ3二値ラベルに加えて、信頼性と政治的バイアススコアが、偽ニュース拡散者の検出をどの程度向上させるか?
- RQ4LIWC、BFM、または両方の組み合わせのうち、どの特徴の組み合わせが誤情報拡散者および政治的バイアス検出において最高のF1スコアを達成するか?
- RQ5グラフ自己注意ネットワーク(GAT)は、社会的ネットワーク構造を用いた場合、従来の分類器を上回って誤情報拡散者を同定できるか?
主な発見
- GATモデルは、すべてのベースラインを上回り、誤情報拡散者検出において優れた性能を示した。これは、社会的相互作用そのものが、誤情報行動を効果的に予測できることを示している。
- 感情的認知プロセス、特に不安や怒りといったネガティブな感情は、右寄りバイアスを持つユーザーにおいて顕著に低く、政治的極端性と負の相関があることが示された。
- 偽ニュース拡散者において、経験への開放性が一貫して低く、代替的視点への認知的開放性が低いことが示された。
- BFMベースの特徴(特に経験への開放性)は、LIWC特徴よりも誤情報拡散者の検出に有効であったが、埋め込みベースの特徴は政治的バイアス検出において語彙ベースの特徴を上回った。
- LIWCとBFMの両方の特徴を組み合わせた場合、ロジスティック回帰を用いた誤情報拡散者検出で最高のF1スコア(63.9%)が達成され、両特徴が相乗的に効果を発揮することが示された。
- データセットはスレッド構造を保持しており、グラフベースのモデリングが可能であり、個々の投稿レベルの分析よりもユーザー相互作用のより現実的な表現を可能としている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。