[論文レビュー] Predicting Misinformation and Engagement in COVID-19 Twitter Discourse in the First Months of the Outbreak
本研究では、パンデミックの初期段階における505,000件のCOVID-19関連ツイートを分析し、170以上の特徴量を用いて誤情報とエンゲージメントを予測する。テキストコンテンツが事実と誤情報を区別する上で最も重要であることが判明し、ユーザーのメタデータが高エンゲージメントを予測する上で重要である。10種類の分類器においてFスコアが72%を超える結果を達成し、誤情報はボットによって顕著に拡散されている一方で、事実よりもエンゲージメントが低いことが明らかになった。
Disinformation entails the purposeful dissemination of falsehoods towards a greater dubious agenda and the chaotic fracturing of a society. The general public has grown aware of the misuse of social media towards these nefarious ends, where even global public health crises have not been immune to misinformation (deceptive content spread without intended malice). In this paper, we examine nearly 505K COVID-19-related tweets from the initial months of the pandemic to understand misinformation as a function of bot-behavior and engagement. Using a correlation-based feature selection method, we selected the 11 most relevant feature subsets among over 170 features to distinguish misinformation from facts, and to predict highly engaging misinformation tweets about COVID-19. We achieved an average F-score of at least 72\% with ten popular multi-class classifiers, reinforcing the relevance of the selected features. We found that (i) real users tweet both facts and misinformation, while bots tweet proportionally more misinformation; (ii) misinformation tweets were less engaging than facts; (iii) the textual content of a tweet was the most important to distinguish fact from misinformation while (iv) user account metadata and human-like activity were most important to predict high engagement in factual and misinformation tweets; and (v) sentiment features were not relevant.
研究の動機と目的
- 初期のCOVID-19パンデミック期におけるボット行動とユーザーのエンゲージメントが誤情報拡散に果たす役割を理解すること。
- Twitterにおける議論において、誤情報と事実を区別するのに最も効果的な特徴量を特定すること。
- 事実でも誤情報でもあるツイートが高エンゲージメントを達成するのを予測すること。
- 感情特徴量が誤情報の区別や拡散予測においてどの程度関連性があるかを評価すること。
提案手法
- 本研究では、パンデミック初期の数か月間にわたる約505,000件のCOVID-19関連ツイートを分析する。
- 相関に基づく特徴選択法を用い、170以上の候補特徴量から11個の最も関連性の高い特徴量サブセットを同定する。
- 選択された特徴量を用いて10種類の多クラス分類器を訓練・評価し、誤情報と高エンゲージメントの予測を実施する。
- テキストコンテンツ、ユーザーのアカウントメタデータ、行動パターン(例:人間らしさのある行動)を主な予測要因として分析する。
- Fスコアを主な評価指標として用い、分類器全体でのモデル性能を評価する。
- 感情特徴量は明示的にテストされ、分類タスクの両方において無関係であることが判明した。
実験結果
リサーチクエスチョン
- RQ1初期のCOVID-19関連Twitter議論において、どの特徴量が誤情報と事実を最も効果的に区別するか?
- RQ2ボット行動は、誤情報と事実の両方を拡散する人間ユーザーとどのように異なるか?
- RQ3事実ツイートおよび誤情報ツイートの両方において、高エンゲージメントを予測する要因は何か?
- RQ4感情特徴量は、誤情報の予測やエンゲージメント予測にどの程度寄与するか?
主な発見
- 実ユーザーは、事実の拡散と誤情報の拡散の両方の責任を負っているが、ボットは誤情報を顕著に多く拡散している。
- 誤情報ツイートは事実ツイートよりもエンゲージメントが低く、ボットによる広範な拡散にもかかわらず、ウイルス性は低いことが示された。
- テキストコンテンツが、誤情報と事実を区別する上で最も重要な特徴量であり、メタデータや行動信号を上回る性能を示した。
- ユーザーのアカウントメタデータと人間らしさのある行動パターンが、高エンゲージメントツイートを特定する上で最も予測可能な特徴量であった。
- 感情特徴量は、誤情報の分類やエンゲージメント予測の両方において、顕著な関連性を示さなかった。
- 選択された特徴量サブセットにより、10種類の多クラス分類器が、両予測タスクにおいて平均して72%以上のFスコアを達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。