[論文レビュー] Characterizing and Predicting Social Correction on Twitter
この論文は Twitter 上の COVID-19 ワクチンに関する誤情報と対誤情報のリプライの大規模データセットを構築し、社会的訂正に関連する言語的/エンゲージメント/投稿者要因を分析し、対抗がどの程度起こるかを予測するモデルを開発しています。
Online misinformation has been a serious threat to public health and society. Social media users are known to reply to misinformation posts with counter-misinformation messages, which have been shown to be effective in curbing the spread of misinformation. This is called social correction. However, the characteristics of tweets that attract social correction versus those that do not remain unknown. To close the gap, we focus on answering the following two research questions: (1) ``Given a tweet, will it be countered by other users?'', and (2) ``If yes, what will be the magnitude of countering it?''. This exploration will help develop mechanisms to guide users' misinformation correction efforts and to measure disparity across users who get corrected. In this work, we first create a novel dataset with 690,047 pairs of misinformation tweets and counter-misinformation replies. Then, stratified analysis of tweet linguistic and engagement features as well as tweet posters' user attributes are conducted to illustrate the factors that are significant in determining whether a tweet will get countered. Finally, predictive classifiers are created to predict the likelihood of a misinformation tweet to get countered and the degree to which that tweet will be countered. The code and data is accessible on https://github.com/claws-lab/social-correction-twitter.
研究の動機と目的
- 誤情報ツイートが社会的訂正を引き付ける理由と仕組みを理解する動機づけ。
- COVID-19 ワクチンに関する誤情報ツイートと対情報リプライの大規模対はデータセットを作成する。
- 言語的、エンゲージメント、および投稿者属性を層別分析して、対抗に関連する要因を特定する。
- 選択された特徴を用いて、ツイートが対抗されるかどうか、および対抗の程度を予測する予測分類器を開発する。
- ユーザー属性ごとの社会的訂正における潜在的な不平等性についての洞察を提供する。
提案手法
- 誤情報ツイートと対誤情報リプライの大規模データセットを作成する(誤情報:1,523,849ツイート;対誤情報リプライ:690,047件)。
- 対誤情報リプライの一部をアノテーションして Roberta-base(小文字化)を用いた対誤情報リプライ分類器を訓練する。
- 大規模なCOVID-19ワクチンツイートコーパス内の誤情報を識別するための誤情報ツイート分類器(BERT)を訓練する。
- 返信数に基づいてツイートを層に分けて、各層内で高い対抗と低い対抗を比較する層別分析を構築する。
- 言語的、エンゲージメント、投稿者属性(LIWC、VADER、丁寧さ/不作法、エンゲージメント比、フォロワー/検証指標、誤情報前の活動)にわたる統計的および特徴分析を実施する。
- 2つの予測モデルを構築する(RQ1)誤情報ツイートが対抗されるかを予測し、(RQ2)選択された特徴を用いて対抗の程度(低い vs 高い)を予測する。
実験結果
リサーチクエスチョン
- RQ1RQ1: 誤情報ツイートがあるとき、それは他のユーザーにより対抗されるか?
- RQ2RQ2: 対抗された場合、対抗の規模はどの程度になるか(低いか高いか)?
主な発見
- 新規データセットが作成され、1,523,849件の誤情報ツイートと690,047件の対誤情報リプライが含まれ、手動アノテートされた対誤情報リプライのサブセットがある。
- 返信数で層化した場合、対抗度が高いツイートは、低い対抗度のものと比べて、感情的内容がより強く、影響度が高く、ネガティブ感情や怒りを含む。
- 高く対抗されたツイートは无礼さが増し、健康関連語が少なく、主題と修辞的要因が訂正に影響を与えることを示唆する。
- エンゲージメント分析では、高く対抗されたツイートは1件の返信あたり引用、リツイート、いいねが少なく、対抗が広範な拡散を抑制できることを示す。
- 投稿者属性は、検証済み投稿者が高度に対抗される投稿の可能性が高いことを示す一方、非検証ユーザーではほとんどの属性に有意差がない。
- 利用者の教育レベル(誤情報前の投稿に基づくARI推定)は対抗発生 likelihood に負の相関を示し、低教育推奨アカウントほど対抗されやすいことを示す。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。