[論文レビュー] Retweet-BERT: Political Leaning Detection Using Language Features and Information Diffusion on Social Networks
Retweet-BERT は、プロフィール記述の BERT ベース埋め込みとリツイートネットワーク構造を組み合わせることで、政治的傾向を予測するスケーラブルで教師なしのモデルであり、2つの最近のデータセットで 96–97% のマクロ F1 を達成した。これは、COVID-19 議論中に右寄りユーザーの間でより強い極端化が見られる非対称的なエコーチャンバー効果を明らかにした。
Estimating the political leanings of social media users is a challenging and ever more pressing problem given the increase in social media consumption. We introduce Retweet-BERT, a simple and scalable model to estimate the political leanings of Twitter users. Retweet-BERT leverages the retweet network structure and the language used in users' profile descriptions. Our assumptions stem from patterns of networks and linguistics homophily among people who share similar ideologies. Retweet-BERT demonstrates competitive performance against other state-of-the-art baselines, achieving 96%-97% macro-F1 on two recent Twitter datasets (a COVID-19 dataset and a 2020 United States presidential elections dataset). We also perform manual validation to validate the performance of Retweet-BERT on users not in the training data. Finally, in a case study of COVID-19, we illustrate the presence of political echo chambers on Twitter and show that it exists primarily among right-leaning users. Our code is open-sourced and our data is publicly available.
研究の動機と目的
- 言語的特徴とネットワーク特徴を用いて、アノテーションなしで Twitter 上の政治的イデオロギーを推定するスケーラブルな手法の開発。
- 情報拡散パターンと言語的同質性(homophily)がソーシャルメディア上の政治的極端化とどのように関連するかの調査。
- 2020 年米国大統領選挙や COVID-19 パニックのような高リスクイベント中に、政治的エコーチャンバーの存在と構造を分析すること。
- 手動評価と事例研究を通じて、訓練データに含まれないユーザーへの一般化性能を検証すること。
- 再現可能性とオンライン極端化に関するさらなる研究を促進するため、オープンソースのコードと公開データを提供すること。
提案手法
- ユーザーのプロフィール記述に BERT を微調整し、イデオロギー、感情、所属関係を反映する文脈依存的埋め込みを抽出する。
- エッジがリツイートを表すリツイートネットワークを構築し、意味のあるエンダースメント信号を保証するため、重みが 2 以上となるように設定する。
- プロフィールデータとネットワークデータを統合し、教師なし事前学習を適用して統合されたユーザー表現を学習する。
- ハッシュタグと AllSides.com からのメディアバイアスレーティングを用いて、ヒューリスティックにラベル付けされた少数のサブセットでモデルを微調整する。
- 最適化されたハイパーパramータを用いたロジスティック回帰を用いて、学習済み埋め込みに基づく政治的極性を分類する。
- 比較のため、node2vec と GraphSAGE をベースラインモデルとして採用し、一貫した訓練および評価プロトコルを適用する。
実験結果
リサーチクエスチョン
- RQ1言語的同質性とリツイートネットワーク構造を併用することで、Twitter 上での政治的傾向検出が向上するか?
- RQ2Retweet-BERT は、最近の大型スケールの Twitter データセットにおいて、最先端のモデルと比較してどの程度の性能を示すか?
- RQ3エコーチャンバーはどの程度形成され、左・右両派のユーザー間で非対称的か?
- RQ4手動評価を通じて、訓練データに含まれないユーザーに一般化する能力は、Retweet-BERT でどの程度効果的か?
- RQ5COVID-19 パニックのような高インパクトイベント中に、政治的に極端なコミュニティでどのような情報拡散パターンが生じるか?
主な発見
- Retweet-BERT は、COVID-19 タイムラインの Twitter データセットで 96% のマクロ F1、2020 年米国大統領選挙データセットで 97% のマクロ F1 を達成し、最先端のベースラインを上回った。
- モデルは一般化性能が強く、訓練データに含まれないユーザーに対しても、手動評価を通じて信頼性の高い性能が確認された。
- 右寄りユーザーは、より密なリツイートネットワークと高い同質性を示し、顕著なエコーチャンバー効果を示した。
- 左寄りユーザーは、より多様な情報露出を示しており、リツイートネットワークにおける構造的孤立が少ないことが示された。
- 政治的エコーチャンバーは、特に COVID-19 議論中に右寄りユーザーの間で最も顕著に現れた。
- ヒューリスティックにラベル付けされたハッシュタグと AllSides.com からのメディアバイアスレーティングは、人為的アノテーションなしに擬似ラベル付けを可能にする有効な手法であった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。