[論文レビュー] Predicting the Topical Stance of Media and Popular Twitter Users
本稿では、リツイート行動を用いた教師なしステイント検出により、メディア機関および人気のあるTwitterユーザーの政治的傾向とトピック的立場を予測するための段階的アプローチを提案する。その後、感情価、グラフ埋め込み、文脈的埋め込みを用いた教師あり分類を実施する。この手法は、メディアバイアス予測において82.6%の正確性を達成し、感情価が最も効果的な特徴量であることが明らかになった。
Discovering the stances of media outlets and influential people on current, debatable topics is important for social statisticians and policy makers. Many supervised solutions exist for determining viewpoints, but manually annotating training data is costly. In this paper, we propose a cascaded method that uses unsupervised learning to ascertain the stance of Twitter users with respect to a polarizing topic by leveraging their retweet behavior; then, it uses supervised learning based on user labels to characterize both the general political leaning of online media and of popular Twitter users, as well as their stance with respect to the target polarizing topic. We evaluate the model by comparing its predictions to gold labels from the Media Bias/Fact Check website, achieving 82.6% accuracy.
研究の動機と目的
- 手動ラベルなしで、メディアおよびインフルエンサーユーザーの政治的傾向とトピック的立場を自動的に推定すること。
- ステイント検出およびメディアバイアス分類のトレーニングデータ作成における手動アノテーションの高コストを低減すること。
- 極端なトピックにおけるリツイート行動を、ユーザーの立場の代理指標として用い、大規模な教師なしクラスタリングを可能にすること。
- 感情価、グラフ埋め込み、BERTベースの文脈的埋め込みといった複数の特徴を組み合わせることで、バイアス予測の精度を向上させること。
- Media Bias/Fact CheckのゴールドスタンダードラベルおよびTwitterユーザーに関する手動判断と照らして、モデルの妥当性を検証すること。
提案手法
- 極端なトピックに対するリツイート行動を分析することで、Twitterユーザーの教師なしステイント検出を実施し、UMAPおよびMean Shiftを用いて対立するグループにユーザーをクラスタリングする。
- 自動的に発見されたステイントラベルでトレーニングされた教師あり学習を用いて、ユーザークラスタを拡張し、カバレッジを向上させる。
- 左寄り・右寄りのクラスタからのリツイートの割合に基づいて、感情価スコアを計算することで、ユーザーの立場をメディアおよびインフルエンサーユーザーに投影する。
- 記事のタイトルおよびコンテンツからのBERT埋め込みに加え、ユーザー間の関係ネットワーク(ユーザー→ハッシュタグおよびユーザー→メンション)からのグラフ埋め込みを組み合わせ、感情価スコアとともに教師あり分類器をトレーニングする。
- node2vecを用いてグラフ埋め込みを生成し、ツイートおよび記事のテキストに対してBERTモデルを微調整して文脈表現を抽出する。
- すべての特徴量をスタックドモデルに統合し、早期停止および交差検証を用いてバイアス予測性能を最適化する。
実験結果
リサーチクエスチョン
- RQ1極端なトピックにおけるリツイート行動は、Twitterユーザーの政治的立場を信頼性を持って推定できるか?
- RQ2グラフ埋め込みや文脈的埋め込みと比較して、感情価はメディアバイアス予測においてどの程度有効な特徴量か?
- RQ3複数の埋め込みタイプを組み合わせることで、メディアバイアス予測の正確性はどの程度向上するか?
- RQ4教師なしユーザークラスタリングを教師あり学習によって効果的に拡張できるか、大規模ユーザー集団へのステイント検出スケーリングに有効か?
- RQ5Media Bias/Fact Checkのような独立したソースからの実際のメディアバイアスラベルに対して、モデルの一般化性能はどの程度高いか?
主な発見
- 感情価、グラフ埋め込み(GraphM+H)、およびツイート・タイトル・コンテンツからのBERT埋め込みを組み合わせた場合、メディアバイアス予測の正確性が82.6%に達した。
- 感情価スコアのみを用いた場合でも75.2%の正確性を示し、個々のBERTまたはグラフ埋め込みモデル(60.6%~71.8%)を著しく上回った。
- 全モデルから感情価を除外すると正確性が4.5ポイント低下(78.1%)し、MAEも0.078上昇したため、感情価が中心的な役割を果たしていることが示された。
- 記事コンテンツからのBERT埋め込みをグラフ埋め込みおよび感情価と組み合わせることで、正確性が80.8%に向上し、相補的な情報の恩恵が得られた。
- グラフ埋め込み単体では感情価より性能が劣るが、感情価およびBERTと組み合わせると、最大で11ポイントの性能向上を達成した。
- 人気のあるTwitterユーザーに対するモデルの性能は、手動判断と照らし合わせて検証され、インフルエンサーステイント検出の信頼性が確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。