[論文レビュー] Quantifying Controversy in Social Media
本稿では、ユーザーの相互作用(例:リツイート)から会話グラフを構築し、3段階のパイプライン(グラフ構築、パーティショニングによる対立する見解の特定、ランダムウォークに基づく指標による議論の度合いの測定)を適用することで、ソーシャルメディアにおける議論の激しさを定量化するドメインに依存しないグラフベースのフレームワークを提案する。主な貢献は、RWC(ランダムウォークによる議論の激しさ)指標の導入であり、特にTwitterにおいて、既存の手法よりも議論の激しさのある話題とそうでない話題を明確に区別できる。コンテンツ特徴量はほとんど効果を示さない。
Which topics spark the most heated debates on social media? Identifying those topics is not only interesting from a societal point of view, but also allows the filtering and aggregation of social media content for disseminating news stories. In this paper, we perform a systematic methodological study of controversy detection by using the content and the network structure of social media. Unlike previous work, rather than study controversy in a single hand-picked topic and use domain specific knowledge, we take a general approach to study topics in any domain. Our approach to quantifying controversy is based on a graph-based three-stage pipeline, which involves (i) building a conversation graph about a topic; (ii) partitioning the conversation graph to identify potential sides of the controversy; and (iii) measuring the amount of controversy from characteristics of the graph. We perform an extensive comparison of controversy measures, different graph-building approaches, and data sources. We use both controversial and non-controversial topics on Twitter, as well as other external datasets. We find that our new random-walk-based measure outperforms existing ones in capturing the intuitive notion of controversy, and show that content features are vastly less helpful in this task.
研究の動機と目的
- ドメイン固有の知識や手作業で整備されたデータセットに依存せずに、ソーシャルメディアにおける議論の激しさを検出・定量化する汎用的でドメインに依存しない手法を開発すること。
- 多様な話題(議論の激しさのある話題とそうでない話題を含む)に対して、広範な範囲の議論の激しさ指標、グラフ構築手法、データソースを体系的に評価すること。
- ソーシャルメディアの会話における議論の激しさを最も効果的に予測する構造的特徴、感情的特徴、コンテンツベースの特徴を同定すること。
- 実世界のシステムに適用可能で、エコーチャンバーとフィルターバブルを緩和するために使用可能な、信頼性が高くスケーラブルな議論の激しさ測定フレームワークを確立すること。
提案手法
- テキストクエリ(例:Twitterにおけるハッシュタグ)によって定義される話題に関連する、ユーザーをノード、リツイート・メンション・返信などの相互作用をエッジとする会話グラフを構築する。
- 特にMETISおよび負のエッジを伴う相関クラスタリングを用いたグラフパーティショニングアルゴリズムを適用し、対立する見解を持つユーザーのクラスタを特定する。
- コンductance、モジュラリティ、アソートラティビティ、および新規のランダムウォークに基づく指標(RWC)を含む複数の議論の激しさ指標を開発・評価し、極端さの度合いを測定する。
- RWC指標は、グラフ内でのランダムウォークの期待到達時間を用いて、対立するクラスタ間の分離度を評価することで、議論の激しさを測定する。
- 人為的にラベル付けされた議論の激しさスコアをゴールドスタンダードとして用い、大規模なTwitter会話データセットおよび外部データセットを用いて、すべての指標を評価する。
- コンテンツ特徴量(例:キーワード、感情分析)と構造的特徴量を比較し、特にリツイートによる支持が顕著に優れた結果を示す構造的特徴量が、はるかに予測力が高いことが判明した。
実験結果
リサーチクエスチョン
- RQ1手作業で整備されたデータセットやドメイン固有の知識に依存せずに、一般化可能なドメインに依存しないアプローチで、ソーシャルメディアにおける議論の激しさを信頼性高く定量化できるか?
- RQ2構造的特徴、感情的特徴、コンテンツベースの特徴のうち、どのグラフベースの特徴が議論の激しさのある話題とそうでない話題を最も効果的に区別できるか?
- RQ3コンductance、モジュラリティ、RWCなどの異なる議論の激しさ指標は、多様な話題において議論の激しさの直感的把握をどの程度正しく捉えられるか?
- RQ4キーワードや感情分析などのコンテンツベースの特徴は、議論の激しさ検出にどの程度貢献するか。また、それらを単独で信頼性を持って使用できるか?
- RQ5提案されたRWC指標は、異なるデータソースやドメインに一般化可能か。また、既存の最先端手法を上回る性能を示すか?
主な発見
- ランダムウォークに基づく議論の激しさ指標(RWC)は、議論の激しさのある話題とそうでない話題を区別する観点で、評価されたすべての他の指標を大きく上回り、実験的評価でも優れた分離度を示した。
- キーワードや感情分析などのコンテンツ特徴量は、議論の激しさ検出において著しく劣っており、感情分析でさえも限定的な効果にとどまる一方、リツイートに基づく構造的特徴量ははるかに予測力が高い。
- リツイートエッジを用いたMETISによるグラフパーティショニングが、メンションやランダムパーティショニングに基づく手法よりも、対立する見解の特定において最も信頼性が高かった。
- 従来の指標(モジュラリティ、アソートラティビティ)は、人為的にラベル付けされた議論の激しさスコアと相関が低く、この文脈では分極化の指標として不適切であることが示された。
- RWC指標は、Twitterや外部のソーシャルメディアデータを含む、さまざまなデータセットおよびドメインにわたって良好に一般化され、その堅牢性とスケーラビリティが確認された。
- カットサイズやコンダクタンスといった単純な構造的指標は、サイズや密度が異なるグラフ間で一般化できないため、大規模システムにおける有用性が制限される。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。