Skip to main content
QUICK REVIEW

[論文レビュー] Identifying Topical Twitter Communities via User List Aggregation

Derek Greene, Derek O’Callaghan|arXiv (Cornell University)|Jun 29, 2012
Complex Network Analysis Techniques参考文献 15被引用数 14
ひとこと要約

本稿では、複数のTwitterユーザーが作成したユーザーリストを集約し、リスト類似度グラフ上でアンサンブルコミュニティ検出を用いることで、安定的で重複するコミュニティを特定する手法を提案する。このアプローチは、ロンドン2012オリンピック期におけるスポーツ固有のコミュニティ検出において、高い正確性(最高1.00)とF1スコア(最高0.95)を達成し、トピック別コミュニティ検出に向けたクラウドソーシングされたリストデータの有効性を示している。

ABSTRACT

A particular challenge in the area of social media analysis is how to find communities within a larger network of social interactions. Here a community may be a group of microblogging users who post content on a coherent topic, or who are associated with a specific event or news story. Twitter provides the ability to curate users into lists, corresponding to meaningful topics or themes. Here we describe an approach for crowdsourcing the list building efforts of many different Twitter users, in order to identify topical communities. This approach involves the use of ensemble community finding to produce stable groupings of user lists, and by extension, individual Twitter users. We examine this approach in the context of a case study surrounding the detection of communities on Twitter relating to the London 2012 Olympics.

研究の動機と目的

  • ニュースイベントやスポーツなど、共通のテーマについて議論するユーザーが参加するTwitterネットワークにおいて、一貫性がありトピックに特化したコミュニティを同定する課題に対処すること。
  • コミュニティ検出のためのクラウドソーシングされたアノテーションとして、Twitterユーザーリストの集団的キュレーションを活用すること。
  • リストメンバーシップの類似度とアンサンブル手法を用いることで、信頼性を向上させる安定的で重複するコミュニティ検出手法を開発すること。
  • 外部の真値リストを用いた検証を含む、ロンドン2012オリンピックを対象とした実世界の事例研究を通じて、アプローチを評価すること。

提案手法

  • ノードをユーザーリスト、エッジをユーザーメンバーシップの類似度として定義するグラフを構築し、Jaccard類似度を用いて重複度を定量化する。
  • 確率的アルゴリズム(例:OSLOM)を用いて複数のパーティションを生成するアンサンブルコミュニティ検出フレームワークを適用し、多様性を確保する。
  • 対比較の割合に基づくコンSENSUS手法を用いて複数のパーティションを統合し、安定的で頑健なコミュニティ構造を導出する。
  • 所属するリストのコミュニティにユーザーを割り当てることで、安定したリストコミュニティからユーザーコミュニティを導出する。
  • 各コミュニティの信頼性を評価するため、パーティション間の平均共割り当て頻度として定義される安定性スコアを用いる。
  • The Telegraphが提供する外部の真値リストを基準に、各スポーツカテゴリごとに正確性、再現率、F1スコアを計算して結果を検証する。

実験結果

リサーチクエスチョン

  • RQ1多様なTwitterユーザーによるユーザーリストのキュレーションを、安定的でトピックに特化したコミュニティを同定する目的で効果的に集約できるか?
  • RQ2アンサンブルコミュニティ検出アプローチは、Twitter上で重複するトピック固有のコミュニティをどれほど効果的に同定できるか?
  • RQ3安定性スコアは、検出されたコミュニティ内のトピック的コンテンツの均質性と一貫性とどの程度相関しているか?
  • RQ4手動でキュレートされた真値リストと比較して、本手法は特定のオリンピックスポーツ関連のコミュニティをどの程度正確に同定できるか?

主な発見

  • 本手法は、18のオリンピックスポーツカテゴリのうち8つで正確性1.00を達成し、特に柔道、バスケットボール、アイスホッケーにおいて高い正確性を示した。
  • アイスホッケーのコミュニティではF1スコアが0.95に達し、関連ユーザーを検出する際の正確性と再現率のバランスが優れていた。
  • 安定性スコアが高いコミュニティは、しばしばニッチなスポーツ(例:バドミントン、BMXレーシング)と関連しており、そのトップユーザーはしばしばエリートアスリートまたは公式組織のアカウントであった。
  • 一部のカテゴリ(例:陸上競技、自転車競技)では再現率が低く、これはリストキュレーションが希薄または不一致していることが要因で、ユーザーが「水泳」など一般的なリストに割り当てられていたことが原因であった。
  • 本手法は、予期しないが一貫性のあるコミュニティ(例:グリーンォールド2014コモンウェルスゲームズをテーマとするコミュニティ)を効果的に同定でき、主な事例研究を超えた応用可能性を示した。
  • リストベースのラベルが多言語用語(例:オランダ語、イタリア語、英語)を含むことが多かったため、本手法は言語に依存しないコミュニティ検出が可能であった。これは、テキストベースのツイート分析とは対照的であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。