Skip to main content
QUICK REVIEW

[論文レビュー] Community Detection Algorithm Evaluation using Size and Hashtags

Paul Wagenseller, Feng Wang|arXiv (Cornell University)|Dec 11, 2016
Complex Network Analysis Techniques参考文献 7被引用数 5
ひとこと要約

本稿では、クライクに基づくコミュニティ検出アルゴリズム(CAA)を提案し、コミュニティサイズ、カバレッジ、モジュラリティ、三角形参加比(TPR)、ハッシュタグを用いたユーザーの関心を用いてコミュニティ検出アルゴリズムを評価する。CAAとInfoMapは、意味のあるコミュニティ(サイズ4–150)を生成し、強いテーマ的整合性を示すが、既存の手法はしばしば極端に小さくまたは大きく、一貫性のないコミュニティを生成する。

ABSTRACT

Understanding community structure in social media is critical due to its broad applications such as friend recommendations, link predictions and collaborative filtering. However, there is no widely accepted definition of community in literature. Existing work use structure related metrics such as modularity and function related metrics such as ground truth to measure the performance of community detection algorithms, while ignoring an important metric, size of the community. [1] suggests that the size of community with strong ties in social media should be limited to 150. As we discovered in this paper, the majority of the communities obtained by many popular community detection algorithms are either very small or very large. Too small communities don't have practical value and too large communities contain weak connections therefore not stable. In this paper, we compare various community detection algorithms considering the following metrics: size of the communities, coverage of the communities, extended modularity, triangle participation ratio, and user interest in the same community. We also propose a simple clique based algorithm for community detection as a baseline for the comparison. Experimental results show that both our proposed algorithm and the well-accepted disjoint algorithm InfoMap perform well in all the metrics.

研究の動機と目的

  • コミュニティ検出アルゴリズムの評価において無視されがちなコミュニティサイズの指標を扱うため。
  • 認知的および社会的限界に基づき、サイズ制約(4–150ユーザー)を焦点に置いて、コミュニティの実用性を特定および測定するため。
  • 構造的指標に加え、ユーザーのハッシュタグ分析によるテーマ的一致性を評価するため。
  • ソーシャルメディアに適した重複を許容する高品質なコミュニティを生成する、画期的なクライクベースのアルゴリズム(CAA)を提案するため。
  • モジュラリティ最適化だけでは、コミュニティサイズとテーマ的一致性を考慮しないと不十分であることを示すため。

提案手法

  • 最大クライクから出発し、成長しきい値と重複しきい値を用いてコミュニティを拡大する、Clique Augmentation Algorithm(CAA)を提案する。
  • 成長しきい値をコミュニティサイズの制御に、重複しきい値をコミュニティ間重複の管理に用いる。
  • 5つの評価指標を適用:コミュニティサイズ分布、カバレッジ(望ましいサイズ範囲内のユーザーの割合)、拡張モジュラリティ、三角形参加比(TPR)、ユーザー関心のハッシュタグ類似度。
  • ユーザーごとに上位10個のハッシュタグを収集し、テーマを手動でラベル付けしてコミュニティの一貫性を評価する。
  • 318,233ユーザーの2013年におけるTwitterネットワーク上で、5つのアルゴリズム(InfoMap、Eigenvector、Fast Greedy、Multilevel、CAA)を評価する。
  • TPRを用いて内部的結束度を測定し、値が高いほどコミュニティ内での三角形クラスタリングが強いことを示す。

実験結果

リサーチクエスチョン

  • RQ1既存のコミュニティ検出アルゴリズムは、コミュニティサイズ分布においてどの程度の性能を示し、実用的なサイズ(4–150ユーザー)のコミュニティを生成するか。
  • RQ2ハッシュタグ類似度で測定したユーザー関心の共有度は、検出されたコミュニティにどの程度反映されているか。
  • RQ3単純なクライクベースのアルゴリズム(CAA)は、意味的で、一貫性があり、適切なサイズのコミュニティを生成する点で、既存のアルゴリズムを上回ることができるか。
  • RQ4コミュニティサイズは、検出されたコミュニティの安定性およびテーマ的一致性にどのように影響するか。
  • RQ5アルゴリズムプロセス中にサイズ制約を組み込むことで、モジュラリティ最適化は著しく改善可能か。

主な発見

  • InfoMapは62%のユーザーをサイズ4–150のコミュニティに割り当てており、望ましいコミュニティサイズへの高いカバレッジを示している。
  • Eigenvectorアルゴリズムは93%のコミュニティがサイズ1–3に属しており、意味のあるコミュニティに割り当てられたユーザーは7%未満にとどまっている。
  • CAAは望ましいサイズのコミュニティに対して41%のカバレッジ率を達成し、Fast Greedy、Multilevel、Eigenvectorを上回った。
  • CAAは全アルゴリズムの中で最高の三角形参加比(TPR)を達成しており、内部的結束度が優れていることを示している。
  • CAAが検出したコミュニティは、ハッシュタグ類似度が最も高く、サンプルされた50のコミュニティのうち10つが共通のテーマを持つ「良い」コミュニティと分類された。
  • InfoMapが生成した大きなコミュニティ(150–300ユーザー)は、テーマ的一致性に欠けており、#wcw や #tbt といった一般的なハッシュタグが共通していたが、テーマ固有のものではなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。