Skip to main content
QUICK REVIEW

[論文レビュー] Size Matters: A Comparative Analysis of Community Detection Algorithms

Paul Wagenseller, Feng Wang|arXiv (Cornell University)|Dec 3, 2017
Complex Network Analysis Techniques被引用数 3
ひとこと要約

本稿では、コミュニティ検出アルゴリズムの評価における重要な直交的次元として、コミュニティサイズ(特にダンバーの数150)を導入し、コミュニティサイズと重なりを制御するためのクリークベースの Clique Augmentation Algorithm (CAA) を提案する。Infomap と CAA が、より望ましいサイズのコミュニティを生成することで他のアルゴリズムを上回っていることが判明した。一方、モジュラリティに基づくアルゴリズム(FastGreedy や Eigenvector)は、実用的・意味的に無視できるほどの非常に大きなコミュニティを生成する。

ABSTRACT

Understanding community structure of social media is critical due to its broad applications such as friend recommendations, user modeling and content personalizations. Existing research uses structural metrics such as modularity and conductance and functional metrics such as ground truth to measure the qualify of the communities discovered by various community detection algorithms, while overlooking a natural and important dimension, community size. Recently, anthropologist Dunbar suggests that the size of stable community in social media should be limited to 150, referred to as Dunbar's number. In this study, we propose a systematic way of algorithm comparison by orthogonally integrating community size as a new dimension into existing structural metrics for consistently and holistically evaluating the community quality in social media context. we design a heuristic clique based algorithm which controls the size and overlap of communities with adjustable parameters and evaluate it along with five state-of-the-art community detection algorithms on both Twitter network and DBLP network. Specifically, we divide the discovered communities based on their size into four classes called close friend, casual friend, acquaintance, and just a face, and then calculate the coverage, modularity, triangle participation ratio, conductance, transitivity, and the internal density of communities in each class. We discover that communities in different classes exhibit diverse structural qualities and many existing community detection algorithms tend to output extremely large communities.

研究の動機と目的

  • コミュニティ検出アルゴリズムの評価において無視されがちなコミュニティサイズの役割に取り組むこと、特にソーシャルネットワークにおいて。
  • ダンバーの数(150)を、ソーシャルメディアにおける「望ましい」コミュニティサイズを特定する社会的基準として統合すること。
  • 従来の構造的指標に加え、コミュニティサイズの分布にも注目して、最先端のアルゴリズムを体系的に評価すること。
  • 調整可能なしきい値を用いてコミュニティサイズと重なりを制御する、新しいクリークベースのアルゴリズム(CAA)を提案・評価すること。
  • 密友、親しい友人、知人、ただの顔、という4つのサイズに基づくコミュニティクラスにわたり、アルゴリズムの性能を比較すること。

提案手法

  • 最大クリークを特定し、増大しきい値と重複しきい値を用いてそれらをコミュニティに統合する Clique Augmentation Algorithm (CAA) を提案する。
  • 増大しきい値を用いてコミュニティサイズを制御し、重複しきい値を用いてコミュニティ間の重なりを制御する。
  • 検出されたコミュニティを4つのサイズクラスに分類する:4–10(密友)、11–50(親しい友人)、51–150(知人)、>150(ただの顔)。
  • 6つの構造的指標(拡張モジュラリティ、三角形参加比(TPR)、コンダクタンス、内部密度、トランジティビティ、カバレッジ)を用いてアルゴリズムを評価する。
  • 2つの実世界ネットワーク(Twitterのフォロワー網とDBLPの共同執筆網)を用い、両方のネットワークで一貫した評価を実施する。
  • 6つのアルゴリズム(Infomap、Multilevel、FastGreedy、Eigenvector、Label Propagation、および提案された CAA)を比較する。

実験結果

リサーチクエスチョン

  • RQ1コミュニティサイズを別個の評価次元として考える場合、異なるコミュニティ検出アルゴリズムの性能はいかがなるか?
  • RQ2既存のアルゴリズムは、安定した社会的グループの認知的限界としてのダンバーの数(150)に一致するサイズのコミュニティをどれほど生成するのか?
  • RQ3構造的品質指標(モジュラリティ、コンダクタンス、TPR など)は、異なるコミュニティサイズクラスでどのように変化するか?
  • RQ4クリークベースのアルゴリズム(CAA)は、構造的品質を維持しつつ、コミュニティサイズと重なりを効果的に制御できるか?
  • RQ5どのアルゴリズムが、極めて大きな実用的でないコミュニティを生成せずに、望ましいコミュニティサイズ(4–150)に属するユーザーのカバレッジを最も高めるか?

主な発見

  • Infomap と CAA は、望ましいコミュニティサイズ(4–150)におけるユーザーのカバレッジが最も高く、Twitter と DBLP の両ネットワークで Infomap は90%を超えるユーザーをカバーしている。
  • モジュラリティ最大化アルゴリズム(Multilevel、FastGreedy、Eigenvector)は、極めて大きなコミュニティを生成する。Eigenvector では、Twitter で71.6%、DBLP で99.5%のユーザーが1つのコミュニティに属しており、実用的・意味的に無視できる。
  • Infomap は、1つの巨大コミュニティによる貢献ではなく、4つのサイズクラスすべてからのバランスの取れた貢献によって高いモジュラリティを達成している。他のアルゴリズムとは異なり、スコアは巨大コミュニティに支配されている。
  • コンダクタンススコアは、モジュラリティベースのアルゴリズムで優れているが、これは、ネットワーク全体からの分離が強い反面、現実的に不切なほど大きなコミュニティを生じさせる代償である。
  • CAA は、最高の三角形参加比(TPR)を達成しており、DBLP で90.1%、Twitter で89.2%に達しており、強い局所的クラスタリングと構造的結束性を示している。
  • 内部密度とトランジティビティは、アルゴリズム間で類似しているが、望ましいサイズのコミュニティ(4–150)では CAA がわずかに他を上回っている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。