Skip to main content
QUICK REVIEW

[論文レビュー] Detecting dense communities in large social and information networks with the Core & Peel algorithm

Marco Pellegrini, Filippo Geraci|arXiv (Cornell University)|Oct 11, 2012
Complex Network Analysis Techniques参考文献 39被引用数 4
ひとこと要約

本稿では、コア分解と局所的近傍探索を用いて繰り返し密な部分グラフを特定・削除することで、大規模ネットワークにおける互いに素な密集コミュニティを高速に特定するヒューリスティックなアルゴリズム「Core & Peel」を提案する。合成ネットワークおよび実世界のネットワークにおいて、精度96%、再現率99%の高い性能を達成し、ゴールデンスタンダードを必要としない評価において、既存手法を効率性と正確性の両面で上回る。

ABSTRACT

Detecting and characterizing dense subgraphs (tight communities) in social and information networks is an important exploratory tool in social network analysis. Several approaches have been proposed that either (i) partition the whole network into clusters, even in low density region, or (ii) are aimed at finding a single densest community (and need to be iterated to find the next one). As social networks grow larger both approaches (i) and (ii) result in algorithms too slow to be practical, in particular when speed in analyzing the data is required. In this paper we propose an approach that aims at balancing efficiency of computation and expressiveness and manageability of the output community representation. We define the notion of a partial dense cover (PDC) of a graph. Intuitively a PDC of a graph is a collection of sets of nodes that (a) each set forms a disjoint dense induced subgraphs and (b) its removal leaves the residual graph without dense regions. Exact computation of PDC is an NP-complete problem, thus, we propose an efficient heuristic algorithms for computing a PDC which we christen Core and Peel. Moreover we propose a novel benchmarking technique that allows us to evaluate algorithms for computing PDC using the classical IR concepts of precision and recall even without a golden standard. Tests on 25 social and technological networks from the Stanford Large Network Dataset Collection confirm that Core and Peel is efficient and attains very high precison and recall.

研究の動機と目的

  • 大規模なソーシャルネットワークや情報ネットワークにおける、既存のコミュニティ検出手法のスケーラビリティと表現力の制限を解決すること。
  • グラフの部分的密集被覆(PDC)を計算する効率的なヒューリスティックアルゴリズムを開発し、互いに素な密集部分グラフを表現すること。
  • ゴールデンスタンダードが存在しない状況でも、精度と再現率を用いた信頼性の高いコミュニティ検出アルゴリズムの評価を可能にする、新規なベンチマークフレームワークを導入すること。
  • 大規模グラフにおける計算効率と意味的で管理可能なコミュニティ表現の両立を図ること。

提案手法

  • アルゴリズムはコア分解を用いて、各ノードにコア番号を割り当て、それが密集部分グラフに属する可能性の指標として機能する。
  • コア番号の降順にノードを処理することで、大きな密集コミュニティを形成する可能性の高い候補(シード)を優先的に処理する。
  • 各シードに対して、その近傍を探索する局所的探索を実行し、ユーザーが定義した密度閾値を超える密集部分グラフを同定する。
  • 密集部分グラフが検出されると、そのノードは「使用済み」とマークされ、再検出を防ぎ、コミュニティが互いに素であることを保証する。
  • 反復的に次数が低いノードを候補部分グラフから除去することで、検出されたコミュニティを精錬・安定化する「ピーリング」プロセスを採用する。
  • 合成グラフに埋め込まれたコミュニティを用いて精度と再現率を計算する新規なベンチマーク技術を提案し、真のラベル(ゴールデンスタンダード)が不要な評価を可能にする。

実験結果

リサーチクエスチョン

  • RQ1ゴールデンスタンダードが存在する場合を除き、過度な計算コストを伴わずに、大規模ネットワークにおいて複数の互いに素な密集コミュニティを効率的に検出できるか。
  • RQ2ゴールデンスタンダードが存在しない状況で、コミュニティ検出アルゴリズムの精度と再現率を意味的に測定する方法は何か。
  • RQ3Core & Peelアルゴリズムは、多様なネットワークタイプおよび異なる密度・半径閾値においても高い正確性を維持できるか。
  • RQ4コア分解は、大規模グラフにおけるコミュニティ検出の効率性と品質をどの程度向上させるか。

主な発見

  • スタンフォード大ネットワークデータセットコレクションの25の実世界ネットワークにおいて、Core & Peelは100%の密度と半径1の条件下で平均精度95.4%、再現率98.96%を達成した。
  • 70%の密度と半径1の条件下では、平均精度83.0%、再現率83.9%、F-measureが82.7%となり、低密度閾値に対しても高いロバストネスを示した。
  • 半径2、70%の密度条件下では、平均精度は85.6%を維持したが、再現率はわずかに78.1%に低下した。これは、構造的制約が緩和されても安定した性能を示している。
  • コア分解の時間計算量は線形であり、半径1では1エッジあたり10−6〜10−5秒、半径2では10−4〜10−3秒の安定した処理時間が確認された。
  • ウェブグラフ、共同作業ネットワーク、道路網など多様なグラフタイプにおいても、高い性能を維持した。これは、本手法の一般化可能性を裏付けている。
  • 提案されたベンチマークフレームワークにより、埋め込まれたコミュニティを持つ合成グラフを用いた信頼性の高い評価が可能となり、真のラベルが不要な状況でも精度と再現率の妥当性が検証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。