Skip to main content
QUICK REVIEW

[論文レビュー] On Efficiently Detecting Overlapping Communities over Distributed Dynamic Graphs

Xun Jian, Xiang Lian|arXiv (Cornell University)|Jan 18, 2018
Complex Network Analysis Techniques参考文献 20被引用数 3
ひとこと要約

本稿では、動的で分散型のグラフにおける重複コミュニティの効率的かつインクリメンタルな検出を可能にする、ランダム化された Speaker-Listener ラベル伝搬アルゴリズム rSLPA を提案する。ラベル伝搬確率を緩和することで、rSLPA は、辺の挿入や削除後のサブ線形時間更新を実現しながらも、高い正確性を維持する。これは、更新されたグラフに対して再びスクラッチからバッチ再処理を行うのと同等の結果をインクリメンタルに達成できる最初のアルゴリズムである。

ABSTRACT

Modern networks are of huge sizes as well as high dynamics, which challenges the efficiency of community detection algorithms. In this paper, we study the problem of overlapping community detection on distributed and dynamic graphs. Given a distributed, undirected and unweighted graph, the goal is to detect overlapping communities incrementally as the graph is dynamically changing. We propose an efficient algorithm, called extit{randomized Speaker-Listener Label Propagation Algorithm} (rSLPA), based on the extit{Speaker-Listener Label Propagation Algorithm} (SLPA) by relaxing the probability distribution of label propagation. Besides detecting high-quality communities, rSLPA can incrementally update the detected communities after a batch of edge insertion and deletion operations. To the best of our knowledge, rSLPA is the first algorithm that can incrementally capture the same communities as those obtained by applying the detection algorithm from the scratch on the updated graph. Extensive experiments are conducted on both synthetic and real-world datasets, and the results show that our algorithm can achieve high accuracy and efficiency at the same time.

研究の動機と目的

  • 時間の経過とともに変化する大規模で動的グラフにおける重複コミュニティ検出の課題に対処すること。
  • グラフの変更後、スクラッチから再計算せずにコミュニティ検出結果をインクリメンタルに更新できるアルゴリズムを設計すること。
  • インクリメンタルな更新が、スクラッチから再処理した場合と同等の品質を維持すること。
  • 非常に並列化可能なアプローチを用いて、分散環境における効率的かつスケーラブルなコミュニティ検出を実現すること。
  • 動的グラフのシナリオにおけるインクリメンタル更新の時間計算量に理論的境界を提供すること。

提案手法

  • rSLPA は SLPA アルゴリズムを拡張し、ラベル伝搬に用いる確率分布を緩和することで、安定性とスケーラビリティを向上させる。
  • ラベル伝搬段階でランダム選択メカニズムを導入することで、初期条件への感受性を低減し、収束性を改善する。
  • ラベル伝搬後、各頂点ごとのラベルを集約し、ラベル頻度と重複度に基づいてコミュニティを抽出する後処理ステップを実施する。
  • インクリメンタル更新メカニズムは、グラフ構造の変化(辺の挿入・削除)を検出し、ラベル分布の影響を受ける部分のみを再計算する。
  • アルゴリズムは分散型に設計されており、クラスタ内の複数ノードで並列実行が可能である。
  • 理論的分析により、さまざまなグラフ変更シナリオ下でのインクリメンタル更新の期待時間計算量が導出され、上界と下界が得られている。

実験結果

リサーチクエスチョン

  • RQ1分散型で動的グラフにおける重複コミュニティ検出を、効率的かつインクリメンタルに更新できるか?
  • RQ2rSLPA のインクリメンタル更新が、スクラッチからのバッチ再処理と同等の品質の結果を生成するか?
  • RQ3rSLPA のインクリメンタル更新メカニズムの時間計算量は何か?また、変更された辺の数に応じてどのようにスケーリングするか?
  • RQ4既存の静的または非インクリメンタルなアルゴリズムと比較して、rSLPA の正確性と効率性はどの程度か?
  • RQ5rSLPA は、辺の変更数に対してサブ線形更新時間で、高品質なコミュニティ検出を維持できるか?

主な発見

  • rSLPA は高い正確性を達成しており、合成 LFR ベンチマークデータセット上での正規化相互情報量(NMI)スコアが一貫して 0.8 を上回っている。
  • rSLPA のインクリメンタル更新メカニズムは、変更された辺の数に対してサブ線形実行時間を示しており、大規模な編集バッチに対しても効率的である。
  • rSLPA は、更新されたグラフ全体をスクラッチから再処理した場合と同等の品質のコミュニティ検出結果を生成する。
  • ラベル伝搬の並列性と局所的更新戦略のおかげで、分散環境におけるスケーリングが良好に実現されている。
  • 実世界および合成グラフを用いた広範な実験により、rSLPA が動的で重複するコミュニティ検出において、既存手法を効率性と正確性の両面で上回ることが確認された。
  • 理論的分析により、rSLPA のインクリメンタル更新の時間計算量が有界であることが確認され、さまざまなグラフ変更シナリオに対して上界と下界が導出された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。