Skip to main content
QUICK REVIEW

[論文レビュー] How to Measure Significance of Community Structure in Complex Networks

Yanqing Hu, Yiming Ding|arXiv (Cornell University)|Feb 10, 2010
Complex Network Analysis Techniques参考文献 14被引用数 3
ひとこと要約

本稿では、コミュニティ分割の事前知識がなくても、ラプラシアン行列の固有ベクトルの安定性を用いて、複雑ネットワークにおけるコミュニティ構造の有意性を測定する新規手法を提案する。固有値のギャップと固有ベクトルの頑健性を分析することで、最適なコミュニティ数を同定し、社会的ネットワークおよび*C. elegans*神経ネットワークが高有意性を示すのに対し、タンパク質および代謝ネットワークは低有意性を示すことが明らかになった。

ABSTRACT

Community structure analysis is a powerful tool for complex networks, which can simplify their functional analysis considerably. Recently, many approaches were proposed to community structure detection, but few works were focused on the significance of community structure. Since real networks obtained from complex systems always contain error links, and most of the community detection algorithms have random factors, evaluate the significance of community structure is important and urgent. In this paper, we use the eigenvectors' stability to characterize the significance of community structures. By employing the eigenvalues of Laplacian matrix of a given network, we can evaluate the significance of its community structure and obtain the optimal number of communities, which are always hard for community detection algorithms. We apply our method to many real networks. We find that significant community structures exist in many social networks and C.elegans neural network, and that less significant community structures appear in protein-interaction networks and metabolic networks. Our method can be applied to broad clustering problems in data mining due to its solid mathematical basis and efficiency.

研究の動機と目的

  • コミュニティ検出アルゴリズムに依存せずにコミュニティ構造の有意性を評価できる手法の不足を解消すること。
  • 現実のネットワークに一般的に見られる誤りリンクやアルゴリズム的ランダムネスに対して、コミュニティ構造がどの程度頑健であるかを定量化すること。
  • 分割の前段階で最適なコミュニティ数を特定できる数学的に根拠のあるインデックスを開発すること。
  • 多様な現実世界のネットワークにこの手法を適用し、ネットワークタイプごとのコミュニティ構造の有意性を比較すること。

提案手法

  • ネットワークのラプラシアン行列から固有値および固有ベクトルを計算し、最小の固有値は常に0である。
  • 摂動に対する固有ベクトルの安定性に基づく頑健性インデックスRを定義し、連続する固有値のギャップと摂動のノルムの比から導出する。
  • コミュニティ構造の有意性を測る指標としてHインデックスを導入し、固有ベクトルの安定性と固有値ギャップから計算する。
  • コミュニティ数cを変化させながら実際のネットワークにこの手法を適用し、Rを最小化し、固有値ギャップλ_{c+1} - λ_cを最大化するcを同定する。
  • LFRベンチマークを用いて、既知のコミュニティ構造を回復できるかを検証する。
  • Hインデックスを用いてネットワークを有意性の観点からランク付けし、高い値はより安定的かつ意味のあるコミュニティ構造を示す。

実験結果

リサーチクエスチョン

  • RQ1コミュニティ分割の事前知識なしに、コミュニティ構造の有意性をどのように評価できるか。
  • RQ2ラプラシアン行列のどの数学的性質が、意味のあるコミュニティ構造の存在を信頼性高く示すか。
  • RQ3固有ベクトルの安定性と固有値ギャップを用いて、ネットワーク内の最適なコミュニティ数を同定できるか。
  • RQ4社会的、生物学的、技術的ネットワークなどの異なる種類の現実世界ネットワークにおいて、コミュニティ構造の有意性はどのように異なるか。
  • RQ5誤りリンクやアルゴリズム的ランダムネスは、検出されたコミュニティ構造の信頼性にどの程度影響を与えるか。

主な発見

  • *C. elegans*神経ネットワークはHインデックス0.57を示し、非常に有意で安定したコミュニティ構造を示している。
  • *C. elegans*代謝ネットワークのHインデックスは0.62であり、強いコミュニティ構造を示すが、コミュニティ数の推定精度が向上したため、従来の結果とは対照的である。
  • 大学のフットボールネットワーク(H = 0.79)やジャズネットワーク(H = 0.47)といった社会的ネットワークは高い有意性を示すが、政治的ブログネットワークはHインデックスが0.22と低かった。
  • E. coli(H = 0.14)、H. Sapiens(H = 0.21)、イースト(H = 0.40)といったタンパク質相互作用ネットワークは、中程度から低めの有意性を示し、明確なコミュニティ構造が乏しいと示唆される。
  • Aquifex aeolicus、Helicobacter pylori、Yersinia pestisなどの代謝ネットワークはいずれもHインデックス0.36を示し、一貫したが中程度の有意性を示している。
  • 本手法はベンチマークネットワークにおいて真のコミュニティ数を正しく同定した:Zacharyのケイブンクラブでは2、大学のフットボールでは12、政治的図書では3であり、最小のR値と最大の固有値ギャップによって確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。