Skip to main content
QUICK REVIEW

[論文レビュー] Local Graph Clustering Beyond Cheeger's Inequality

Zeyuan Allen Zhu, Silvio Lattanzi|arXiv (Cornell University)|Apr 30, 2013
Complex Network Analysis Techniques参考文献 41被引用数 6
ひとこと要約

本稿は、クラスタ内の内部結合性を組み込むことで、Cheegerの不等式を改善する新しい局所的グラフクラスタリングアルゴリズムを提案する。導出される導出率の保証は Õ(min{√φ(A), φ(A)/√Conn(A)} ) であり、ここで Conn(A) は A に誘導される部分グラフの混合時間(mixing time)を測る。この手法はPageRankに基づくランダムウォークを活用し、理論的境界をより厳密にし、特に結合性の高いクラスタにおいて実験的にも優れた性能を示す。

ABSTRACT

Motivated by applications of large-scale graph clustering, we study random-walk-based LOCAL algorithms whose running times depend only on the size of the output cluster, rather than the entire graph. All previously known such algorithms guarantee an output conductance of $ ilde{O}(\sqrt{ϕ(A)})$ when the target set $A$ has conductance $ϕ(A)\in[0,1]$. In this paper, we improve it to $$ ilde{O}\bigg( \min\Big\{\sqrt{ϕ(A)}, \frac{ϕ(A)}{\sqrt{\mathsf{Conn}(A)}} \Big\} \bigg)\enspace, $$ where the internal connectivity parameter $\mathsf{Conn}(A) \in [0,1]$ is defined as the reciprocal of the mixing time of the random walk over the induced subgraph on $A$. For instance, using $\mathsf{Conn}(A) = Ω(λ(A) / \log n)$ where $λ$ is the second eigenvalue of the Laplacian of the induced subgraph on $A$, our conductance guarantee can be as good as $ ilde{O}(ϕ(A)/\sqrt{λ(A)})$. This builds an interesting connection to the recent advance of the so-called improved Cheeger's Inequality [KKL+13], which says that global spectral algorithms can provide a conductance guarantee of $O(ϕ_{\mathsf{opt}}/\sqrt{λ_3})$ instead of $O(\sqrt{ϕ_{\mathsf{opt}}})$. In addition, we provide theoretical guarantee on the clustering accuracy (in terms of precision and recall) of the output set. We also prove that our analysis is tight, and perform empirical evaluation to support our theory on both synthetic and real data. It is worth noting that, our analysis outperforms prior work when the cluster is well-connected. In fact, the better it is well-connected inside, the more significant improvement (both in terms of conductance and accuracy) we can obtain. Our results shed light on why in practice some random-walk-based algorithms perform better than its previous theory, and help guide future research about local clustering.

研究の動機と目的

  • 本稿の目的は、外部導出率(external conductance)だけでなく、クラスタ内の内部結合性も考慮することで、局所的グラフクラスタリングアルゴリズムの理論的保証を改善することにある。
  • 先行研究の限界を是正する。先行研究は外部結合性(φ(A)が小さい)にのみ注目しており、クラスタの内部的結合度は無視している。
  • 出力クラスタサイズにのみ依存する実行時間を持つ局所的クラスタリングアルゴリズムを構築し、より優れた導出率と正確性を達成することを目的とする。
  • なぜ一部のランダムウォークベースのアルゴリズムが、理論的予測を上回って実際には優れた性能を示すのかを解明すること。特に結合性の高いクラスタにおいて顕著である。
  • 内部結合性(Conn(A))とクラスタリング性能の向上を結びつける理論的基盤を確立すること。

提案手法

  • アルゴリズムは、ランダムウォークの収束特性を活用して、シードノードの周囲にクラスタを特定するPageRankに基づく局所的探索を用いる。
  • 外部導出率 φ(A) と内部結合性 Conn(A) の両方に依存する新しい導出率保証を導入。Conn(A) は、A に誘導される部分グラフの混合時間の逆数として定義される。
  • 新たなポテンシャル関数とリークに基づく議論を用いて、PageRankの減衰を限定する。結合性が高いクラスタ(Conn(A) が大きい)は、より良好な導出率保証をもたらすことが示される。
  • 反復的プッシュ・レレイ方式のアルゴリズム(Approximate-PR)を用いて、有界なサポートボリュームを持つ ε-近似PageRank ベクトルを近似的に計算する。
  • 理論的分析により、出力集合の導出率が Õ(min{√φ(A), φ(A)/√Conn(A)}) であることが証明され、従来の Õ(√φ(A)) の境界を改善する。
  • 理論的下界を用いて解析のタイトネスを確立し、合成および実世界のグラフ上で性能を検証する。

実験結果

リサーチクエスチョン

  • RQ1内部クラスタ結合性(Conn(A))を用いることで、外部導出率のみに依存する従来の理論的保証を超えて、局所的グラフクラスタリングの理論的保証を改善できるか?
  • RQ2ランダムウォークベースの局所的クラスタリングアルゴリズムの性能は、特に混合時間に依存してどのように変化するか?
  • RQ3改善された導出率保証が、クラスタリングの正確性(精度と再現率)にどの程度反映されるか?
  • RQ4なぜ一部の局所的クラスタリングアルゴリズムは、理論的境界を上回って実際には優れた性能を示すのか、特に結合性の高いクラスタにおいては?
  • RQ5新しい導出率境界 Õ(min{√φ(A), φ(A)/√Conn(A)}) はタイトか?また、出力サイズに依存する実行時間を持つ局所的アルゴリズムで達成可能か?

主な発見

  • 本稿は、Conn(A) が大きい場合には従来の Õ(√φ(A)) の境界を改善する、新しい導出率保証 Õ(min{√φ(A), φ(A)/√Conn(A)}) を達成した。
  • Conn(A) = Ω(λ(A)/log n) と高い内部結合性を示すクラスタでは、導出率保証が Õ(φ(A)/√λ(A)) に改善され、グローバルスペクトル法における改善されたCheegerの不等式と一致する。
  • 理論的解析により、提案アルゴリズムの性能はタイトであることが示され、追加の仮定なしでは境界を著しく改善できないことが示された。
  • 合成および実世界のグラフを用いた実験的評価により、本手法は特に内部結合性の高いクラスタにおいて、従来手法を上回ることが確認された。
  • 本研究は、内部結合性が局所的クラスタリングにおいて根本的なパラメータであることを明らかにした。これは、既存のランダムウォークベースのアルゴリズムにおける理論と実際のギャップを説明する要因である。
  • アルゴリズムは小さな出力サポートボリュームを維持し、出力クラスタサイズにのみ依存する実行時間で動作し、スケーラビリティを保った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。