Skip to main content
QUICK REVIEW

[論文レビュー] Randomized spectral co-clustering for large-scale directed networks

Xiao Guo, Yixuan Qiu|arXiv (Cornell University)|Apr 25, 2020
Complex Network Analysis Techniques参考文献 50被引用数 8
ひとこと要約

本稿では、大規模な有向ネットワークにおける計算を高速化しながら統計的精度を維持する、2つの確率的スペクトル共同クラスタリングアルゴリズム—ランダムプロジェクションベースとランダムサンプリングベース—を提案する。これらの手法は、確率的共ブロックモデル下で、近似誤差および誤分類誤差率の向上を達成しており、数百万ノードに達する実際のネットワークを用いた実証的検証と、公開のRパッケージRandClustを備えている。

ABSTRACT

Directed networks are broadly used to represent asymmetric relationships among units. Co-clustering aims to cluster the senders and receivers of directed networks simultaneously. In particular, the well-known spectral clustering algorithm could be modified as the spectral co-clustering to co-cluster directed networks. However, large-scale networks pose great computational challenges to it. In this paper, we leverage sketching techniques and derive two randomized spectral co-clustering algorithms, one \emph{random-projection-based} and the other \emph{random-sampling-based}, to accelerate the co-clustering of large-scale directed networks. We theoretically analyze the resulting algorithms under two generative models -- the stochastic co-block model and the degree-corrected stochastic co-block model, and establish their approximation error rates and misclustering error rates, indicating better bounds than the state-of-the-art results of co-clustering literature. Numerically, we design and conduct simulations to support our theoretical results and test the efficiency of the algorithms on real networks with up to millions of nodes. A publicly available R package extsf{RandClust} is developed for better usability and reproducibility of the proposed methods.

研究の動機と目的

  • 数百万ノードを有する大規模な有向ネットワークにおけるスペクトル共同クラスタリングの計算ボトルネックを解消すること。
  • 送信ノードと受信ノードを同時にクラスタリングする際にも、統計的精度を維持しながら効率的かつスケーラブルなアルゴリズムを開発すること。
  • 確率的共ブロックおよび次数補正付き確率的共ブロックモデル下での近似誤差および誤分類誤差率の理論的分析を行うこと。
  • 合成ネットワークおよび実世界のネットワーク(ヨーロッパの電子メールネットワークを含む)を用いた手法の検証を行うこと。
  • 再現性と使いやすさを考慮し、公開のRパッケージRandClustを提供すること。

提案手法

  • スペクトル構造を保持するように次元削減を実行するため、隣接行列の次元をランダムプロジェクションで低減し、効率的なSVD計算を実現する。
  • 行列要素のサブセットを選択することで、隣接行列の低ランク近似を高速化するため、ランダムサンプリングを用いる。
  • スケッチされた行列に対してランダム化SVDを適用し、主左および主右特異ベクトルを抽出して共同クラスタリングに用いる。
  • 左および右特異ベクトルに対してk-meansクラスタリングを実行し、送信クラスタと受信クラスタを取得する。
  • 理論的分析には、行列濃度不等式およびスペクトルノルムと誤差率に関する境界を用いる。
  • これらの手法は、低ランク行列近似理論に裏打ちされており、有向ネットワークの共同クラスタリングに適応されている。

実験結果

リサーチクエスチョン

  • RQ1ランダムプロジェクションおよびランダムサンプリングは、大規模な有向ネットワークにおけるスペクトル共同クラスタリングの高速化に有効に利用できるか?
  • RQ2提案された確率的共同クラスタリングアルゴリズムの理論的近似誤差および誤分類誤差率は何か?
  • RQ3確率的共ブロックモデル下で、提案手法の誤差率は最先端の共同クラスタリング手法と比較してどの程度か?
  • RQ4確率的アルゴリズムは、実世界の大規模な有向ネットワークにおいて、クラスタリング精度をどの程度保持できるか?
  • RQ5本手法は、最大数百万ノードのネットワークにおいて、どの程度スケーラブルかつ効率的か?

主な発見

  • 提案された確率的スペクトル共同クラスタリング手法は、確率的共ブロックモデル下で、既存の最先端の共同クラスタリング手法よりも優れた近似誤差率を達成している。
  • 提案手法の誤分類誤差率は有界であり、特に次数補正付き確率的共ブロックモデル下で先行研究を上回っている。
  • シミュレーションにより理論的誤差境界が確認され、さまざまなネットワーク構成およびモデル設定において一貫した性能を示している。
  • 10万ノードを超えるヨーロッパの電子メールネットワークにおいて、フルSVDと比較して計算時間を最大90%まで短縮しながらも、高いクラスタリング精度(ARI > 0.85)を維持している。
  • RパッケージRandClustにより、最小限のユーザー入力で大規模な有向ネットワークの効率的かつ再現可能な共同クラスタリングが可能である。
  • ランダムプロジェクションベースの手法は優れたスケーラビリティを示し、ランダムサンプリングベースの手法はスパースネットワークにおいてより高い精度を達成している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。