[論文レビュー] Hierarchical Agglomerative Graph Clustering in Nearly-Linear Time
本稿では、動的低出次数グラフの向き付けとモジュラーなネイバーヒープデータ構造を活用することで、近似的に線形時間計算量を達成する、階層的凝集型クラスタリング(HAC)の新しいアルゴリズムフレームワークを提示する。完全連結およびWPGMA連結法に対する初めての正確な $\tilde{O}(m)$-時間アルゴリズムを提供し、平均連結法に対しても、$\tilde{O}(n\bar{\beta})$-時間の正確なサブクアドラティックなアルゴリズムを実現。さらに、$\tilde{O}(m)$-時間の$\epsilon$-近似アルゴリズムを併せて提供し、大規模データセットで最大76.5倍の高速化を達成しながらクラスタリング品質を維持する。
We study the widely used hierarchical agglomerative clustering (HAC) algorithm on edge-weighted graphs. We define an algorithmic framework for hierarchical agglomerative graph clustering that provides the first efficient $ ilde{O}(m)$ time exact algorithms for classic linkage measures, such as complete- and WPGMA-linkage, as well as other measures. Furthermore, for average-linkage, arguably the most popular variant of HAC, we provide an algorithm that runs in $ ilde{O}(n\sqrt{m})$ time. For this variant, this is the first exact algorithm that runs in subquadratic time, as long as $m=n^{2-ε}$ for some constant $ε> 0$. We complement this result with a simple $ε$-close approximation algorithm for average-linkage in our framework that runs in $ ilde{O}(m)$ time. As an application of our algorithms, we consider clustering points in a metric space by first using $k$-NN to generate a graph from the point set, and then running our algorithms on the resulting weighted graph. We validate the performance of our algorithms on publicly available datasets, and show that our approach can speed up clustering of point datasets by a factor of 20.7--76.5x.
研究の動機と目的
- 実世界のデータでは非ゼロ類似度が $o(n^2)$ 個にとどまる場合に、従来の $O(n^2)$ HACアルゴリズムの非効率性を解消すること。
- スパースな辺重み付きグラフ上での効率的で正確かつ近似可能なHACを実現する汎用的なアルゴリズムフレームワークを設計すること。
- 特に平均連結法において、以前はこのようなアルゴリズムが存在しなかったが、広く使われる連結測度に対してサブクアドラティックまたはほぼ線形時間計算量を達成すること。
- $k$-NNグラフを用いたメトリック空間の点集合を対象に、実世界の点データセットにおける提案アルゴリズムの実用的スケーラビリティとクラスタリング品質を検証すること。
提案手法
- フレームワークは、グラフの辺を対象とした効率的な優先度キュー操作を可能にする、ネイバーヒープというモジュラーなデータ構造を用いる。
- 平均連結法では、動的かつ低出次数のグラフの向き付けを維持し、最大出次数が $O(\alpha)$ となるように保証する。ここで $\alpha$ はグラフのアーボリシティを表す。
- 正確なアルゴリズムは $\tilde{O}(n\bar{\alpha})$ 時間で実行され、$\alpha = O(\sqrt{m})$ であるため、$\tilde{O}(n\sqrt{m})$ 時間で実現される。
- 平均連結法の近似アルゴリズムは、サンプリングに基づくアプローチにより $\epsilon$-近い連結値を維持することで、$\tilde{O}(m)$ 時間で実行される。
- この手法は、メトリック空間の点集合から構築された $k$-NN グラフにも適用可能であり、クラスタリングパイプラインをグラフベースのHACワークフローに変換する。
- フレームワークは、未定義の類似度を $\bot$(完全・WPGMA用)またはゼロ(平均連結法用)として扱い、$n \times n$ 類似度行列を格納しない辺重み付きグラフ表現を用いる。
実験結果
リサーチクエスチョン
- RQ1非ゼロ類似度が $o(n^2)$ 個にとどまる場合に、サブクアドラティック時間で動作する平均連結法の正確なHACアルゴリズムを設計できるか?
- RQ2スパースグラフ環境下で、完全およびWPGMA連結法といった古典的連結測度に対して、ほぼ線形時間計算量を達成できるか?
- RQ3平均連結法の近似HACアルゴリズムを設計し、$\tilde{O}(m)$ 時間で実行可能であり、かつクラスタリング品質を維持できるか?
- RQ4提案されたフレームワークは、60,000点以上の大規模データセットに対しても、標準的な $O(n^2)$ 実装と比較して顕著なエンドツーエンドの高速化を達成できるか?
主な発見
- 正確な平均連結法HACアルゴリズムは $\tilde{O}(n\sqrt{m})$ 時間で実行され、$m = n^{2-\epsilon}$ の場合にサブクアドラティックとなる。これは、この測度に対する最初の正確なアルゴリズムである。
- フレームワークは、完全およびWPGMA連結法に対して $\tilde{O}(m)$-時間の正確なアルゴリズムを達成し、標準的な $O(n^2)$ 複雑さと比べて顕著に改善されている。
- Fashion-MNISTデータセット(60,000点)では、sklearnの $O(n^2)$ メトリックベースHACと比較して、20.7倍のエンドツーエンドの高速化を達成した。
- Last.fmデータセット(292,385点)では、近似平均連結法アルゴリズムが76.5倍の高速化を達成し、外挙推定では全データセットで200倍~500倍の高速化が予想される。
- 近似およびシンプルな正確アルゴリズムは、正確なsklearnベースラインと比較して、クラスタリング品質が1%以内の差に収まる。正確アルゴリズムは平均でARIが1.8%、NMIが0.5%高い。
- アルゴリズムのメモリ使用量は約 $56m + O(n)$ バイトであり、256GBのマシンで数十億ノードおよび20億~30億エッジのグラフ処理が可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。