Skip to main content
QUICK REVIEW

[論文レビュー] Massively Parallel Algorithms and Hardness for Single-Linkage Clustering Under $\ell_p$-Distances

Grigory Yaroslavtsev, Adithya Vadapalli|arXiv (Cornell University)|Oct 4, 2017
Advanced Clustering Algorithms Research参考文献 3被引用数 21
ひとこと要約

本稿では、$\varepsilon_p$-距離(ハミング、$\ell_1$、$\ell_2$、$\ell_\infty$)における単一連結クラスタリングのための、初めてのスケーラブルな並列アルゴリズムを提示する。固定次元 $d$ において、$O(\log n)$ MPCラウンドで $(1+\epsilon)$-近似を達成する。また、標準的な MPC 困難性仮定のもとで、$o(\log n)$-ラウンドのアルゴリズムは定数要因の近似を達成できないことを示し、Spark 実験により、数個のオーダーの高速化を確認した。

ABSTRACT

We present massively parallel (MPC) algorithms and hardness of approximation results for computing Single-Linkage Clustering of $n$ input $d$-dimensional vectors under Hamming, $\ell_1, \ell_2$ and $\ell_\infty$ distances. All our algorithms run in $O(\log n)$ rounds of MPC for any fixed $d$ and achieve $(1+ε)$-approximation for all distances (except Hamming for which we show an exact algorithm). We also show constant-factor inapproximability results for $o(\log n)$-round algorithms under standard MPC hardness assumptions (for sufficiently large dimension depending on the distance used). Efficiency of implementation of our algorithms in Apache Spark is demonstrated through experiments on a variety of datasets exhibiting speedups of several orders of magnitude.

研究の動機と目的

  • マスサイト・パラレルコンピュテーション(MPC)モデルにおいて、一般的な $\ell_p$-距離のもとで大規模なベクトルデータに対する単一連結クラスタリングのための、効率的でスケーラブルなアルゴリズムを設計すること。
  • 従来の研究が $k$-mean や $k$-median に注力していたり、ベクトルデータに対して非効率な場合が多く、MPC における単一連結クラスタリングの証明可能な保証のギャップを埋めること。
  • 標準的な MPC 困難性仮定のもとで、$o(\log n)$-ラウンドのアルゴリズムが $k$-SLC に対して定数要因の近似を達成できないことを示す理論的限界を確立すること。
  • Apache Spark 上での実装と評価を通じて、実用的な効率性を示すこと。

提案手法

  • MST における $k-1$ 個の最長辺と $k$-SLC の等価性を活用し、Boruvka のアルゴリズムのシミュレーションによる MPC 合致 MST 構築を用いる。
  • $\ell_p$-距離に基づく階層的クラスタリングと、近似最近傍探索(ANN)を組み合わせ、近似と局所性を制御するパrameter $\eta$ を用いる。
  • ベクトルを距離閾値に基づいて再帰的にパーティショニングする戦略を採用し、キャッシュされたサブセット上で Prim のアルゴリズムを用いて局所的 MST を計算する。
  • $\eta$-パrameter化された ANN フィルタを用いて、通信量と局所的計算量を削減し、収縮する距離範囲内の候補近傍のみに焦点を当てる。
  • 各ラウンドで局所的クラスタリングとマシン間通信を実行し、クラスタ間距離に基づいてクラスタを統合する、複数ラウンドの MPC フレームワークを実装する。
  • 理論的 MPC 保証と実際の Spark 最適化(キャッシュに配慮したデータレイアウト、クラスタ境界の反復的精錬)を統合する。

実験結果

リサーチクエスチョン

  • RQ1MPC モデルにおいて、$\ell_p$-距離における単一連結クラスタリングは、証明可能な近似保証のもとで、効率的に解けるか?
  • RQ2MPC における $k$-SLC に対して、$(1+\epsilon)$-近似を達成するためのラウンド複雑度の上限は何か?
  • RQ3MPC モデルに内在する制限により、$k$-SLC に対して、対数未満のラウンド数のアルゴリズムが定数要因の近似を達成できないのか?
  • RQ4ANN ベースのフィルタリングにおける $\eta$ の選択が、近似品質と実行時間にどのように影響するか?
  • RQ5理論的 MPC アルゴリズムは、Apache Spark のような実世界のシステムで、逐次的手法よりも顕著な高速化を達成できるか?

主な発見

  • 提案された MPC アルゴリズムは、任意の固定次元 $d$ に対して、$\ell_1$、$\ell_2$、$\ell_\infty$ 距離における $k$-SLC に対して $O(\log n)$ ラウンドで $(1+\epsilon)$-近似を達成する。
  • ハミング距離の場合にも正確なアルゴリズムを提供し、同様に $O(\log n)$ ラウンドで実行される。
  • 標準的な MPC 困難性仮定のもとで、次元が十分に大きい場合、$o(\log n)$-ラウンドのアルゴリズムは $\ell_p$-距離における $k$-SLC に対して定数要因の近似を達成できない。
  • Apache Spark における実験的評価では、逐次的 Prim のアルゴリズムよりも数個のオーダーの高速化が確認され、特に局所データが L2 キャッシュに収まる場合に顕著だった。
  • $\eta \approx 0.5$ と近似値 $\approx 1.15$ の付近で、局所入力が L2 キャッシュに収まる点に一致し、顕著な高速化が発生する。
  • すべてのデータセットにおいて、アルゴリズムは最大 40 ラウンドで終了し、$\ell_1$ および $\ell_\infty$ における性能は、共有パーティショニング論理のおかげで $\ell_2$ と類似している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。