Skip to main content
QUICK REVIEW

[論文レビュー] Dimensionality Reduction for k-Means Clustering and Low Rank Approximation

Michael B. Cohen, Sam Elder|arXiv (Cornell University)|Oct 24, 2014
Sparse and Compressive Sensing Techniques参考文献 41被引用数 14
ひとこと要約

この論文は、k-平均クラスタリングおよび低ランク近似における次元削減を可能にする射影コスト保存スケッチを導入し、(1+ε)の相対誤差を達成する。ランダム射影、SVD、または列サンプリングを用いてデータをO(k)次元に削減することで、k-平均や低ランクアルゴリズムの計算を高速化しつつ近似品質を保持する。k-平均クラスタリングにおいては、入力サイズに依存せずkに関して非線形なO(log k / ε²)次元で(9+ε)の近似が達成され、これはkに関して非線形な次元で初めての結果である。

ABSTRACT

We show how to approximate a data matrix $\mathbf{A}$ with a much smaller sketch $\mathbf{ ilde A}$ that can be used to solve a general class of constrained k-rank approximation problems to within $(1+ε)$ error. Importantly, this class of problems includes $k$-means clustering and unconstrained low rank approximation (i.e. principal component analysis). By reducing data points to just $O(k)$ dimensions, our methods generically accelerate any exact, approximate, or heuristic algorithm for these ubiquitous problems. For $k$-means dimensionality reduction, we provide $(1+ε)$ relative error results for many common sketching techniques, including random row projection, column selection, and approximate SVD. For approximate principal component analysis, we give a simple alternative to known algorithms that has applications in the streaming setting. Additionally, we extend recent work on column-based matrix reconstruction, giving column subsets that not only `cover' a good subspace for $\bv{A}$, but can be used directly to compute this subspace. Finally, for $k$-means clustering, we show how to achieve a $(9+ε)$ approximation by Johnson-Lindenstrauss projecting data points to just $O(\log k/ε^2)$ dimensions. This gives the first result that leverages the specific structure of $k$-means to achieve dimension independent of input size and sublinear in $k$.

研究の動機と目的

  • 行列のkランク近似のコストを保持する次元削減技術を開発し、k-平均クラスタリングおよび低ランク近似の計算を高速化すること。
  • 任意のk次元部分空間近似が元の行列におけるそれとほぼ同等になることを保証する一般枠組み—射影コスト保存スケッチ—を提供すること。
  • k-平均および低ランク問題に対して、O(k)次元のみで(1+ε)の相対誤差を達成することにより、先行研究と比較して次元を顕著に削減すること。
  • 次元削減により通信量と保存領域を最小限に抑えることで、効率的な分散処理およびストリーミングアルゴリズムの実現を可能にすること。

提案手法

  • 任意のk次元部分空間への射影のコストが(1+ε)の誤差内で乗法的に保存される射影コスト保存スケッチの概念を導入する。
  • ランダム射影、列サンプリング、および近似SVDを用いて、保証付きの性能でこのようなスケッチを効率的に構築する。
  • Johnson-Lindenstrauss型の射影を用いて、データをO(log k / ε²)次元に削減し、k-平均クラスタリングで(9+ε)の近似を維持する。
  • 既存のランダム化SVDおよびサンプリングアルゴリズムを活用し、近似SVDや不正確なサンプリング確率をフレームワーク内で使用可能であることを示す。
  • 非自明な射影を用いてまずO(k/ε²)次元に、次にO(k/ε)次元にまで削減することで、通信量がÕ(s log d log k)ビットに抑えられる分散アルゴリズムを設計する。
  • 列ベースの行列再構成を拡張し、良い部分空間を張る列のサブセットを選択するとともに、低ランク近似を直接計算可能にする。

実験結果

リサーチクエスチョン

  • RQ1次元削減を用いて、O(k)次元にデータを削減しながら、k-平均クラスタリングで(1+ε)の相対誤差を達成できるか?
  • RQ2元の行列のランクが高くなっても、O(k)列で十分なスケッチを構築し、kランク近似のコストを保存できるか?
  • RQ3Johnson-Lindenstrauss射影を用いて、入力サイズに依存せずkに関して非線形なO(log k / ε²)次元で、k-平均クラスタリングで(9+ε)の近似が達成できるか?
  • RQ4列サンプリング技術を用いて、粗い近似SVDを相対誤差の低い低ランク近似に改善できるか?
  • RQ5提案されたスケッチフレームワークを通信量を最小限に抑える分散およびストリーミング環境に適用できるか?

主な発見

  • Johnson-Lindenstrauss射影を用いてO(log k / ε²)次元に削減することで、k-平均クラスタリングで(9+ε)の近似を達成した。これは、入力サイズに依存せずkに関して非線形な次元で初めての結果である。
  • ランダム射影、列サンプリング、または近似SVDを用いて、O(k/ε)のサイズのスケッチにより、k-平均および低ランク近似で(1+ε)の相対誤差を達成した。
  • 提案された射影コスト保存スケッチは、スケッチ上での任意のk次元部分空間近似のコストが、元の行列におけるコストの(1+ε)以内に保たれることを保証する。
  • まずO(k/ε²)次元に、次にO(k/ε)次元にまで削減することで、通信量がÕ(s log d log k)ビットに抑えられる分散k-平均アルゴリズムを設計した。
  • フレームワークにより、データパーティションの独立処理とスケッチ行列の最小限の通信を可能にし、ストリーミングおよび分散計算を効率的に行えるようになった。
  • 列ベースの行列再構成を拡張し、選択された列が良い部分空間を張るとともに、低ランク近似を直接計算可能であることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。