Skip to main content
QUICK REVIEW

[論文レビュー] Embed and Conquer: Scalable Embeddings for Kernel k-Means on MapReduce

Ahmed Elgohary, Ahmed Farahat|arXiv (Cornell University)|Nov 11, 2013
Advanced Clustering Algorithms Research参考文献 28被引用数 6
ひとこと要約

本稿では、近似最近接重心(APNC)と呼ばれる低次元埋め込みの新規族を用いて、スケーラブルなMapReduceフレームワークを、カーネルk-meansクラスタリングに提案する。データインスタンスをカーネル類似度を保持する低次元空間に埋め込むことで、分散システム上で効率的かつ統合的な並列処理を可能とし、ImageNet や RCV1 の大規模データセットにおいて、正確なカーネルk-meansや既存の近似手法と比較して、著しく短い実行時間で高いクラスタリング精度を達成する。

ABSTRACT

The kernel $k$-means is an effective method for data clustering which extends the commonly-used $k$-means algorithm to work on a similarity matrix over complex data structures. The kernel $k$-means algorithm is however computationally very complex as it requires the complete data matrix to be calculated and stored. Further, the kernelized nature of the kernel $k$-means algorithm hinders the parallelization of its computations on modern infrastructures for distributed computing. In this paper, we are defining a family of kernel-based low-dimensional embeddings that allows for scaling kernel $k$-means on MapReduce via an efficient and unified parallelization strategy. Afterwards, we propose two methods for low-dimensional embedding that adhere to our definition of the embedding family. Exploiting the proposed parallelization strategy, we present two scalable MapReduce algorithms for kernel $k$-means. We demonstrate the effectiveness and efficiency of the proposed algorithms through an empirical evaluation on benchmark data sets.

研究の動機と目的

  • カーネルk-meansのスケーラビリティの限界を解消するため、全カーネル行列の計算と保存に起因する大規模データ処理における課題に対処すること。
  • コンmodityベースの分散クラスタ上でMapReduceモデルを用いて、カーネルk-meansの効率的並列化を可能とすること。
  • カーネル類似度を保持しつつ、正しいかつ効率的なクラスタリング近似を可能とする低次元埋め込みの族を設計すること。
  • 必要な埋め込み特性を満たす2つの実用的埋め込み手法—Nyström近似に基づくAPNC-Nysとp-安定分布を用いるAPNC-SD—を開発すること。
  • 中規模および大規模のベンチマークデータセット上で提案アルゴリズムの実験的妥当性を検証し、優れた正確性と効率性を示すこと。

提案手法

  • カーネルk-meansにおける正しさとスケーラビリティを保証する4つの主要な性質を持つ埋め込み族APNCを導入する。
  • 統一的な並列化戦略を提案:まずすべてのデータポイントの埋め込みを計算し、次にMapReduceを用いて埋め込み空間上でクラスタリングを実行する。
  • サブセットのデータポイントをサンプリングすることで、Nyström法を用いて全カーネル行列を近似し、APNC-Nys埋め込みを構築する。
  • ℓ1ノルムの近似を可能とするp-安定分布を用いて、カーネル符号化ベクトルの距離計算を効率化するAPNC-SD埋め込みを構築する。
  • 近似誤差を最小化するために、ℓ1およびℓ2距離に基づく不一致関数を設計し、埋め込み空間におけるクラスタ割り当てをガイドする。
  • MapReduceパイプラインでアルゴリズムを実行する:Mapフェーズで埋め込み計算を行い、Reduceフェーズで反復的クラスタリングと最近接重心割り当てを実行する。

実験結果

リサーチクエスチョン

  • RQ1分散環境下で正しいカーネルk-means近似に必要な性質を保持する低次元埋め込み族を定義できるか?
  • RQ2このような埋め込みを活用することで、MapReduce上でカーネルk-meansを効率的に並列化できるか?
  • RQ3Nyström法とp-安定分布を用いて、必要な性質を満たし、高精度なクラスタリングを可能にする埋め込みを構築できるか?
  • RQ4大規模データセット上での既存のカーネルk-means近似手法と比較して、提案されたAPNC-NysおよびAPNC-SD手法の正確性と効率性はどのように異なるか?
  • RQ5ImageNet や RCV1 のようなデータセットに対して、提案されたMapReduceベースのアルゴリズムは、競争力のあるクラスタリング品質を維持しながらどの程度スケーラブルに拡張できるか?

主な発見

  • ImageNetデータセットでは、APNC-SDがNMI 11.10%(l=1500)を達成し、先行手法の10.4%(Approx-KKM)を上回った。
  • RCV1データセットでは、APNC-SDがNMI 13.56%(l=1500)を達成し、スペクトルクラスタリングを用いた報告済み最高の28.65%と同等の精度であったが、実行時間が著しく短縮された。
  • 300件のサンプル(l=300)でのみ、APNC-NysおよびAPNC-SDの両方とも正確なカーネルk-meansとほぼ同一のクラスタリング精度を達成し、その信頼性を裏付けた。
  • RCV1データセットでは、APNC-SDが15.6分(l=1500)で総クラスタリング時間を短縮した。これはAPNC-Nysの29分、分散スペクトルクラスタリングベースラインの95分と比較して顕著に短い。
  • APNC-NysとAPNC-SDの埋め込み時間はほぼ同等であったが、APNC-SDはℓ1距離を用いるため、クラスタリングステップがより高速であった。
  • CovTypeデータセットでは、APNC-SDがNMI 15.56%(l=1500)を達成し、先行手法の14%(RFF)を上回り、APNC-Nysよりも高いNMIを達成しながらも、同程度の実行時間で実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。