Skip to main content
QUICK REVIEW

[論文レビュー] An Efficient Method of Partitioning High Volumes of Multidimensional Data for Parallel Clustering Algorithms

Saraswati Mishra, Avnish Chandra Suman|arXiv (Cornell University)|Sep 20, 2016
Data Management and Algorithms参考文献 3被引用数 6
ひとこと要約

本論文では、スケーラブルな K-Means++ シーディングを用いたボロノイ平面の木構造を用いた新規なパーティショニング手法を提案し、並列クラスタリングにおける高次元多次元データの効率的分布を実現する。次元数が増加する際、スケーラビリティとロードバランシングにおいて、従来の Kd-ツリーおよびグリッドベースの手法を上回る性能を発揮し、特に高次元産業ワークロード(100〜1000次元)において顕著である。

ABSTRACT

An optimal data partitioning in parallel & distributed implementation of clustering algorithms is a necessary computation as it ensures independent task completion, fair distribution, less number of affected points and better & faster merging. Though partitioning using Kd Tree is being conventionally used in academia, it suffers from performance drenches and bias (non equal distribution) as dimensionality of data increases and hence is not suitable for practical use in industry where dimensionality can be of order of 100s to 1000s. To address these issues we propose two new partitioning techniques using existing mathematical models & study their feasibility, performance (bias and partitioning speed) & possible variants in choosing initial seeds. First method uses an n dimensional hashed grid based approach which is based on mapping the points in space to a set of cubes which hashes the points. Second method uses a tree of voronoi planes where each plane corresponds to a partition. We found that grid based approach was computationally impractical, while using a tree of voronoi planes (using scalable K-Means++ initial seeds) drastically outperformed the Kd-tree tree method as dimensionality increased.

研究の動機と目的

  • 高次元データクラスタリングにおける Kd-ツリーおよびグリッドベースのパーティショニングの限界を解決すること。
  • 大規模かつ高次元データセットにおける並列クラスタリングのロードバランシングを改善し、パーティショニングのオーバーヘッドを低減すること。
  • 100〜1000次元の次元数を有する産業応用に適したスケーラブルでバイアスの小さいパーティショニング技術を開発すること。
  • パーティショニング品質および性能を向上させるために、代替の初期シード選択戦略を評価すること。

提案手法

  • 各内部ノードがボロノイ平面を表し、データ空間を凸領域に分割するツリー構造を提案する。
  • スケーラブルな K-Means++ を用いて、データ空間全体に均等に分散した初期シードを選択し、パーティショニングのバイアスを低減する。
  • 各データポイントは、最も近いボロノイ平面に割り当てられ、データセットの階層的パーティショニングが形成される。
  • ボロノイ境界に基づいて再帰的に領域を分割することで、データ分布に動的に適応する。
  • 幾何的分離を維持し、パーティション間の重複を最小限に抑える空間を埋めるアプローチを採用する。
  • パーティショニング速度、ロード不均衡、スケーラビリティの観点から、Kd-ツリーおよびハッシュ化されたグリッド手法と性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1高次元において、提案されたボロノイベースのパーティショニング手法は Kd-ツリーと比べてロードバランシングおよびパーティショニング速度でどのように差をつけるか?
  • RQ2異なる初期シード選択戦略が、高次元クラスタリングにおけるパーティショニング品質および収束に与える影響は何か?
  • RQ3100〜1000次元のデータを、パフォーマンス劣化を伴わずに効果的に処理できるか?
  • RQ4動的ロードリバランスの際、本手法は従来の技術と比較して影響を受けるポイント数をどれほど削減できるか?
  • RQ5実際の高次元データパーティショニングにおいて、グリッドベースのハッシュ化アプローチは実用的か?

主な発見

  • グリッドベースのハッシュ化アプローチは、高次元データに対して計算的に不切実であり、過剰なメモリおよび計算オーバーヘッドが生じた。
  • ボロノイ平面ツリー手法は、次元数が増加するに従い、Kd-ツリーを著しく上回るパーティショニング速度とロードバランシングを実現した。
  • スケーラブルな K-Means++ を用いたシード選択により、パーティショニングバイアスが低減し、クラスタ間でのデータ分布が改善された。
  • ボロノイベースの手法は、1000次元を超える高次元でも低ロード不均衡を維持したが、Kd-ツリーはパフォーマンス劣化を示した。
  • 本手法は、高次元データを含む並列クラスタリングワークロードにおいて、優れたスケーラビリティと効率性を示した。
  • 本研究では、産業スケールの応用においてボロノイベースのパーティショニングが、従来手法の代替として実用的かつ効果的であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。