Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Processing of k Nearest Neighbor Joins using MapReduce

Wei Lü, Yanyan Shen|arXiv (Cornell University)|Jun 30, 2012
Data Mining Algorithms and Applications被引用数 6
ひとこと要約

本稿では、大規模かつ多次元データセット向けに、Voronoi図に基づくパーティショニングおよびグループ化戦略を用いてデータシャッフルと計算を最小限に抑えることで、MapReduceにおける効率的なkNNジョインアルゴリズムを提案する。コストモデルと2つのグリーディグループ化手法を導入し、リプリカを削減することで、実データおよび合成データにおいて高いスケーラビリティとパフォーマンスを達成する。

ABSTRACT

k nearest neighbor join (kNN join), designed to find k nearest neighbors from a dataset S for every object in another dataset R, is a primitive operation widely adopted by many data mining applications. As a combination of the k nearest neighbor query and the join operation, kNN join is an expensive operation. Given the increasing volume of data, it is difficult to perform a kNN join on a centralized machine efficiently. In this paper, we investigate how to perform kNN join using MapReduce which is a well-accepted framework for data-intensive applications over clusters of computers. In brief, the mappers cluster objects into groups; the reducers perform the kNN join on each group of objects separately. We design an effective mapping mechanism that exploits pruning rules for distance filtering, and hence reduces both the shuffling and computational costs. To reduce the shuffling cost, we propose two approximate algorithms to minimize the number of replicas. Extensive experiments on our in-house cluster demonstrate that our proposed methods are efficient, robust and scalable.

研究の動機と目的

  • データ量と次元数の増加に伴い、集中型システムにおけるkNNジョインの計算コストとシャッフルコストが高くなる問題に対処すること。
  • MapReduceフレームワークを用いて分散環境で効率的なkNNジョイン処理を可能にすること。
  • インtelリジェントなデータグループ化によりリプリカを削減することで、データシャッフルと計算オーバーヘッドを最小限に抑えること。
  • MapReduceフレームワークの変更を必要としないスケーラブルで頑健かつ効率的なkNNジョイン手法を設計すること。

提案手法

  • 適切に選択されたピボットを用いたVoronoi図を活用し、オブジェクトを初期グループにパーティショニングする。
  • セル間距離が制限されている場合にのみVoronoiセルをグループ化し、kNN近傍が同じグループ内に残ることを保証する。
  • シャッフル時のリプリカ数を推定するためのコストモデルを適用し、グループ化意思決定を支援する。
  • リプリカ数を最小限に抑えつつジョインの正しさを保つ2つのグリーディグループ化戦略を提案する。
  • マッパーおよびリデューサー段階でプルーニングルールを適用し、不要な距離計算を削減する。
  • グループ割り当てに基づいてオブジェクトをリデューサーにマップし、クエリオブジェクトのすべてのkNN近傍が同じ場所に配置されることを保証する。

実験結果

リサーチクエスチョン

  • RQ1集中型インデックスに依存せずに、分散環境におけるMapReduceでのkNNジョインをどのように効率的に実装できるか?
  • RQ2正しいkNN結果を保証しつつ、リデューサー間でデータリプリカの数を最小限に抑えるグループ化戦略は何か?
  • RQ3提案手法は、データサイズと次元数の増加に伴って、ベースライン手法と比較してどのようにスケーリングするか?
  • RQ4パーティショニングおよびグループ化のパラメータの違いが、シャッフルコストと計算コストに与える影響は何か?
  • RQ5既存のMapReduceベースのkNNジョイン技術と比較して、実行時間およびリソース使用量の面で、提案手法がより優れたパフォーマンスを達成できるか?

主な発見

  • 提案手法PGBJは、実行時間およびシャッフルコストの両面でH-BRJおよびPBJを上回り、データサイズが大きくなるにつれて性能向上が顕著になる。
  • シャッフルコストは計算ノード数に比例して線形に増加するが、PGBJはリプリケーションを削減することで、低いオーバーヘッドを維持する。
  • 異なるデータセットにおいても良好なスケーリングを示し、実データおよび合成データの両方で一貫したパフォーマンス向上を達成する。
  • コストモデルはリプリカ数を正確に予測でき、シャッフルを低減する効果的なグリーディグループ化戦略の実現を可能にする。
  • さまざまなデータ分布と次元数にわたり、頑健性を保ちつつ高いプルーニング効率を維持する。
  • 実装にはMapReduceフレームワークの変更が不要であり、既存のクラスタ環境への容易なデプロイが可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。