Skip to main content
QUICK REVIEW

[論文レビュー] Optimization and analysis of large scale data sorting algorithm based on Hadoop

Zhuo Wang, Longlong Tian|arXiv (Cornell University)|Jun 1, 2015
Graph Theory and Algorithms参考文献 2被引用数 4
ひとこと要約

本論文は、Hadoopにおける大規模データ向けに最適化された、複数ラウンドのMapReduceベースのソートアルゴリズムを提案している。ランダムサンプリングとリデューサー間での均一なデータ分散を用いることで、負荷の不均衡を低減する。実験の結果、マス・データセットにおいて、ネイティブHadoopシャッフルソートよりも効率性とスケーラビリティに優れていることが示された。

ABSTRACT

When dealing with massive data sorting, we usually use Hadoop which is a framework that allows for the distributed processing of large data sets across clusters of computers using simple programming models. A common approach in implement of big data sorting is to use shuffle and sort phase in MapReduce based on Hadoop. However, if we use it directly, the efficiency could be very low and the load imbalance can be a big problem. In this paper we carry out an experimental study of an optimization and analysis of large scale data sorting algorithm based on hadoop. In order to reach optimization, we use more than 2 rounds MapReduce. In the first round, we use a MapReduce to take sample randomly. Then we use another MapReduce to order the data uniformly, according to the results of the first round. If the data is also too big, it will turn back to the first round and keep on. The experiments show that, it is better to use the optimized algorithm than shuffle of MapReduce to sort large scale data.

研究の動機と目的

  • 大規模データ処理におけるHadoopのネイティブシャッフルベースのソートにおける非効率性と負荷の不均衡を解消すること。
  • データスケューを最小限に抑えてソートスループットを向上させる、スケーラブルで分散型のソートアルゴリズムを設計すること。
  • さまざまなデータサイズ下での標準Hadoop MapReduceソートと比較して、提案アルゴリズムのパフォーマンスを評価すること。
  • サンプリングとデータ分散戦略がクラスタ環境におけるソーティング効率に与える影響を分析すること。

提案手法

  • アルゴリズムは複数のMapReduceラウンドを用いる:最初のラウンドでデータセットのランダムサンプリングを行い、データ分布を推定する。
  • 2番目のMapReduceラウンドでは、サンプル結果をもとにパーティショニングの範囲境界を定義し、リデューサー間でのより均一なデータ分散を実現する。
  • 初期パーティショニング後もデータが大きすぎる場合は、繰り返しサンプリングとパーティショニングのステップを実行し、データが管理可能なパーティションに収まるまで繰り返す。
  • HadoopのMapReduceモデルを活用するが、パーティショニング論理を変更することでスケューを低減し、負荷分散を向上させる。
  • しばしば大規模ソート処理で不均一なリデューサー負荷を引き起こすHadoopのデフォルトのハッシュベースのパーティショニングに依存しない。
  • 標準Hadoop APIを用いて実装され、サンプルデータ統計に基づくカスタムパーティショニング論理を有する。

実験結果

リサーチクエスチョン

  • RQ1大規模データ処理において、複数ラウンドのサンプリングとパーティショニングは、Hadoopのデフォルトシャッフルと比較してどのようにソーティングパフォーマンスを向上させるか?
  • RQ2提案アルゴリズムは、大規模ソート処理中、リデューサー間の負荷不均衡をどの程度低減するか?
  • RQ3最適化されたアルゴリズムの実行時間とリソース利用効率の観点から、どの程度のパフォーマンス向上が達成されるか?
  • RQ4データ量の増加に伴ってアルゴリズムはどのようにスケーリングするか? また、イテレーティブサンプリングはどの段階で必要になるか?

主な発見

  • サンプルデータを用いてリデューサー間で均一なパーティショニングを実現することで、最適化されたアルゴリズムは負荷の不均衡を顕著に低減した。
  • パフォーマンス評価の結果、提案手法は実行時間とスケーラビリティの両面でネイティブHadoopシャッフルソートを上回っていることが示された。
  • 繰り返しサンプリングを用いた複数のMapReduceラウンドにより、1ラウンド処理では処理できない非常に大きなデータセットの効果的な処理が可能になった。
  • サンプリングに基づく範囲ベースのパーティショニングにデフォルトのハッシュパーティショニングを置き換えることで、より良いデータ分散と高いスループットが達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。