Skip to main content
QUICK REVIEW

[論文レビュー] Optimizing MapReduce for Highly Distributed Environments

Benjamin Heintz, Abhishek Chandra|arXiv (Cornell University)|Jul 30, 2012
Cloud Computing and Resource Management参考文献 23被引用数 9
ひとこと要約

本稿では、地理的に分散したデータおよび計算リソースを有する極めて分散型の環境において、MapReduceジョブを実行するためのモデル駆動型でエンド・ツー・エンドの最適化フレームワークを提案する。プッシュ、マップ、シャッフル、リデュースの複数フェーズを同時に最適化することで、短視眼的な手法と比較して実行時間を最大82%短縮し、実世界のテストではアンビエントHadoopと比較して31–41%の改善を達成した。

ABSTRACT

MapReduce, the popular programming paradigm for large-scale data processing, has traditionally been deployed over tightly-coupled clusters where the data is already locally available. The assumption that the data and compute resources are available in a single central location, however, no longer holds for many emerging applications in commercial, scientific and social networking domains, where the data is generated in a geographically distributed manner. Further, the computational resources needed for carrying out the data analysis may be distributed across multiple data centers or community resources such as Grids. In this paper, we develop a modeling framework to capture MapReduce execution in a highly distributed environment comprising distributed data sources and distributed computational resources. This framework is flexible enough to capture several design choices and performance optimizations for MapReduce execution. We propose a model-driven optimization that has two key features: (i) it is end-to-end as opposed to myopic optimizations that may only make locally optimal but globally suboptimal decisions, and (ii) it can control multiple MapReduce phases to achieve low runtime, as opposed to single-phase optimizations that may control only individual phases. Our model results show that our optimization can provide nearly 82% and 64% reduction in execution time over myopic and single-phase optimizations, respectively. We have modified Hadoop to implement our model outputs, and using three different MapReduce applications over an 8-node emulated PlanetLab testbed, we show that our optimized Hadoop execution plan achieves 31-41% reduction in runtime over a vanilla Hadoop execution. Our model-driven optimization also provides several insights into the choice of techniques and execution parameters based on application and platform characteristics.

研究の動機と目的

  • 地理的に分散したデータおよび計算リソースを有する極めて分散型の環境における効率的なMapReduce実行の増大するニーズに対応すること。
  • 現代の大規模アプリケーションにおいて、中央集権的なデータと密結合なクラスタを仮定する従来のMapReduce展開の限界を特定すること。
  • 分散環境におけるすべてのMapReduceフェーズにわたる主要な設計選択とパフォーマンスのトレードオフを捉える柔軟なモデリングフレームワークを開発すること。
  • 局所的でフェーズ固有の意思決定ではなく、グローバルなパフォーマンスのトレードオフを考慮するエンド・ツー・エンドの最適化戦略を提案すること。
  • データ拡張係数やネットワークの非均一性といった、アプリケーションおよびプラットフォームの特性に基づいた、実行パラメータと技術に関する実行可能なインサイトを提供すること。

提案手法

  • 分散型のデータソースおよびコンピューティングノード全体にわたるMapReduce実行を抽象化する、データに依存しないエンド・ツー・エンドのパフォーマンスモデルを設計する。
  • データプッシュ、マップ、シャッフル、リデュースの複数フェーズにおける共同制御問題として最適化を定式化し、フェーズ間のトレードオフ分析を可能にする。
  • データサイズ、ネットワーク遅延、計算能力といったパラメータを用いた数学的モデルを導入し、異なる構成における実行時間を予測する。
  • パイプライン処理およびリソース割り当て戦略を含め、合計実行時間を最小化する最適な構成をモデルから同定する。
  • モデルの出力を改造済みHadoopディストリビューションに実装し、実世界のテストベッドでのパフォーマンス向上を検証する。
  • 8ノードのPlanetLabエミュレーテッドテストベッドを活用し、3つの多様なMapReduceアプリケーションにおいて最適化されたHadoop実行計画の評価を実施する。

実験結果

リサーチクエスチョン

  • RQ1エンド・ツー・エンドの最適化(複数フェーズにわたる最適化)は、短視眼的でフェーズ単位の最適化と比較して、実行時間の短縮においてどの程度優れているか?
  • RQ2ネットワークの非均一性およびデータ分布は、MapReduceパフォーマンス最適化の有効性にどのような影響を及えるか?
  • RQ3データ拡張係数といったアプリケーション固有の特性は、最適な実行計画にどのように影響を与えるか?
  • RQ4モデル駆動型最適化は、アンビエントHadoopと比較して、分散環境における実世界のHadoopパフォーマンスをどの程度向上できるか?
  • RQ5パイプライン処理、データローカリティ、リソース割り当てといった、システムパラメータおよびアーキテクチャ的選択肢は、プラットフォームおよびワークロード条件が変化する中で、どの程度の影響を持つのか?

主な発見

  • 提案されたエンド・ツー・エンドの最適化により、局所的に最適な意思決定のみを下す短視眼的最適化戦略と比較して、実行時間が最大82%短縮された。
  • 8ノードのPlanetLabテストベッドを用いた3つの実MapReduceアプリケーションの評価において、モデル駆動型アプローチはアンビエントHadoopと比較して実行時間を31–41%削減した。
  • 高度に分散型で非均一なネットワーク環境において、本最適化は顕著な利点を示した—グローバルに分散したサイトでは短視眼的手法と比較して82%の改善が得られたが、単一ローカルクラスタ環境では37%の改善にとどまった。
  • データ拡張係数αは最適な実行計画に強く影響を与え、最適化に最も感受しやすいフェーズやパイプライン処理が最大の利点をもたらすフェーズを変える要因となった。
  • モデルは、ネットワークの非均一性がグローバル最適化の価値を増幅させることを明らかにした。これは、リソースおよびデータ分布のパターンをより効果的に活用可能にしたためである。
  • 本フレームワークは、アプリケーションおよびインfra構成の特性に基づいた、最適なデータパーティショニングやパイプラインスケジューリングといった、実行可能なパラメータ選択に関するインサイトを提供した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。