Skip to main content
QUICK REVIEW

[論文レビュー] Hadoop Scheduling Base On Data Locality

Bo Jiang, Jiaying Wu|arXiv (Cornell University)|Jun 1, 2015
Cloud Computing and Resource Management参考文献 3被引用数 5
ひとこと要約

本論文は、タスクの局所性を考慮したHadoopスケジューリングアルゴリズムを提案しており、リソースプリフェッチを用いてタスクの局所性を向上させ、ジョブ完了時間を短縮する。タスクの完了時間を推定し、タスク実行前にデータブロックを候補ノードに事前に転送することで、より良いデータ局所性を確保し、実験で測定可能な性能向上を達成する。

ABSTRACT

In hadoop, the job scheduling is an independent module, users can design their own job scheduler based on their actual application requirements, thereby meet their specific business needs. Currently, hadoop has three schedulers: FIFO, computing capacity scheduling and fair scheduling policy, all of them are take task allocation strategy that considerate data locality simply. They neither support data locality well nor fully apply to all cases of jobs scheduling. In this paper, we took the concept of resources-prefetch into consideration, and proposed a job scheduling algorithm based on data locality. By estimate the remaining time to complete a task, compared with the time to transfer a resources block, to preselect candidate nodes for task allocation. Then we preselect a non-local map tasks from the unfinished job queue as resources-prefetch tasks. Getting information of resources blocks of preselected map task, select a nearest resources blocks from the candidate node and transferred to local through network. Thus we would ensure data locality good enough. Eventually, we design a experiment and proved resources-prefetch method can guarantee good job data locality and reduce the time to complete the job to a certain extent.

研究の動機と目的

  • 既存のHadoopスケジューラ(FIFO、Capacity、Fair)がデータ局所性を効果的にサポートできないという限界を解決すること。
  • プロアクティブなデータ配置により、データ転送のオーバーヘッドを低減することで、ジョブスケジューリングの効率を向上させること。
  • データ局所性と推定タスク完了時間に基づいて、動的に最適なノードを選択するスケジューリングメカニズムを設計すること。
  • リソースプリフェッチの有効性を評価し、高いデータ局所性を維持するとともに、全体のジョブ実行時間を短縮できること。

提案手法

  • 未完了ジョブキューからの非局所マップタスクを特定し、早期のデータ転送の対象とすべき候補として選定するリソースプリフェッチメカニズムを導入する。
  • タスクの残りの完了時間を推定し、ネットワーク経由でのデータブロック転送に要する時間と比較する。
  • 近接性とネットワークコストに基づき、候補ノードから最も近いデータブロックを選定し、ターゲットノードに事前に転送する。
  • データ局所性と転送時間の両方を評価することで、タスク割り当てのためのノードを事前に選定し、タスク実行前にデータがローカルに確保されるようにする。
  • タスク完了時間の推定とネットワークに配慮したデータ転送を組み合わせたハイブリッド戦略を用い、スケジューリング意思決定を最適化する。
  • リアルタイムのクラスタ状態とタスク進行状況に基づいて、スケジューリング選択をフィードバックドライブで更新するアプローチを採用する。

実験結果

リサーチクエスチョン

  • RQ1リソースプリフェッチは、現在のスケジューラーが達成できる水準を超えて、Hadoopジョブスケジューリングにおけるデータ局所性を向上させることができるか?
  • RQ2タスク完了時間の推定は、データ転送とタスク割り当て意思決定の効率にどのように影響するか?
  • RQ3分散Hadoop環境において、事前にデータブロックを転送することで、ジョブ完了時間をどの程度短縮できるか?
  • RQ4提案手法は、多様なジョブワークロードやクラスタ構成においても良好なデータ局所性を維持できるか?
  • RQ5データ転送コストとタスク実行時間のトレードオフは、スケジューリングパフォーマンスにどのように影響するか?

主な発見

  • 提案されたリソースプリフェッチ手法により、タスク実行前にデータブロックを積極的に候補ノードに移動させることで、データ局所性が顕著に向上した。
  • 実験的評価においてジョブ完了時間が短縮されたことから、実世界のワークロードにおいて本手法の有効性が示された。
  • 従来のスケジューラーと比較して、データ局所性とネットワーク転送コストのバランスをより良くとることで、優れた性能を発揮した。
  • 動的かつ多様なクラスタ条件下でも、本手法は高いデータ局所性を維持できた。
  • 推定完了時間と転送コストに基づくタスクスケジューリング意思決定により、リソースの効率的利用が実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。