Skip to main content
QUICK REVIEW

[論文レビュー] A Simulator for Data-Intensive Job Scheduling

Matteo Dell’Amico|arXiv (Cornell University)|Jun 25, 2013
Cloud Computing and Resource Management参考文献 15被引用数 7
ひとこと要約

本稿では、ジョブサイズが正確に分かっていない場合のデータ集約型バッチシステムにおけるサイズベースのジョブスケジューラーのシミュレーションベースの評価を提案している。著者らは、σ=1のログノルム分布を用いた顕著な推定誤差に対しても、FSP+PSスケジューラーがFIFOおよびフェアシェアリングを一貫して上回り、平均滞留時間を桁違いに短縮し、不正確なサイズ予測に対しても強いロバスト性を示している。

ABSTRACT

Despite the fact that size-based schedulers can give excellent results in terms of both average response times and fairness, data-intensive computing execution engines generally do not employ size-based schedulers, mainly because of the fact that job size is not known a priori. In this work, we perform a simulation-based analysis of the performance of size-based schedulers when they are employed with the workload of typical data-intensive schedules and with approximated size estimations. We show results that are very promising: even when size estimation is very imprecise, response times of size-based schedulers can be definitely smaller than those of simple scheduling techniques such as processor sharing or FIFO.

研究の動機と目的

  • ジョブサイズが事前に正確に分かっていないデータ集約型バッチワークロードにおいて、サイズベースのスケジューリングの実現可能性と性能を評価すること。
  • サイズ推定誤差が、特に平均滞留時間とフェアネスの観点からスケジューリング性能に与える影響を評価すること。
  • 現実のワークロードトレースと推定不確実性を想定した状況下で、FIFO、プロセッサシェアリング(PS)、FSP、およびハイブリッド型FSP+PSといった異なるスケジューリング戦略の有効性を比較すること。
  • シミュレーション結果を根拠に、HFSP Hadoopスケジューラの設計を支援する実証的証拠を提供し、実環境への展開を支援すること。
  • システム負荷とジョブサイズ分布の歪みを制御するd/nパラメータに対するスケジューリング性能の感度を分析すること。

提案手法

  • 著者らは、numpyとmatplotlibを用いたカスタムのPythonベースのシミュレータを開発し、スケジューリング論理に集中できるように、低レベルの実行エンジンの詳細を抽象化した。
  • ジョブは(到着時刻、実行時間)のペアとしてモデル化され、実行時間は実際のHadoopワークロードトレース(FB09-0、FB09-1、FB10)から抽出された。
  • サイズ推定誤差は、ログノルム分布を用いてモデル化される:推定サイズŝ = sX(X ~ Log-N(0, σ²))とし、誤差レベルを制御可能にする。
  • シミュレータは、FIFO、プロセッサシェアリング(PS)、残り実行時間最短(SRPT)、フェアサイズベースポリシー(FSP)に加え、FSP+PSやFSP+FIFOといったハイブリッドバージョンを含む、標準的なスケジューラを実装している。
  • 性能は、提出から完了までの平均滞留時間(sojourn time)を用いて評価され、安定性を確保するため複数回のシミュレーション実行の平均値が用いられている。
  • シミュレーションでは、負荷(l)、推定誤差(σ)、およびジョブサイズ分布の歪みを制御するd/nパラメータという3つの主要なシステムパラメータが評価されている。

実験結果

リサーチクエスチョン

  • RQ1ジョブサイズが正確に分かっていない状況下で、現実のデータ集約型ワークロードにおけるサイズベースのスケジューラーの性能はいかがなものか?
  • RQ2ログノルム分布としてモデル化されたサイズ推定誤差が、バッチジョブスケジューリングにおける平均滞留時間とフェアネスに与える影響は何か?
  • RQ3FSP+PSスケジューラーは、FIFO、PS、FSP+FIFOと比較して、応答時間と推定誤差へのロバスト性においてどのように異なるか?
  • RQ4システム負荷が、サイズベースと非サイズベースのスケジューラー間の性能差にどのように影響するか?
  • RQ5ジョブサイズ分布の形状を制御するd/nパラメータに対するスケジューリング性能の感度は何か?

主な発見

  • σ=1という高い推定誤差(推定値が2倍以上ずれる確率が50%以上)がある状況下でも、FSP+PSスケジューラーはFIFOと比較して平均滞留時間を桁違いに短縮し、一貫した性能向上を示している。
  • FSP+PSは、すべての3つのHadoopトレース(FB09-0、FB09-1、FB10)において、PSおよびFIFOを著しく上回っており、特に高負荷および高推定誤差下で顕著な性能優位性を示している。
  • FSP+FIFOスケジューラーは、長時間ジョブが過小推定され、早期にスケジューリングされることが原因で、性能の変動が大きく、まれに深刻な悪影響を及ぼすことがある。
  • 推定誤差が存在しない状況では、FSPとSRPTの性能はほぼ同一であり、FSPが平均滞留時間にほとんどコストをかけずにフェアネスを保証できることを確認している。
  • システム負荷が1.0を超えると、スケジューラー間の性能差が縮小し、極度の混雑状態ではサイズベースポリシーの利点が薄れる傾向にある。
  • d/nパラメータは全体的な性能にほとんど影響を及ぼさないため、ジョブサイズ分布の歪みの変動に対しても、スケジューリングの結果がロバストであることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。