Skip to main content
QUICK REVIEW

[論文レビュー] Bandwidth-Aware Scheduling with SDN in Hadoop: A New Trend for Big Data

Peng Qin, Bin Dai|arXiv (Cornell University)|Mar 12, 2014
Cloud Computing and Resource Management参考文献 8被引用数 12
ひとこと要約

本稿では、ソフトウェア定義ネットワーキング(SDN)をHadoopと統合することでジョブ完了時間を最適化する、帯域幅に配慮したタスクスケジューラーBASSを提案する。SDNの集中制御を活用して動的な帯域幅割り当てと、データローカリティおよび利用可能なネットワーク容量に基づく知的なタスク割り当てを実現することで、BASSは、最先端のスケジューラーであるBARやHDSと比較して、ジョブ完了時間を最大18%短縮する。これは、スケーラブルなビッグデータ処理における新たなトレンドを示している。

ABSTRACT

Software Defined Networking (SDN) is a revolutionary network architecture that separates out network control functions from the underlying equipment and is an increasingly trend to help enterprises build more manageable data centers where big data processing emerges as an important part of applications. To concurrently process large-scale data, MapReduce with an open source implementation named Hadoop is proposed. In practical Hadoop systems one kind of issue that vitally impacts the overall performance is know as the NP-complete minimum make span problem. One main solution is to assign tasks on data local nodes to avoid link occupation since network bandwidth is a scarce resource. Many methodologies for enhancing data locality are proposed such as the HDS and state-of-the-art scheduler BAR. However, all of them either ignore allocating tasks in a global view or disregard available bandwidth as the basis for scheduling. In this paper we propose a heuristic bandwidth-aware task scheduler BASS to combine Hadoop with SDN. It is not only able to guarantee data locality in a global view but also can efficiently assign tasks in an optimized way. Both examples and experiments demonstrate that BASS has the best performance in terms of job completion time. To our knowledge, BASS is the first to exploit talent of SDN for big data processing and we believe it points out a new trend for large-scale data processing.

研究の動機と目的

  • HadoopクラスタにおけるNP完全な最小マックススパン問題に対処すること。ここでは、ジョブ完了時間がネットワーク帯域幅とリソース競合によって制限される。
  • HDS や BAR のような既存のスケジューラーの限界を克服すること。これらはデータローカリティを優先するが、グローバルな帯域幅の可用性や動的なネットワーク状態を考慮しない。
  • SDNの集中制御とプログラマビリティを活用して、ビッグデータワークロードにおけるパフォーマンス向上を実現する帯域幅に配慮したスケジューリングフレームワークを設計すること。
  • 提案されたスケジューラーが、さまざまなワークロードとネットワーク状態下での実世界のHadoop環境において、有効性を評価すること。

提案手法

  • ネットワーク帯域幅の割り当てのためのタイムスロット(TS)方式を提案。リンク利用率を管理し、スケジューリングの予測可能性を確保するため、ネットワークトランスミッションを時間インターバルに分割する。
  • HadoopにおけるSDN統合による帯域幅に配慮したスケジューリング(BASS)を導入。タスク割り当てを、ローカル実行とリモート実行の両方を考慮した推定完了時間に基づいて評価するヒューリスティックスケジューラーである。
  • タスクの進行状況と残り時間の推定にProgressRate方式を用い、リアルタイムのノードの空き時間とネットワーク利用状況に基づいた動的スケジューリング意思決定を可能にする。
  • SDNコントローラーを統合し、ネットワーク帯域幅を監視・制御。OpenFlowを用いて帯域幅予約を強制し、タスクスケジューリング中のデータ転送を最適化する。
  • ハイブリッド意思決定論理を採用:ローカル実行が可能で高速な場合はローカルに割り当てるが、そうでない場合は帯域幅が十分でかつ全体の完了時間が短縮される場合に限りリモートノードにオフロードする。
  • 6ノード、2台のOpen vSwitch、100Mbpsリンクを備えた実Hadoopクラスタを用いてスケジューラーを検証。WordcountおよびSortワークロードを用いてテストした。

実験結果

リサーチクエスチョン

  • RQ1SDNの集中制御による帯域幅制御を、Hadoopクラスタにおけるジョブ完了時間の向上に効果的に活用できるか?
  • RQ2タスクスケジューリングにネットワーク帯域幅の意識を組み込むことで、従来のローカリティのみを重視するスケジューラーと比較して、データローカリティと全体のパフォーマンスにどのような影響を与えるか?
  • RQ3さまざまなワークロード下で、帯域幅に配慮したスケジューラーが、BAR や HDS といった最先端のスケジューラーを上回るジョブ完了時間性能を示すか?
  • RQ4大規模なデータ処理において、データローカリティとネットワーク帯域幅利用度のトレードオフは何か。そして、その最適化はどのように達成できるか?

主な発見

  • BASSは、すべてのテストワークロードで最も短いジョブ完了時間を達成し、BARと比較して最大18%、HDSと比較して最大19%のマックススパン短縮を実現した。
  • 600MBのWordcountジョブでは、BASSは231秒で完了したが、BAR(259秒)とHDS(269秒)を上回った。これは、データローカリティ比が58.3%(BAR:66.7%、HDS:83.3%)と低いにもかかわらず達成された。
  • 5GBのSortジョブでは、BASSは1572秒で完了したのに対し、BARは1632秒、HDSは1859秒であった。これは、一貫した優位性を示している。
  • 結果から、帯域幅の可用性がデータローカリティのパフォーマンス影響を上回ることが明らかになった。CPUが制限されているローカルノードでは、十分な帯域幅を備えたリモート実行がより速い完了時間をもたらす。
  • BASSは、CPU集約的(Wordcount)およびI/O集約的(Sort)な多様なワークロードにおいても高いパフォーマンスを維持し、その適応性を証明した。
  • 本研究は、リアルタイムの帯域幅監視と制御にSDNを統合することで、ビッグデータスケジューリングにおける新しいパラダイムを確立できることを確認した。BASSは、Hadoopにおいてこの能力を完全に活用した最初のスケジューラーである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。