Skip to main content
QUICK REVIEW

[論文レビュー] Phoenix Cloud: Consolidating Different Computing Loads on Shared Cluster System for Large Organization

Jianfeng Zhan, Lei Wang|arXiv (Cornell University)|Jun 7, 2009
Cloud Computing and Resource Management参考文献 8被引用数 12
ひとこと要約

Phoenix Cloudは、協働リソースプロビジョニングポリシーを用いて、異種のHPCおよびWebサービスワークロードを共有クラスタに統合する階層型クラウド管理システムを提案する。これにより、インfra構成規模を最大23%削減しつつ、科学的計算のスループットを向上させ、動的変動するWebワークロードに十分なリソースを確保できる。

ABSTRACT

Different departments of a large organization often run dedicated cluster systems for different computing loads, like HPC (high performance computing) jobs or Web service applications. In this paper, we have designed and implemented a cloud management system software Phoenix Cloud to consolidate heterogeneous workloads from different departments affiliated to the same organization on the shared cluster system. We have also proposed cooperative resource provisioning and management policies for a large organization and its affiliated departments, running HPC jobs and Web service applications, to share the consolidated cluster system. The experiments show that in comparison with the case that each department operates its dedicated cluster system, Phoenix Cloud significantly decreases the scale of the required cluster system for a large organization, improves the benefit of the scientific computing department, and at the same time provisions enough resources to the other department running Web services with varying loads.

研究の動機と目的

  • 大規模組織におけるHPCおよびWebサービスのための別々のクラスタシステムの運用における非効率性と高い管理コストを解消すること。
  • 異種のワークロードを共有インfraストラクチャに統合することで、必要なクラスタ規模全体を削減すること。
  • 変動が激しいワークロードを示すWebサービスに十分なリソースプロビジョニングを確保しつつ、HPCジョブのリソース利用効率を向上させること。
  • 部門間での協働リソース共有を可能にするクラウド管理システムを設計し、サービス品質を損なわないようにすること。
  • 科学的計算とWebサービスワークロードの両方を統合されたプラットフォーム上で効果的にサポートする階層型アーキテクチャを設計すること。

提案手法

  • 共有インフラストラクチャに共通のサービスフレームワークを備えた3層アーキテクチャを実装:共通サービスフレームワーク、部門固有のクラウド管理サービス(HPCおよびWeb)、クライアントツール。
  • 共通のサービスフレームワークを用いてリソース管理をアプリケーション固有の論理から分離し、モジュラーかつ拡張性のあるシステム設計を実現する。
  • HPCスケジューラにおいて、ジョブの提出パターンに基づいて効率的にリソースを割り当てるため、ファーストフィットスケジューリングポリシーを適用する。
  • 実世界のトレースデータを用いてWebサービスの動的リソース要件をシミュレートし、リソースシミュレータがリソースの割り当ておよび解放を制御する。
  • シミュレーションを100倍高速化することで、2週間分のワークロードを3時間未満で完了し、実際のリソース消費と同等の忠実度を維持する。
  • 静的(専用クラスタ)と動的(統合済み)構成を比較し、さまざまなクラスタサイズにおけるパフォーマンスとリソース利用効率を評価する。

実験結果

リサーチクエスチョン

  • RQ1異なるリソース要件と利用パターンを示すHPCおよびWebサービスワークロードを、共有クラスタインフラストラクチャに効果的に統合できるか?
  • RQ2部門間での協働リソースプロビジョニングが、全体のシステム効率とリソース利用効率に与える影響は何か?
  • RQ3ワークロードを統合した場合、HPCジョブの完了率を維持または向上させるために必要な最小クラスタサイズは何か?
  • RQ4Webサービスのピーク負荷時における可用性を低下させることなく、リソース共有によって全体のインfra構成スケールをどの程度削減できるか?
  • RQ5動的統合構成と静的専用クラスタ構成とを比較した場合、ターンアラウンド時間とジョブ完了率はどのように変化するか?

主な発見

  • Phoenix Cloudは、専用クラスタ構成と比較して、必要となるクラスタ規模を最大23%削減する。160ノードの動的構成は、静的構成の76.9%の規模に相当する。
  • 160ノードのクラスタサイズでも、静的構成よりもHPCジョブの完了数が高く維持されており、リソース利用効率とスループットの向上が裏付けられる。
  • 動的構成では静的構成よりも1ジョブあたりの平均ターンアラウンド時間が短く保たれており、応答性の向上が示されている。
  • クラスタサイズが小さくなるにつれてHPCジョブのキル数が増加するが、170ノードの地点でわずかな異常が観察される以外は、リソース割り当ての安定性に閾値効果が見られる。
  • 実世界のトレースデータに基づくシミュレーションにより、Webサービスワークロードは変動する負荷下でも一貫したパフォーマンスとリソースプロビジョニングを維持しており、信頼性が確保されている。
  • 本システムは競合するワークロードを効果的にバランスさせ、科学的計算の恩恵を高める一方で、動的Webサービスに十分なリソースを確保している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。