Skip to main content
QUICK REVIEW

[論文レビュー] A Data-Driven Approach to Dynamically Adjust Resource Allocation for Compute Clusters

Francesco Pace, Dimitrios Milios|ArXiv.org|Jul 1, 2018
Cloud Computing and Resource Management参考文献 30被引用数 4
ひとこと要約

本論文は、ガウス過程回帰を用いてアプリケーションのリソース利用状況を予測し、リアルタイムで割り当てを調整することで、リソースの余剰を削減するデータ駆動型で動的資源割り当てメカニズムを提案する。予測の不確実性と懐疑的プリエンプションポリシーを組み込むことで、アプリケーションの障害を引き起こさずに平均ターンアラウンドタイムを50%以上短縮し、リソースの余剰を約40%削減する。これにより、クラスタの効率性と応答性が顕著に向上する。

ABSTRACT

Nowadays, data-centers are largely under-utilized because resource allocation is based on reservation mechanisms which ignore actual resource utilization. Indeed, it is common to reserve resources for peak demand, which may occur only for a small portion of the application life time. As a consequence, cluster resources often go under-utilized. In this work, we propose a mechanism that improves cluster utilization, thus decreasing the average turnaround time, while preventing application failures due to contention in accessing finite resources such as RAM. Our approach monitors resource utilization and employs a data-driven approach to resource demand forecasting, featuring quantification of uncertainty in the predictions. Using demand forecast and its confidence, our mechanism modulates cluster resources assigned to running applications, and reduces the turnaround time by more than one order of magnitude while keeping application failures under control. Thus, tenants enjoy a responsive system and providers benefit from an efficient cluster utilization.

研究の動機と目的

  • クラウドクラスタにおける静的でリザーブドベースの割り当てが原因で広く見られるデータセンターリソースの低利用状況を是正すること。
  • リソースの余剰(割り当て済みと実利用量の差)を、アプリケーションの障害リスクを増加させることなく削減すること。
  • リアルタイムでの需要予測に基づいてリソース割り当てを動的に調整することで、システムの応答性とクラスタの利用効率を向上させること。
  • 予測の不確実性とシステムの安全性のバランスを取るメカニズムを設計し、RAMなどの共有不可リソースが不足する原因となる障害を回避すること。
  • Apache SparkおよびTensorFlowアプリケーションの代表的ワークロードを用いた実際のテストベッドで、このアプローチを検証すること。

提案手法

  • 時間的変動と不確実性を捉えるために、アプリケーションのリソース利用状況(CPU、RAM)を予測するためのガウス過程(GP)回帰を用いる。
  • 予測の信頼区間を活用して割り当て調整をガイドし、不足供給のリスクを回避するための安全余裕を確保する。
  • 安全である場合にのみリソースを再割り当てする懐疑的プリエンプションポリシーを採用し、動的調整中の障害リスクを最小限に抑える。
  • クラスタノード全体のリアルタイムリソース使用状況を監視し、アプリケーションの挙動と照合することで、予測モデルのトレーニングと更新を実施する。
  • 制御された実験で静的リザーブドベースの割り当てと動的形状化を比較するために、FIFOスケジューラと統合する。
  • 10台のサーバーと実際のワークロード(SparkおよびTensorFlow)を用いたテストベッドを構築し、現実的な条件下での性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1共有クラスタにおける安全な動的割り当てを可能にするために、リソース利用状況の予測をどれほど正確かつ不確実性を考慮したものにすることができるか?
  • RQ2静的リザーブドベースの割り当てと比較して、動的リソース調整がクラスタのターンアラウンドタイムとリソースの余剰に与える影響は何か?
  • RQ3予測誤差をどのように軽減すれば、RAMのような共有不可リソースのためのアプリケーション障害を防げるか?
  • RQ4動的割り当てシステムにおいて、応答性と信頼性の両立を最もよく果たすプリエンプション戦略は何か?
  • RQ5動的割り当ては、障害率を増加させることなく、どの程度クラスタの利用効率を向上させることができるか?

主な発見

  • 動的割り当てメカニズムは、ベースラインの静的リザーブドシステムと比較して、リソースの余剰を約40%削減した。
  • アプリケーションの中央値ターンアラウンドタイムは、キューイング時間が短くなったことにより約50%短縮された。
  • 懐疑的プリエンプションポリシーを採用した場合、高負荷下でもすべての実験でアプリケーションまたはコンponentの障害がゼロであった。
  • 不確実性を考慮した予測により、安全かつ積極的なリソース調整が可能となり、余剰容量を最小限に抑えつつ信頼性を損なわずに済んだ。
  • 特に弾力的かつ剛性のあるアプリケーションが混在するワークロードの処理において、システムの応答性と効率性が顕著に向上した。
  • 実際のテストベッドと実際のワークロードを用いた検証により、提案手法のスケーラビリティと頑健性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。