[論文レビュー] Prediction-Based Power Oversubscription in Cloud Platforms
この論文では、機械学習を用いてワークロードのパフォーマンス上の重要度を分類し、95パーセンタイルCPU使用率を予測することで、予測に基づくパワーオーバーサブスクリプションフレームワークを、パubリッククラウドプラットフォームに提案している。このフレームワークにより、VMの知的配置と各VMのパワーキャップ制御を実施することで、重要なワークロードへの影響を最小限に抑えながら、最大2倍のオーバーサブスクリプションを実現する。
Datacenter designers rely on conservative estimates of IT equipment power draw to provision resources. This leaves resources underutilized and requires more datacenters to be built. Prior work has used power capping to shave the rare power peaks and add more servers to the datacenter, thereby oversubscribing its resources and lowering capital costs. This works well when the workloads and their server placements are known. Unfortunately, these factors are unknown in public clouds, forcing providers to limit the oversubscription so that performance is never impacted. In this paper, we argue that providers can use predictions of workload performance criticality and virtual machine (VM) resource utilization to increase oversubscription. This poses many challenges, such as identifying the performance-critical workloads from black-box VMs, creating support for criticality-aware power management, and increasing oversubscription while limiting the impact of capping. We address these challenges for the hardware and software infrastructures of Microsoft Azure. The results show that we enable a 2x increase in oversubscription with minimum impact to critical workloads.
研究の動機と目的
- ピークパワードロップに基づく保守的なプロビジョニングに起因するデータセンターパワー容量の未利用を是正すること。
- ワークロードの種別と配置が不明で動的であるため、従来のパワーキャッピングの限界を克服すること。
- 非重要ワークロードではキャッピングに耐えるが、パフォーマンス上の重要ワークロードを識別・保護することで、知的かつスマートにパワーオーバーサブスクリプションを可能にすること。
- VMの詳細なインスペクションを必要とせず、予測をVMの配置とパワーキャッピング意思決定に統合できるスケーラブルかつ生産環境対応のシステムを開発すること。
- 重要なワークロードへのキャッピングのパフォーマンス影響を最小限に抑えながら、クラウドインfraのパワーエフェクティビティとコスト削減を最大化すること。
提案手法
- ブラックボックスVMからの日周波パターンを示す利用状況パターンを検出するためのパターンマッチングアルゴリズムを設計する。
- パターンマッチングアルゴリズムの出力をもとに、VMのライフタイムにわたるワークロードの重要度と95パーセンタイルCPU使用率を予測する機械学習モデルをトレーニングする。
- サーバーとラック全体でパワードロップとキャッピングの余裕をバランスさせる、重要度および利用状況に配慮したVM配置ポリシーを実装する。
- フィードバックと予測を活用して、重要ワークロードを保護するように選択的にスロットリングを適用する、各VMのパワーキャップコントローラーを開発する。
- 生産環境での利用を想定し、Microsoft AzureのMLおよび予測サービングインfraに予測と制御スタックを統合する。
- キャッピングの影響を重要および非重要ワークロードの両方の事前定義されたしきい値に抑えるように、オーバーサブスクリプションレベルの選択戦略を設計する。
実験結果
リサーチクエスチョン
- RQ1アプリケーションレベルのインストルメンテーションなしで、ブラックボックスVMにおけるワークロードの重要度と高パーセンタイルCPU使用率を機械学習モデルが正確に予測できるか?
- RQ2パフォーマンスに影響を与えることなく、パブリッククラウドプラットフォームで予測を活用してより高いパワーオーバーサブスクリプションを実現する方法は何か?
- RQ3予測された重要度に基づく各VMのパワーキャッピングを適用する際、オーバーサブスクリプションの利得とキャッピングの影響の最適なトレードオフは何か?
- RQ4各VMのパワーキャッピングと知的VM配置を、Microsoft Azureのような生産環境クラウドインfraにどのように統合できるか?
- RQ5予測に基づく技術は、サービスレベルの保証を維持しながら、過剰プロビジョニングの必要性をどの程度まで低減できるか?
主な発見
- 提案されたシステムにより、従来の保守的なプロビジョニング手法と比較して、パワーオーバーサブスクリプションが2倍に向上した。
- ワークロードの重要度予測のための機械学習モデルは、従来のFFTベースの手法よりも高い精度と頑健性を達成した。
- 95パーセンタイルCPU使用率の予測により、パワーバジェットの超過を事前に予測し、より効果的なキャッピング意思決定が可能になった。
- 重要度に配慮したVM配置ポリシーにより、非重要ワークロードを戦略的に分離することで、キャッピングイベントの発生回数と影響が削減された。
- 高いパワーパレッッジ下でも、重要なワークロードへのパフォーマンスへの影響を最小限に抑え、事前定義されたサービスレベル目標を満たした。
- このアプローチは生産環境で利用可能であり、MLサービングやファームウェアレベルのパワーカントロールを含む既存のAzureインfraとシームレスに統合された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。