Skip to main content
QUICK REVIEW

[論文レビュー] MuxFlow: Efficient and Safe GPU Sharing in Large-Scale Production Deep Learning Clusters

Yihao Zhao, Xin Liu|arXiv (Cornell University)|Mar 24, 2023
Brain Tumor Detection and ClassificationNeuroscience被引用数 3
ひとこと要約

MuxFlow は、混合オンラインおよびオフラインのディープラーニングワークロードにおける効率的かつ安全な GPU の空間共有を可能にするプロダクション対応の GPU クラスターシステムです。二段階のパフォーマンス保護メカニズム、混合エラー処理戦略、およびマッチングベースのスケジューリングによる動的 SM 分配を組み合わせることで、CompanyX の 20,000 枚以上の GPU を有するクラスタで実稼働環境において GPU 利用率を 26% から 76% まで向上させました。

ABSTRACT

Large-scale GPU clusters are widely-used to speed up both latency-critical (online) and best-effort (offline) deep learning (DL) workloads. However, most DL clusters either dedicate each GPU to one workload or share workloads in time, leading to very low GPU resource utilization. We present MuxFlow, the first production cluster system that supports efficient and safe space-sharing for DL workloads. NVIDIA MPS provides an opportunity to share multiple workloads in space on widely-deployed NVIDIA GPUs, but it cannot guarantee the performance and safety of online workloads. MuxFlow introduces a two-level protection mechanism for memory and computation to guarantee the performance of online workloads. Based on our practical error analysis, we design a mixed error-handling mechanism to guarantee the safety of online workloads. MuxFlow further proposes dynamic streaming multiprocessor (SM) allocation and matching-based scheduling to improve the efficiency of offline workloads. MuxFlow has been deployed at CompanyX's clusters with more than 20,000 GPUs. The deployment results indicate that MuxFlow substantially improves the GPU utilization from 26$\%$ to 76$\%$, SM activity from 16$\%$ to 33$\%$, and GPU memory from 42$\%$ to 48$\%$.

研究の動機と目的

  • 大規模なディープラーニングクラスタにおける GPU 利用率の低さに起因する、GPU が単一のワークロードに専有されたり、時間共有されたりする状況を是正すること。
  • NVIDIA MPS を通じて GPU の空間共有を可能にすると同時に、低遅延を要するオンラインワークロードのパフォーマンス隔離を保証すること。
  • 特に Kubernetes 環境におけるコンテナのシグナル(SIGINT や SIGTERM)によるエラー伝搬を低減することで、オンラインワークロードの安全性を確保すること。
  • 動的ストリーミングマルチプロセッサ(SM)割り当てと双方向マッチングによる知能的なワークロードペアリングによって、オフラインワークロードの効率を向上させること。
  • 実世界のクラスタでパフォーマンス、安全性、利用率のバランスを取れる実用的でプロダクショングレードのシステムを構築すること。

提案手法

  • オフラインワークロードのリソース消費を制限するために、GPU メモリおよびカーネル起動頻度にワークロード単位の制限を課す xCUDA というランタイムメカニズムを導入。
  • GPU レベルの SysMonitor を採用し、多次元メトリクスを用いてパフォーマンス劣化のリスクを検出。必要に応じてオフラインワークロードの排出をトリガー。
  • SIGINT/SIGTERM シグナル(99% の伝搬エラーの原因)を遮断し、正常に処理する混合エラー処理メカニズムを設計。また、例外的なエラーに対して CUDA コンテキストをリセット。
  • オフラインワークロードが使用する SM パcentage をオンラインワークロードに応じて補完的に調整する動的 SM 分配を提案。パフォーマンスへの影響を最小限に抑える。
  • オフラインワークロードのペアリングを最大重み付き二部マッチング問題としてモデル化。干渉を推定する深層学習ベースの予測器と、KM アルゴリズムを用いて最適ペアリングを特定。
  • すべてのモジュールを統合したスタックフルクラスターシステムを構築。CompanyX で実稼働環境に導入。既存インfra に最小限の変更で数千枚の GPU をサポート。

実験結果

リサーチクエスチョン

  • RQ1低遅延のオンラインワークロードのパフォーマンスを損なうことなく、大規模なプロダクション環境におけるディープラーニングクラスタで GPU の空間共有を安全かつ効率的に実現する方法は何か?
  • RQ2共有 GPU 環境において、オフラインワークロードからオンラインワークロードへのエラー伝搬を効果的に防止するメカニズムは何か?
  • RQ3動的 SM 分配は、オンラインワークロードのパフォーマンスを十分に維持しつつ、GPU リソースの利用効率をどのように向上させられるか?
  • RQ4共有 GPU クラスタにおいて、全体の効率を最大化するためのオフラインワークロードとオンラインワークロードの最適なペアリング戦略は何か?
  • RQ5NVIDIA MPS などの既存の GPU 虚擬化プリミティブを用いて、空間共有、パフォーマンス隔離、安全性の保証を統合した実用的でプロダクション対応のシステムを構築できるか?

主な発見

  • MuxFlow は、20,000 枚以上の GPU を有するプロダクションクラスタで、GPU 利用率を 26% から 76% まで向上させ、リソース効率を顕著に改善しました。
  • SM のアクティビティは 16% から 33% に上昇し、共有ワークロード下でも GPU コンピューティングユニットの利用が向上していることが示されました。
  • GPU メモリ利用率は 42% から 48% に向上し、混合ワークロード間での効果的なメモリ管理が実現したことが確認されました。
  • 混合エラー処理メカニズムにより、99% の伝搬エラー(主にコンテナ終了時の SIGINT/SIGTERM シグナルによるもの)が正常に抑制されました。
  • DL ベースの干渉予測を用いたマッチングベースのスケジューリングにより、高いワークロードペアリング効率が達成され、オンラインワークロードのパフォーマンス劣化が最小限に抑えられました。
  • 動的 SM 分配により、オンラインとオフラインワークロードのリソース使用が補完的に行われ、オンラインの遅延にほとんど影響を与えることなく、オフラインタスクが空いている GPU 容量を活用できました。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。