[論文レビュー] Contention-Aware GPU Partitioning and Task-to-Partition Allocation for Real-Time Workloads
本稿では、メモリ集約的およびコンピューティング集約的なタスクを1つのパーティションにグループ化することで、リアルタイムカーネル間の干渉を低減する、コンテンツションに配慮したGPUパーティショニングおよびタスク-パーティション割り当てヒューリスティクスを提案する。このアプローチは、非パーティショニング型GPU実行に比べてスケジューラビリティと効率性を向上させ、最大25パーティション(各パーティションに2タスク)を達成し、リソース競合下のリアルタイムワークロードスケジューリングにおいてベースライン手法を上回る性能を発揮する。
In order to satisfy timing constraints, modern real-time applications require massively parallel accelerators such as General Purpose Graphic Processing Units (GPGPUs). Generation after generation, the number of computing clusters made available in novel GPU architectures is steadily increasing, hence, investigating suitable scheduling approaches is now mandatory. Such scheduling approaches are related to mapping different and concurrent compute kernels within the GPU computing clusters, hence grouping GPU computing clusters into schedulable partitions. In this paper we propose novel techniques to define GPU partitions; this allows us to define suitable task-to-partition allocation mechanisms in which tasks are GPU compute kernels featuring different timing requirements. Such mechanisms will take into account the interference that GPU kernels experience when running in overlapping time windows. Hence, an effective and simple way to quantify the magnitude of such interference is also presented. We demonstrate the efficiency of the proposed approaches against the classical techniques that considered the GPU as a single, non-partitionable resource.
研究の動機と目的
- 共有SMおよびメモリ上で重複するカーネル実行によるリソース競合と予測不可能性の問題に対処する。
- タスクの特性に基づいてGPUリソースを隔離されたスケジューラブルなユニットにパーティショニングすることで、GPUの利用効率とタイミングの予測可能性を向上させる。
- 共存するカーネル間の干渉を最小限に抑えるためのヒューリスティクスに基づくタスク-パーティション割り当て戦略を開発する。
- 非パーティショニング型GPU実行および古典的スケジューリング手法と比較して、リアルタイムシステムにおける優位性を実証する。
- 実用的導入を可能にするために、NVIDIA MIG や AMD CUマスキングなどの既存GPUフレームワークとの統合を可能にする。
提案手法
- カーネルの実行時間とリソース要件に基づいて、Streaming Multiprocessors (SMs) をスケジューラブルなパーティションにグループ化するGPUパーティショニングヒューリスティクスを提案する。
- 同時に実行されるカーネル間の共有メモリおよびコンピューティングリソースからの干渉を定量化するためのコンテンツション指標を導入する。
- 干渉を低減するために、補完的ワークロードをペアにするように設計された2つのタスク割り当てヒューリスティクス(Best Fit (BF) と Smallest Memory Size (SMS))を採用する。
- 禁止ペアリストを用いて、干渉を引き起こす可能性のあるタスクペア(例:2つのメモリ集約的タスク)を同じパーティションに割り当てないよう制御する。
- 合計利用度の評価とパーティショニング実行下でのタイミング制約の保証を可能にする、スケジューラビリティ解析フレームワークを適用する。
- テスト用合成ワークロード(タスク数:50および200、利用度レベル変動あり)を用いて、非パーティショニング型ベースライン(1G)と比較して、アプローチの妥当性を検証する。
実験結果
リサーチクエスチョン
- RQ1メモリ集約的およびコンピューティング集約的タスクを含む、多様な実行時間およびリソース要件を持つリアルタイムカーネル間の干渉を最小限に抑えるために、GPUパーティションをどのように定義できるか?
- RQ2マルチカーネルGPUワークロードにおいて、リソース利用度と干渉低減の両立を最適化するタスク-パーティション割り当て戦略は何か?
- RQ3コンテンツションに配慮したパーティショニングは、非パーティショニング型GPU実行と比較して、どの程度スケジューラビリティを向上させるか?
- RQ4異なるワークロードおよび干渉状況下で、BFとSMSの両ヒューリスティクスはどのように性能を発揮するか?
- RQ5本手法は、NVIDIA MIG や AMD CUマスキングなどの既存GPU仮想化機能と統合可能か?
主な発見
- 提案されたヒューリスティクスは、全テスト利用度レベルでスケジューラビリティ率がほぼ1.0に達し、非パーティショニング型ベースライン(1G)が高利用度下で著しくスケジューラビリティが低いことと比較して顕著に優れている。
- 50タスクをスケジューリングする際の平均パーティション数は約25であり、1パーティションあたり約2タスクであることが示され、干渉低減の目的に合致している。
- Best Fit (BF) ヒューリスティクスは、候補のマージ処理が少ないため、SMS よりも高い効率性と短い解析時間を達成している。
- 200タスクの場合、1パーティションあたりのタスク密度が上昇(平均4つ以上)し、干渉が増加するため、クラスタリング効率が低下し、性能劣化が生じる。
- 解析時間は合計利用度にほとんど依存せず、BFベースの手法は単純な比較論理により、SMSベースの手法よりも高速に処理が可能である。
- 本手法は高いスケーラビリティと頑健性を示し、高リソース競合下でも高いスケジューラビリティを維持しており、リアルタイムGPUワークロードに対して効果的であることが実証された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。