Skip to main content
QUICK REVIEW

[論文レビュー] MGG: Accelerating Graph Neural Networks with Fine-grained intra-kernel Communication-Computation Pipelining on Multi-GPU Platforms

Yuke Wang, Boyuan Feng|arXiv (Cornell University)|Sep 14, 2022
Advanced Graph Neural Networks被引用数 7
ひとこと要約

MGGは、GNNに特化したパイプライン構築法とGPUに配慮したマッピングを活用して、通信と計算を重ねる細粒度なキーネル内通信-計算パイプライン化システムを提案する。これにより、ROCなどの最先端システムと比較して最大10.83倍の高速化を達成し、パイプライン構成の動的最適化とGPU間通信のボトル neck を低減することで、フルグラフGNN推論を顕著に高速化する。

ABSTRACT

The increasing size of input graphs for graph neural networks (GNNs) highlights the demand for using multi-GPU platforms. However, existing multi-GPU GNN systems optimize the computation and communication individually based on the conventional practice of scaling dense DNNs. For irregularly sparse and fine-grained GNN workloads, such solutions miss the opportunity to jointly schedule/optimize the computation and communication operations for high-performance delivery. To this end, we propose MGG, a novel system design to accelerate full-graph GNNs on multi-GPU platforms. The core of MGG is its novel dynamic software pipeline to facilitate fine-grained computation-communication overlapping within a GPU kernel. Specifically, MGG introduces GNN-tailored pipeline construction and GPU-aware pipeline mapping to facilitate workload balancing and operation overlapping. MGG also incorporates an intelligent runtime design with analytical modeling and optimization heuristics to dynamically improve the execution performance. Extensive evaluation reveals that MGG outperforms state-of-the-art full-graph GNN systems across various settings: on average 4.41X, 4.81X, and 10.83X faster than DGL, MGG-UVM, and ROC, respectively.

研究の動機と目的

  • 不規則でスパースかつ細粒度なGPU間通信に起因するマルチGPU GNNの性能ボトル neck を解消すること。
  • 計算と通信を別々に最適化する従来のシステムの限界を克服し、共同スケジューリングの機会を逃さないこと。
  • GPUキーネル内での通信と計算の動的重ね合わせを可能にすることで、高性能なGNN実行を実現すること。
  • 知的ランタイム最適化を通じて、多様なGNNワークロードとGPUハードウェア構成に適応可能なシステムを設計すること。
  • 効率的で低オーバーヘッドの通信プリミティブを活用することで、GNNにとどまらず他のディープラーニングワークロードへも一般化可能なアプローチを構築すること。

提案手法

  • MGGは、GPUキーネル内での通信と計算の細粒度な重ね合わせを可能にする動的ソフトウェアパイプラインを導入する。
  • データアクセスパターンに基づいて、粗粒度なGNN演算を細粒度で重複する段階に分解するGNNに特化したパイプライン構築法を採用する。
  • GPUに配慮したパイプラインマッピングを用いて、GPUの占有率を最大化し、遅延を最小化するための最適なスレッド、ワープ、ブロック構成を選択する。
  • NVSHMEMベースの通信プリミティブを統合し、GPU間で低遅延かつ細粒度なリモートメモリアクセスを実現する。
  • 解析的モデリングと最適化ヒューリスティクスを用いた知的ランタイムエンジンが、インタリーブ距離やワープ-ブロックマッピングなどのパイプラインパラメータを動的にチューニングする。
  • 通信とワークロードのパターンに応じて、局所性指向、ワークロード指向、学習ベースのパーティショニング戦略を柔軟に適応可能にし、複数のグラフパーティショニング戦略をサポートする。

実験結果

リサーチクエスチョン

  • RQ1不規則でスパースなGNNワークロードにおいて、通信と計算を効果的に重ねる細粒度なキーネル内パイプライン化をどのように構築できるか?
  • RQ2マルチGPUプラットフォームにおけるGNNのパフォーマンスを最大化するための最適なパイプライン構成とGPUマッピング戦略は何か?
  • RQ3システムは、変動するグラフ構造とハードウェア構成にどのように動的に適応し、高いパフォーマンスを維持できるか?
  • RQ4パイプラインパラメータの知的ランタイムチューニングによって、通信オーバーヘッドをどの程度低減できるか?
  • RQ5提案されたパイプライン化アプローチは、GNNにとどまらず、他のディープラーニングワークロードへも一般化可能か?

主な発見

  • MGGは、さまざまなGNNワークロードにおいて、DGLに対して平均4.41倍、MGG-UVMに対して4.81倍、ROCに対して最大10.83倍の高速化を達成した。
  • Criteo Kaggleデータセットでは、DLRMにおける埋め込み照会時間を315.27msから119.66msに短縮し、2.64倍の改善を実現した。
  • NCCLに依存せず、GPUが主導する細粒度なリモートメモリアクセスを活用することで、不要なGPU間トラフィックを効果的に削減した。
  • 解析的モデリングによるランタイム最適化により、ワークロードとハードウェア特性に応じた動的適応が可能となり、パイプライン効率が向上した。
  • DLMRへの成功した統合を通じて、他のDLワークロードに対しても一般化がうまくいくことが実証された。
  • NVSHMEMプリミティブの使用により、低遅延かつスケーラブルな通信が実現され、複数GPU間での効率的なパイプライン化を支援した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。