Skip to main content
QUICK REVIEW

[論文レビュー] GNNAdvisor: An Efficient Runtime System for GNN Acceleration on GPUs.

Yuke Wang, Boyuan Feng|arXiv (Cornell University)|Jun 11, 2020
Advanced Graph Neural Networks被引用数 16
ひとこと要約

GNNAvisor は、コミュニティなどのグラフ構造的インサイトを活用し、グループベースのワークロード管理と GPU メモリ階層の最適化を実施することで、グラフニューラルネットワーク(GNNs)の実行を高速化する GPU ランタイムシステムである。GunRock などの最先端のフレームワークと比較して最大 52.16x の高速化を達成しており、モデル化と推定戦略により、多様な GNN アーキテクチャとデータセットにおける自動パフォーマンスチューニングを可能にしている。

ABSTRACT

As the emerging trend of the graph-based deep learning, Graph Neural Networks (GNNs) recently attract a significant amount of research attention from various domains. However, existing GNN implementations fail to catch up with the evolving GNN architectures, ever-increasing graph size, and node embedding dimensionality, thus, suffering from an unsatisfied performance. To break this hurdle, we propose GNNAdvisor, an efficient runtime system to systematically accelerate GNN applications on GPUs. First, GNNAdvisor spots the graph structure information (e.g., graph community) as a new driving force to facilitate GNN acceleration. Besides, GNNAdvisor implements a novel yet highly-efficient group-based workload management tailored for GNN computation to improve the thread-level performance on GPUs. GNNAdvisor further capitalizes on the GPU memory hierarchy for acceleration by gracefully coordinating the execution of GNNs according to the characteristics of the GPU memory structure. Moreover, GNNAdvisor incorporates a Modeling & Estimating strategy to offer sufficient flexibility for automatic performance tunning across various GNN architectures and input datasets. Extensive experiments show that GNNAdvisor provides an average of 3.02x, 4.36x, and 52.16x speedup over the state-of-the-art GNN execution frameworks, Deep Graph Library (DGL), NeuGraph, and GunRock, respectively.

研究の動機と目的

  • 進化を続ける GNN アーキテクチャ、より大きなグラフ、および高い埋め込み次元数に対応できない既存の GNN フレームワークにおけるパフォーマンスボトルネックを解消すること。
  • グラフコミュニティなどのグラフ固有の構造的性質を、GPU 上での GNN 高速化の新たな最適化ベクトルとして活用すること。
  • GPU アーキテクチャにおけるスレッドレベルのパフォーマンスを向上させるため、グループベースのワークロード管理戦略を設計すること。
  • GNN の実行パターンをメモリアクセス特性と一致させることで、GPU メモリ階層の利用を最適化すること。
  • モデル化と推定戦略を用いて、多様な GNN モデルとデータセットにおける自動パフォーマンスチューニングを可能にすること。

提案手法

  • ワークロードのパーティショニングとスケジューリング意思決定を支援するため、グラフコミュニティおよびその他の構造的特徴を特定する。
  • GPU のオカッパイとスレッドレベルの並列性を向上させるグループベースのワークロード管理モデルを実装する。
  • GNN の計算と GPU メモリ階層(例えば、共有メモリ、グローバルメモリ)を調整して、遅延を最小限に抑え、帯域幅の利用を最大化する。
  • さまざまな構成下でのパフォーマンスを予測するモデル化と推定フレームワークを導入し、自動チューニングを可能にする。
  • 入力グラフの特性と GNN アーキテクチャに応じて動的に適応可能な統合されたランタイムシステムにすべてのモジュールを統合する。
  • プロファイリングと推定技術を用いて、手動チューニングを必要とせずに構成選択をガイドする。

実験結果

リサーチクエスチョン

  • RQ1コミュニティなどのグラフ構造情報は、GPU 上での GNN 実行パフォーマンス向上に有効に活用できるか?
  • RQ2グループベースのワークロード管理戦略は、GNN ワークロードにおけるスレッドレベルの並列性と GPU 利用率をどのように向上させることができるか?
  • RQ3GPU メモリ階層の最適化は、GNN 推論および学習におけるメモリボトルネックをどの程度軽減できるか?
  • RQ4モデル化と推定戦略により、多様な GNN アーキテクチャとデータセットにおける自動パフォーマンスチューニングは可能か?
  • RQ5包括的かつ構造に配慮した GNN ランタイムシステムは、既存のフレームワークと比較してどの程度のパフォーマンス向上を達成できるか?

主な発見

  • GNNAvisor は、多様な GNN ワークロードにおいて、Deep Graph Library (DGL) より平均 3.02x の高速化を達成した。
  • NeuGraph よりも平均 4.36x の高速化を達成しており、多様な GNN アーキテクチャにおける優れた最適化を示している。
  • GunRock よりも驚異的な平均 52.16x の高速化を達成しており、メモリおよびスレッド最適化におけるその有効性が顕著に表れている。
  • モデル化と推定戦略により、最小限の手動設定で自動パフォーマンスチューニングが可能となり、デプロイの柔軟性が向上した。
  • グラフ構造への配慮と GPU メモリに配慮したスケジューリングの統合により、実行時間が著しく短縮され、リソース利用率が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。