Skip to main content
QUICK REVIEW

[論文レビュー] DistGNN: Scalable Distributed Training for Large-Scale Graph Neural Networks.

Vasimuddin, Sanchit Misra|arXiv (Cornell University)|Apr 14, 2021
Advanced Graph Neural Networks参考文献 34被引用数 13
ひとこと要約

DistGNNは、共有メモリ効率、最小頂点カットによるグラフ分割、遅れ更新アルゴリズムを用いてDGLを最適化することで、CPUクラスタ上で大規模なグラフニューラルネットワーク(GNN)のスケーラブルな分散学習フレームワークを提案する。128 CPUソケットを用いることで、単一ソケットCPU学習におけるベースラインDGLと比較して最大97倍の高速化を達成する。

ABSTRACT

Full-batch training on Graph Neural Networks (GNN) to learn the structure of large graphs is a critical problem that needs to scale to hundreds of compute nodes to be feasible. It is challenging due to large memory capacity and bandwidth requirements on a single compute node and high communication volumes across multiple nodes. In this paper, we present DistGNN that optimizes the well-known Deep Graph Library (DGL) for full-batch training on CPU clusters via an efficient shared memory implementation, communication reduction using a minimum vertex-cut graph partitioning algorithm and communication avoidance using a family of delayed-update algorithms. Our results on four common GNN benchmark datasets: Reddit, OGB-Products, OGB-Papers and Proteins, show up to 3.7x speed-up using a single CPU socket and up to 97x speed-up using 128 CPU sockets, respectively, over baseline DGL implementations running on a single CPU socket

研究の動機と目的

  • 大規模なグラフにおける分散CPUクラスタ上でのフルバッチGNN学習のスケーラビリティ課題に対処すること。
  • 単一ノードにおけるメモリおよび帯域幅のボトルネックを低減し、分散環境におけるノード間通信を最小限に抑えること。
  • 共有メモリと通信に配慮した技術を用いて、CPUクラスタ上で効率的なフルバッチ学習を実現するDGLの最適化を行うこと。
  • 数百のコンピューティングノードにスケーリングすることで、巨大グラフ上のGNNの実行可能な学習を可能にすること。

提案手法

  • 個々のノードにおけるメモリ圧力を軽減するための効率的な共有メモリ実装を採用すること。
  • ノード間通信量を最小限に抑えるために、最小頂点カットによるグラフ分割アルゴリズムを適用すること。
  • ノード間の冗長な通信を回避するための遅れ更新アルゴリズムのファミリーを導入すること。
  • 通信削減および通信回避戦略を統合することで、DGLフレームワークの分散学習を最適化すること。
  • モデルの精度を維持しながら、大幅に高速化された学習スループットを実現する分散学習パイプラインを設計すること。

実験結果

リサーチクエスチョン

  • RQ1フルバッチGNN学習を、何百ものCPUノードにわたってどのように効率的にスケーリングできるか?
  • RQ2分散GNN学習において通信量を最小限に抑えるためにどのようなグラフ分割戦略が効果的か?
  • RQ3遅れ更新による通信回避は、学習パフォーマンスにどの程度の向上効果をもたらすか?
  • RQ4提案されたフレームワークは、ベースラインDGL実装と比較して、どの程度のスループット向上とスケーラビリティを達成するか?

主な発見

  • 単一CPUソケットを用いる場合、DistGNNはベースラインDGLに対して最大3.7倍の高速化を達成する。
  • 128 CPUソケットを用いる場合、DistGNNは単一ソケットベースラインDGL学習と比較して最大97倍の高速化を達成する。
  • 最小頂点カットによるグラフ分割アルゴリズムは、分散GNN学習におけるノード間通信量を効果的に低減する。
  • 遅れ更新による通信回避技術は、ノード間の通信オーバーヘッドを顕著に低減する。
  • フレームワークは、大規模グラフにおけるスケーラブルなフルバッチ学習を可能にしつつ、モデルのパフォーマンスを維持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。