Skip to main content
QUICK REVIEW

[論文レビュー] EnGN: A High-Throughput and Energy-Efficient Accelerator for Large Graph Neural Networks

Shengwen Liang, Ying Wang|arXiv (Cornell University)|Aug 31, 2019
Advanced Graph Neural Networks参考文献 41被引用数 9
ひとこと要約

EnGN は、新しいリングエッジリダクション(RER)データフローと再構成可能な PE アレイアーキテクチャを導入することで、大規模なグラフニューラルネットワーク(GNN)の高スループットかつ高エネルギー効率な推論を実現する専用ハードウェアアクセラレータです。CPU に対して最大 1802.9X の高速化と 1326.35X のエネルギー効率の向上を達成しており、最先端の GCN アクセラレータ HyGCN よりも 2.97X の高速化と 6.2X の低いエネルギー消費量を実現しています。

ABSTRACT

Graph neural networks (GNNs) emerge as a powerful approach to process non-euclidean data structures and have been proved powerful in various application domains such as social networks and e-commerce. While such graph data maintained in real-world systems can be extremely large and sparse, thus employing GNNs to deal with them requires substantial computational and memory overhead, which induces considerable energy and resource cost on CPUs and GPUs. In this work, we present a specialized accelerator architecture, EnGN, to enable high-throughput and energy-efficient processing of large-scale GNNs. The proposed EnGN is designed to accelerate the three key stages of GNN propagation, which is abstracted as common computing patterns shared by typical GNNs. To support the key stages simultaneously, we propose the ring-edge-reduce(RER) dataflow that tames the poor locality of sparsely-and-randomly connected vertices, and the RER PE-array to practice RER dataflow. In addition, we utilize a graph tiling strategy to fit large graphs into EnGN and make good use of the hierarchical on-chip buffers through adaptive computation reordering and tile scheduling. Overall, EnGN achieves performance speedup by 1802.9X, 19.75X, and 2.97X and energy efficiency by 1326.35X, 304.43X, and 6.2X on average compared to CPU, GPU, and a state-of-the-art GCN accelerator HyGCN, respectively.

研究の動機と目的

  • CPU や GPU で大規模かつスパースな実世界のグラフを GNN に対して実行する際の高い計算およびメモリオーバーヘッドに対処すること。
  • GNN が示す不規則で動的なデータアクセスパターンに対処するのに非効率な一般用途プロセッサの課題を克服すること。
  • GCN にとどまらず、GRN や GAT を含む多様な GNN アーキテクチャをサポートする専用アクセラレータを設計すること。
  • べき乗則に従う分布を示すグラフと可変な頂点特徴長を有するグラフにおいて、データローカリティとメモリ階層を最適化すること。
  • すべての GNN 伝搬ステージを統合的かつ再構成可能なハードウェアアーキテクチャとして実現することで、高スループットと高エネルギー効率を達成すること。

提案手法

  • スパースかつランダムに接続されたグラフにおける悪いデータローカリティを管理するために、頂点のリングとエッジリダクションを基盤とした、リングエッジリダクション(RER)データフローを提案。
  • GNN レイヤー間での動的次元変更をサポートし、特徴抽出、集約、更新ステージにおける高い並列性を実現する再構成可能な RER PE アレイを設計。
  • 大規模なグラフをオンチップバッファに収容し、バッファ利用率を最大化するために、適応的計算再順序付けとタイルスケジューリングを組み合わせたグラフタイル戦略を導入。
  • レジスタファイル、共有バッファ、スクラッチパッドの3段階のオンチップメモリ階層を採用し、オフチップメモリアクセスを削減してエネルギー効率を向上。
  • GNN における密なテンソル演算を効率的に処理しつつ、不規則なグラフアクセスに対しても柔軟性を保つために、RER PE アレイ内でサステイリックに似たデータフローを採用。
  • モデルやデータセットの特性に応じて PE アレイサイズ(例:32×32)を最適化し、リソースの未利用を回避し、スループットを最大化。

実験結果

リサーチクエスチョン

  • RQ1一般の GNN モデル(GCN にとどまらない)の多様で不規則なデータフローパターンを効率的にサポートできるハードウェアアクセラレータはどのように設計できるか?
  • RQ2大規模でスパースなべき乗則分布グラフにおける悪いデータローカリティを効果的に抑制するデータフローとメモリアクセスパターンは何か?
  • RQ3オンチップメモリ階層とタスクスケジューリングを一体的に設計することで、オンチップメモリ容量を超えるグラフの処理を可能にする方法は何か?
  • RQ4ドメイン特化アクセラレータは、CPU や GPU、および既存の GNN アクセラレータと比較して、どの程度の性能向上とエネルギー効率の向上を達成できるか?
  • RQ5PE アレイサイズの選択が、異種の GNN ワークロードにおけるリソース利用効率とスループットに与える影響は何か?

主な発見

  • EnGN は、複数の GNN モデルとデータセットにおいて、CPU と比較して平均で 1802.9X の高速化と 1326.35X の高いエネルギー効率を達成。
  • EnGN は、GPU と比較して平均で 19.75X の高速化と 304.43X の高いエネルギー効率を達成。
  • 最先端の GCN アクセラレータ HyGCN と比較して、EnGN は 2.97X の高いスループットと 6.2X の低いエネルギー消費量を実現。
  • 32×32 の PE アレイは、入力特徴次元(例:16)がカラム数未満である場合、利用率が低いためベースラインと差が生じないことが示され、動的アレイサイズの必要性が明らかに。
  • 大規模データセットでは、集約ステージが大きな PE アレイでボトルネックとなり、特にエッジ対頂点比が高い場合に小規模データセットと比較して高速化率が低下。
  • グラフタイル化と適応的スケジューリングにより、バッファ利用率が著しく向上し、オンチップメモリ容量を超えるグラフの効率的処理が可能に。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。