Skip to main content
QUICK REVIEW

[論文レビュー] Hardware/Software Co-Programmable Framework for Computational SSDs to Accelerate Deep Learning Service on Large-Scale Graphs

Miryeong Kwon, Donghyun Gouk|arXiv (Cornell University)|Jan 23, 2022
Advanced Graph Neural Networks被引用数 7
ひとこと要約

本稿では、FPGAを搭載した計算型SSD(CSSD)上でGNNワークロードを直接実行することにより、大規模グラフ上のディープラーニング推論を高速化する、ハードウェア/ソフトウェア共同プログラマブルフレームワークであるHolisticGNNを提案する。計算をストレージに近接させ、PCIeを介したグラフ意味論ライブラリによる直接プログラミングを可能にすることで、エンドツーエンドの推論遅延とエネルギー消費を削減し、最新のGPUと比較して7.1倍の高速化と33.2倍のエネルギー効率向上を達成した。

ABSTRACT

Graph neural networks (GNNs) process large-scale graphs consisting of a hundred billion edges. In contrast to traditional deep learning, unique behaviors of the emerging GNNs are engaged with a large set of graphs and embedding data on storage, which exhibits complex and irregular preprocessing. We propose a novel deep learning framework on large graphs, HolisticGNN, that provides an easy-to-use, near-storage inference infrastructure for fast, energy-efficient GNN processing. To achieve the best end-to-end latency and high energy efficiency, HolisticGNN allows users to implement various GNN algorithms and directly executes them where the actual data exist in a holistic manner. It also enables RPC over PCIe such that the users can simply program GNNs through a graph semantic library without any knowledge of the underlying hardware or storage configurations. We fabricate HolisticGNN's hardware RTL and implement its software on an FPGA-based computational SSD (CSSD). Our empirical evaluations show that the inference time of HolisticGNN outperforms GNN inference services using high-performance modern GPUs by 7.1x while reducing energy consumption by 33.2x, on average.

研究の動機と目的

  • 大規模グラフ上でのGNN推論における高いエンドツーエンド遅延とエネルギー非効率性を解消すること。特に、事前処理とデータ移動が実行時間の大部分を占める点を改善する。
  • 従来のストレージ内処理(ISP)の限界を克服し、計算型SSD上で完全なプログラマビリティとハードウェア非依存性を実現すること。
  • 低レベルのハードウェアやストレージファームウェアの知識が不要な、シームレスで高水準なプログラミングインターフェースをGNNアルゴリズムに提供すること。
  • ソフトウェアと再構成可能なハードウェアを共同設計することで、グラフの事前処理から推論までを包括的かつニアストレージで実行するGNNワークロードの実現。
  • FPGAベースの計算型SSDが、実世界のGNNワークロードにおいて、高性能GPUを上回る性能とエネルギー効率を達成できることを実証すること。

提案手法

  • ユーザーが高水準なグラフ意味論ライブラリでGNNアルゴリズムを記述することで、ハードウェアの詳細を抽象化する共同プログラマブルフレームワークの設計。
  • FPGA搭載のCSSDに、ノードサンプリングや埋め込みアグリゲーションといったGNN固有の演算を低レベルで再構成可能に加速するためのハードウェアRTLの実装。
  • PCIeを介したリモートプロシージャコール(RPC)を可能にし、データ移動を伴わずにホストがCSSD上でGNN計算を直接呼び出せるようにする。
  • ストレージデバイス内に統合された包括的なデータ処理パイプラインを実装し、グラフの読み込み、隣接リストの構築、埋め込み計算をすべてデバイス内で処理する。
  • GNN推論における面積制約とパフォーマンスのバランスを取るために、64個のプロセッシングエレメント(PE)を最適化してハードウェアを最適化。
  • ストレージレイヤーでの効率的な更新操作を提供することで、動的グラフの進化を可能にする、変更可能なグラフワークロードのサポート。

実験結果

リサーチクエスチョン

  • RQ1計算型SSD上で共同プログラマブルフレームワークを採用することで、大規模グラフ上のGNN推論のエンドツーエンド遅延を顕著に短縮できるか?
  • RQ2FPGAベースのCSSDを用いたニアストレージ処理は、GPUベースの推論と比較して、遅延とエネルギー効率の点でどの程度優れているか?
  • RQ3低レベルのストレージやハードウェアの複雑さを暴露せずに、高水準でユーザーに透明なGNNプログラミングモデルを提供することが可能か?
  • RQ4従来のデータ移動に依存するアプローチと比較して、事前処理、サンプリング、アグリゲーションを含む包括的なストレージ内実行のGNNパイプラインは、どの程度効果的か?
  • RQ5フレームワークは、挿入や削除を含む動的グラフ更新を、低遅延パフォーマンスを維持したまま効率的にサポートできるか?

主な発見

  • HolisticGNNは、大規模グラフワークロードにおいて、最新の高性能GPUと比較してエンドツーエンド推論遅延を7.1倍短縮した。
  • フレームワークは、GPUベースの推論サービスと比較してエネルギー消費を33.2倍低減し、優れたエネルギー効率を示した。
  • 変更可能なグラフ操作では、1日平均の更新遅延が970 msであり、最悪ケースの累積遅延はたった8.4秒(合計時間の0.01%)にとどまった。
  • 性能向上は、chameleon や youtube など高グラフ複雑性を示すワークロードを含む多様なワークロードで一貫して得られた。
  • PCIeを介したRPCの使用により、低レベルのハードウェアやファームウェアを管理する必要なしに、シームレスな統合と高水準プログラミングが可能になった。
  • フレームワークは、生のグラフ読み込みから推論までをストレージデバイス内ですべて加速し、データ移動のボトル neck を排除した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。