[論文レビュー] GraphR: Accelerating Graph Processing Using ReRAM
GraphRは、ReRAMクロスバーを用いたアナログ内蔵計算により、スパース行列-ベクトル乗算(SpMV)を高速化する、初めてのReRAMベースのグラフ処理アクセラレータである。SpMVは多くのグラフアルゴリズムのコア演算である。GraphRはCPUに対して最大132.67倍の高速化と33.82倍のエネルギー効率向上を達成し、データ移動のオーバーヘッドを低減し、非揮発性メモリの特性を活用することで、GPUおよびPIMベースのシステムを凌駕する性能とエネルギー効率を実現した。
This paper presents GRAPHR, the first ReRAM-based graph processing accelerator. GRAPHR follows the principle of near-data processing and explores the opportunity of performing massive parallel analog operations with low hardware and energy cost. The analog computation is suit- able for graph processing because: 1) The algorithms are iterative and could inherently tolerate the imprecision; 2) Both probability calculation (e.g., PageRank and Collaborative Filtering) and typical graph algorithms involving integers (e.g., BFS/SSSP) are resilient to errors. The key insight of GRAPHR is that if a vertex program of a graph algorithm can be expressed in sparse matrix vector multiplication (SpMV), it can be efficiently performed by ReRAM crossbar. We show that this assumption is generally true for a large set of graph algorithms. GRAPHR is a novel accelerator architecture consisting of two components: memory ReRAM and graph engine (GE). The core graph computations are performed in sparse matrix format in GEs (ReRAM crossbars). The vector/matrix-based graph computation is not new, but ReRAM offers the unique opportunity to realize the massive parallelism with unprecedented energy efficiency and low hardware cost. With small subgraphs processed by GEs, the gain of performing parallel operations overshadows the wastes due to sparsity. The experiment results show that GRAPHR achieves a 16.01x (up to 132.67x) speedup and a 33.82x energy saving on geometric mean compared to a CPU baseline system. Com- pared to GPU, GRAPHR achieves 1.69x to 2.19x speedup and consumes 4.77x to 8.91x less energy. GRAPHR gains a speedup of 1.16x to 4.12x, and is 3.67x to 10.96x more energy efficiency compared to PIM-based architecture.
研究の動機と目的
- 従来のグラフ処理アーキテクチャにおける高いメモリ帯域幅とデータ移動のオーバーヘッドを解決すること。
- 反復的グラフアルゴリズムが内在的に持つ誤差耐性を活用し、新興の非揮発性メモリにおけるアナログ計算を可能にすること。
- ReRAMクロスバーとグラフエンジンを統合した、効率的な内蔵SpMV実行を実現する新しいアクセラレータの設計。
- CPU、GPU、PIMベースのシステムと比較して顕著な性能およびエネルギー効率の向上を実証すること。
- ReRAMベースのアナログ計算が実世界のグラフワークロードにおいて実用的で効率的であることを検証すること。
提案手法
- GraphRは、スパース行列-ベクトル乗算(SpMV)として表現された頂点プログラムを、ReRAMクロスバーにマッピングし、イン・サイドでアナログ計算を実行する。
- 二段階構造を採用:スパース行列を格納するReRAMベースのメモリと、並列アナログ演算を実行するグラフエンジン(GEs)。
- システムは小さなサブグラフを並列に処理し、マスド規模の並列性の恩恵がスパarsityに起因する非効率性を上回る。
- アナログ計算は直接ReRAMクロスバー上で実行され、データを処理ユニットに移動させることなく、エネルギー効率の高い行列-ベクトル乗算が可能になる。
- ReRAMの非揮発性特性を活用して静的エネルギー漏れを最小限に抑え、データ移動を削減する内蔵処理を支援する。
- GraphRはハイブリッド実行モデルを採用しており、並列性が著しいSpMV演算はReRAMクロスバーにオフロードされ、不規則なメモリアクセスはメインメモリで処理される。
実験結果
リサーチクエスチョン
- RQ1ReRAMクロスバーを用いたアナログ内蔵計算は、グラフ処理ワークロードを効果的に高速化できるか?
- RQ2反復的グラフアルゴリズムが内在的に持つ誤差耐性は、ReRAMのアナログ演算における不正確さをどの程度耐えられるか?
- RQ3CPU、GPU、PIMベースのアクセラレータと比較して、ReRAMベースのSpMVは性能およびエネルギー効率で優れているか?
- RQ4データのスパarsityがGraphRの性能およびエネルギー効率に与える影響は何か?
- RQ5イン・サイド計算とスパース行列表現を組み合わせたGraphRのアーキテクチャ設計は、優れたスループットとエネルギー節約を達成できるか?
主な発見
- GraphRは、評価されたすべてのグラフワークロードにおいて、CPUベースラインシステム比で幾何平均16.01倍(最大132.67倍)の高速化を達成した。
- CPUプラットフォーム比で幾何平均33.82倍のエネルギー節約を達成し、SDデータセットを用いたスパース行列-ベクトル乗算では最大217.88倍のエネルギー節約を記録した。
- GPUと比較して、GraphRは1.69~2.19倍の高い性能を発揮し、計算ユニット数が同程度であるにもかかわらず、4.77~8.91倍の低いエネルギー消費量を実現した。
- PIMベースのアーキテクチャと比較して、GraphRは1.16~4.12倍の高いスループットを達成し、3.67~10.96倍の高いエネルギー効率を実現した。
- スパarsityが増加するにつれて性能およびエネルギー効率はわずかに低下するが、並列性の恩恵が依然としてオーバーヘッドを上回る。
- 結果から、ReRAMベースのアナログ計算がグラフ処理において実用的で効果的であることが確認された。特に、MAC演算が支配的なPageRankや協調フィルタリングのようなアルゴリズムに顕著である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。