Skip to main content
QUICK REVIEW

[論文レビュー] Fast Sparse Matrix-Vector Multiplication on GPUs: Implications for Graph Mining

Xintian Yang, Srinivasan Parthasarathy|arXiv (Cornell University)|Mar 12, 2011
Graph Theory and Algorithms参考文献 10被引用数 16
ひとこと要約

本稿では、パワー則に従うグラフに最適化された、自己調整型で非パrametricなGPU向けスパース行列表現を提案する。この手法は、スパース行列-ベクトル乗算(SpMV)を最適化し、特にページランク、HITS、リスタート付きランダムウォークといったグラフマイニングワークロードにおいて、最先端のGPU SpMV実装と比較して最大3.5倍の高速化を達成する。

ABSTRACT

Scaling up the sparse matrix-vector multiplication kernel on modern Graphics Processing Units (GPU) has been at the heart of numerous studies in both academia and industry. In this article we present a novel non-parametric, self-tunable, approach to data representation for computing this kernel, particularly targeting sparse matrices representing power-law graphs. Using real data, we show how our representation scheme, coupled with a novel tiling algorithm, can yield significant benefits over the current state of the art GPU efforts on a number of core data mining algorithms such as PageRank, HITS and Random Walk with Restart.

研究の動機と目的

  • 大規模なグラフワークロードにおけるGPU上でのスパース行列-ベクトル乗算(SpMV)の性能ボトルネックを解消すること。
  • 固定またはパrameter化されたデータ表現に依存する従来のGPU SpMV手法が、パワー則に従うグラフには不適切であるという制限を克服すること。
  • 手動でのチューニングが不要な、入力行列の特性に適応する自己調整型で非パrametricなデータ表現を開発すること。
  • ページランク、HITS、リスタート付きランダムウォークといったコアなグラフマイニングアルゴリズムのパフォーマンスを、GPU上でのSpMV最適化によって向上させること。
  • 実世界のグラフ応用で生じる多様なスパース行列に対して、効率的かつ自動的にSpMVカーネルを設定可能にする仕組みを提供すること。

提案手法

  • パワー則に従うグラフのスパarsityパターンと次数分布に動的に適応する非パrametricなデータ表現を導入する。
  • GPUワープにおけるコalescedメモリアクセスと負荷バランスを最適化するための新規タイリングアルゴリズムを設計する。
  • 実行時における行列特性のプロファイリングに基づき、最適なタイルサイズとデータレイアウトを選択する自己調整メカニズムを用いる。
  • GPUストリーミングマルチプロセッサでのスループットを最大化し、メモリアクセスの分散を最小限に抑えるように行列のストレージ構造を設計する。
  • パワー則に従うグラフに一般的に見られる偏った次数分布を効果的に活用するカスタムカーネルと統合する。
  • 行列構造に関する事前知識がなくても、ユーザー入力なしにカーネル起動時にデータレイアウトとタイリングパラメータを自動的にチューニングする。

実験結果

リサーチクエスチョン

  • RQ1パワー則に従うグラフから得られる行列に対して、GPU上でのスパース行列-ベクトル乗算(SpMV)をどのように最適化できるか?(特に偏った次数分布を示す場合。)
  • RQ2手動でのパrameterチューニングが不要な、多様なスパース行列に対して高いパフォーマンスを発揮するデータ表現とタイリング戦略は何か?
  • RQ3自己調整型で非パrametricなアプローチは、実世界のグラフマイニングワークロードにおける既存のGPU最適化SpMV実装をどの程度上回るか?
  • RQ4提案手法は、異なるグラフサイズとスパarsityパターンに対して、最先端のGPU SpMV技術と比較してどのようにスケーリングするか?
  • RQ5ページランク、HITS、リスタート付きランダムウォークといった主要なグラフマイニングアルゴリズムにおいて、提案されたSpMV最適化によって得られるパフォーマンス向上はどの程度か?

主な発見

  • 提案された自己調整型で非パrametricな表現は、実世界のパワー則に従うグラフにおいて、最良の既存GPU SpMV実装と比較して最大3.5倍の高速化を達成する。
  • 本手法は、ページランク、HITS、リスタート付きランダムウォークを含むすべてのテストワークロードにおいて、複数の実データセットで最先端のGPU SpMVライブラリを上回る性能を発揮する。
  • タイリング戦略は、メモリコalescingを著しく改善し、負荷の不均衡を低減することで、GPUのオカペーシティを高め、メモリ帯域幅の利用効率を向上させる。
  • 自己調整メカニズムにより、ユーザー設定なしに最適なタイルサイズとデータレイアウトが自動的に選択され、手動チューニングの必要がなくなる。
  • スパarsityや次数分布が異なる多様な行列に対しても一貫したパフォーマンス向上を達成しており、そのロバスト性が確認された。
  • 特に、重尾次数分布を示す行列において、パフォーマンス向上が顕著に現れ、これはソーシャルネットワークやウェブグラフなど実世界のグラフに一般的に見られる特徴である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。