[論文レビュー] SparseRT: Accelerating Unstructured Sparsity on GPUs for Deep Learning Inference
SparseRT は、インspectors-executors フレームワークを活用して、GPU 上での深層学習推論における非構造的スパarsity を高速化するコードジェネレータである。SpMM(スパース行列-密行列乗算)の最適化により、1x1畳み込みおよび全結合層において、90% のスパarsity で平均 3.4倍、95% のスパarsity で平均 5.4倍の速度向上を達成した。これは、非構造的スパarsity が一般用途の GPU でも効率的に活用可能であることを示している。
In recent years, there has been a flurry of research in deep neural network pruning and compression. Early approaches prune weights individually. However, it is difficult to take advantage of the resulting unstructured sparsity patterns on modern hardware like GPUs. As a result, pruning strategies which impose sparsity structures in the weights have become more popular. However,these structured pruning approaches typically lead to higher losses in accuracy than unstructured pruning. In this paper, we present SparseRT, a code generator that leverage unstructured sparsity to accelerate sparse linear algebra operations in deep learning inference on GPUs. For 1x1 convolutions and fully connected layers, we demonstrate geometric mean of speedups of 3.4x over the equivalent dense computation at 90% sparsity and 5.4x at 95% sparsity when evaluated on hundreds of test cases in deep learning. For sparse 3x3 convolutions, we show speedups of over 5x on use cases in ResNet-50.
研究の動機と目的
- 現代の GPU ハードウェアでは非構造的スパarsity がうまくサポートされないという一般的な信念に挑戦すること。
- 科学計算向けに最適化された、極度に高いスパarsity を想定した既存の SpMM 実装におけるパフォーマンスボトルネックを解消すること。
- 一般用途の GPU アーキテクチャを用いて、非構造的スパarsity を有する prune された深層ニューラルネットワークの効率的推論を可能にすること。
- カスタム最適化カーネルを組み合わせることで、非構造的プルーニングが正確かつ高性能であることを実証すること。
提案手法
- SparseRT は、スパarsity パatters を分析し、SpMM 操作用に最適化された PTX カーネルを生成するインスペクタ-エグゼキュータ フレームワークを採用している。
- 密行列乗算から出発し、スパarsity パターンに基づいて不要な計算を排除することで、複雑なスパースフォーマットに依存しない。
- 各レイヤーのスパarsity 構造に特化した PTX コード生成バックエンドを介して、カスタム CUDA カーネルを生成する。
- スパースな 3x3 畳み込みは、im2col テクニックを用いて SpMM に変換することで高速化される。
- 本手法は、コンピュータビジョンおよび NLP の実世界の prune モデル(ResNet-50 や BERT に類似したアーキテクチャを含む)を対象として評価された。
- 一般化を確認するため、数百のテストケースを対象に、90% および 95% のスパarsity 水準でパフォーマンスを測定した。
実験結果
リサーチクエスチョン
- RQ1一般用途の GPU において、カスタムハードウェアを用いずに非構造的スパarsity を効率的に高速化できるか?
- RQ2インスペクタ-エグゼキュータ ベースのコード生成技術は、深層学習推論ワークロードにおける SpMM に対してどれほど有効か?
- RQ3実用的なスパarsity 水準(例:90–95%)における非構造的スパarsity で、どの程度のパフォーマンス向上が達成できるか?
- RQ4SpMM 最適化は、prune されたネットワークにおける 1x1 畳み込みおよび全結合層の推論速度をどの程度向上できるか?
- RQ5スパース畳み込み演算は、最小限のパフォーマンス損失で効果的に SpMM に還元できるか?
主な発見
- SparseRT は、1x1 畳み込みおよび全結合層において、90% のスパarsity で密行列計算比で平均 3.4倍の速度向上を達成した。
- 95% のスパarsity では、平均速度向上が 5.4倍に増加し、より高いスパarsity に対して強いスケーラビリティを示した。
- ResNet-50 のスパースな 3x3 畳み込みにおいて、SpMM に還元することで最大 4倍の速度向上を達成した。
- コンピュータビジョンおよび NLP の実世界の prune モデルから得た数百のテスト行列において、一貫したパフォーマンス向上が得られた。
- 結果は、非構造的スパarsity が一般用途の GPU アーキテクチャと相性が悪いという一般的な仮定を覆している。
- 適切なコード生成と最適化を施すことで、非構造的スパarsity は効率的な深層学習推論の有効な道筋であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。