Skip to main content
QUICK REVIEW

[論文レビュー] Dynamic Sparse Graph for Efficient Deep Learning

Liu Liu, Lei Deng|arXiv (Cornell University)|Oct 1, 2018
Advanced Neural Network Applications参考文献 60被引用数 4
ひとこと要約

本稿では、次元削減探索とダブルマスク選択を用いて、高選別性を持つニューロンのみを動的に活性化することで、顕著なメモリおよび計算コストの削減を実現する、新たなトレーニングおよび推論フレームワークである動的スパースグラフ(DSG)を提案する。DSGは、複数のベンチマークにおいて、精度の損失を最小限に抑えつつ、メモリ使用量を1.7–4.5倍、演算量を2.3–4.4倍削減する。また、バッチ正規化(Batch Normalization)との互換性を維持し、エッジデバイス上での効率的なデプロイも可能である。

ABSTRACT

We propose to execute deep neural networks (DNNs) with dynamic and sparse graph (DSG) structure for compressive memory and accelerative execution during both training and inference. The great success of DNNs motivates the pursuing of lightweight models for the deployment onto embedded devices. However, most of the previous studies optimize for inference while neglect training or even complicate it. Training is far more intractable, since (i) the neurons dominate the memory cost rather than the weights in inference; (ii) the dynamic activation makes previous sparse acceleration via one-off optimization on fixed weight invalid; (iii) batch normalization (BN) is critical for maintaining accuracy while its activation reorganization damages the sparsity. To address these issues, DSG activates only a small amount of neurons with high selectivity at each iteration via a dimension-reduction search (DRS) and obtains the BN compatibility via a double-mask selection (DMS). Experiments show significant memory saving (1.7-4.5x) and operation reduction (2.3-4.4x) with little accuracy loss on various benchmarks.

研究の動機と目的

  • DNNトレーニングにおけるメモリおよび計算のボトル neck を解消すること、特に重みではなく活性化値がメモリ使用量を支配している点に焦点を当てる。
  • 推論に最適化された従来のスパースネス手法が、動的活性化とバッチ正規化(BN)との非互換性によりトレーニングを複雑にするという限界を克服すること。
  • モデルの精度を保持しつつ、一貫性のあるBN互換スパースネス機構を用いて、トレーニングと推論の両方を加速すること。
  • 各トレーニングイテレーションにおいて、最も選別性の高いニューロンのみを活性化することで、表現の冗長性を低減すること。
  • トレーニングおよび推論の両段階でメモリフットプリントと計算コストを最小限に抑えることで、リソース制限のあるエッジデバイスへのデプロイを可能にすること。

提案手法

  • DSGは、各トレーニングイテレーションにおいて、最も選別性の高いニューロンを特定・活性化する次元削減探索を採用し、活性化のメモリ使用量と計算量を削減する。
  • ダブルマスク選択機構により、ミニバッチ間での活性化統計を維持することで、バッチ正規化(BN)との互換性を保つ。
  • この手法はイテレーションごとに計算グラフを動的に再構成し、順方向および逆方向の伝搬においてスパースネスが維持されるようにする。
  • スパースネスは重みレベルではなくニューロンレベルに適用され、重みのプルーニングではなく活性化の冗長性をターゲットとする。
  • フレームワークは単一ノードおよび分散トレーニングをサポートしており、タイリングおよびデータ再利用最適化によるハードウェアアクセラレーションの可能性を有する。
  • トレーニング後、同じスパースネスパターンを推論段階でも再利用可能であり、デプロイフェーズ全体にわたって一貫した効率性を実現する。

実験結果

リサーチクエスチョン

  • RQ1モデル精度を損なわずに、DNNトレーニングにおけるメモリおよび計算コストを効果的に削減する方法は何か?
  • RQ2既存の推論最適化スパースネス技術がなぜトレーニングを加速できないのか、その主なボトル neck は何か?
  • RQ3活性化の再編成によってスパースネスを破壊する傾向があるにもかかわらず、スパーストレーニング環境でバッチ正規化をどのように維持できるか?
  • RQ4バックプロパゲーション中に、動的かつニューロンレベルのスパースネスを効率的に計算・維持することは可能か?
  • RQ5多様なDNNアーキテクチャにわたり、動的スパースネスはどれほどメモリおよび計算コストを削減できるか?

主な発見

  • DSGはDNNトレーニング段階で最大4.5倍、推論段階で1.7倍のメモリ使用量削減を達成し、顕著な表現コストの削減を実現する。
  • 推論段階で最大4.4倍、トレーニング段階で2.3倍の計算演算量削減が可能であり、複数のベンチマークで精度の損失を最小限に抑えている。
  • ダブルマスク選択機構により、スパースネスにもかかわらずバッチ正規化の互換性が成功裏に維持され、モデル精度が保持されている。
  • VGG8、ResNet8、AlexNetにおける実験から、DSGは同等のMAC(Multiply-accumulate Operations)を持つより小さな密結合モデルを上回るトレーニング時間および精度を達成している。
  • 動的スパースネス機構により、順方向および逆方向の伝搬が効率的に行えるため、クラウドおよびエッジデバイスの両方でのデプロイに適している。
  • 従来のトレーニングパイプラインと互換性があり、分散トレーニングのシナリオへも拡張可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。