Skip to main content
QUICK REVIEW

[論文レビュー] DPRed: Making Typical Activation Values Matter In Deep Learning Computing.

Alberto Delmás, Sayeh Sharify|arXiv (Cornell University)|Apr 17, 2018
Advanced Neural Network Applications参考文献 55被引用数 14
ひとこと要約

DPRedは、層よりも細かい粒度で、アクティベーションの動的で即時の精度調整を、DPRedストライプ(DPRS)と呼ばれるハードウェアアクセラレータを用いて実現する。DPRSは畳み込みニューラルネットワーク全体で、固定精度アクセラレータと比較して2.61倍の高速化と1.84倍のエネルギー効率の向上を達成しており、全結合層ではさらに高い効果を発揮する。

ABSTRACT

We show that selecting a fixed precision for all activations in Convolutional Neural Networks, even if that precision is different per layer, amounts to worst case design. We show that much lower precisions can be used, if we could target the common case instead by tailoring the precision at a much finer granularity than that of a layer. We propose Dynamic Prediction Reduction (DPRed) where hardware on-the-fly detects the precision activations need and at a much finer granularity than a whole layer. We demonstrate a practical implementation of DPRed with DPRed Stripes (DPRS), a data-parallel hardware accelerator that adjusts precision on-the-fly to accommodate the values of the activations it processes concurrently. DPRS accelerates convolutional layers and executes unmodified convolutional neural networks. DPRS is 2.61x faster and 1.84x more energy efficient than a fixed-precision accelerator for a set of convolutional neural networks. We further extend DPRS to exploit activation and weight precisions for fully-connected layers. The enhanced design improves average performance and energy efficiency respectively by 2.59x and 1.19x over the fixed-precision accelerator for a broader set of neural networks. We also consider a lower cost variant that supports only even precision widths which offers better energy efficiency.

研究の動機と目的

  • 畳み込みニューラルネットワーク(CNN)におけるすべてのアクティベーションに対して固定精度計算が非効率であることを解決する。これは、異なる数値範囲を持つにもかかわらず、すべての値を均等に扱うためである。
  • 層レベルでの精度選択という制限を克服する。これは、各層内のアクティベーション分布における細かい変動を捉えられていないためである。
  • 実時間で個々のアクティベーション値ごとに精度を適応的に変更できるハードウェアアクセラレータを設計する。これにより、性能とエネルギー効率が向上する。
  • モデルの再トレーニングやネットワーク構造の変更を最小限に抑え、ハードウェアレベルでの動的精度制御を統合することで、変更のないCNNの効率的実行を可能にする。
  • アーキテクチャの広範な範囲にわたる性能評価を目的として、このアプローチを全結合層へと拡張する。

提案手法

  • 各アクティベーション値の大きさと分布に基づき、必要な最小精度を特定する動的予測低減(DPRed)手法を導入する。
  • 実行時におけるアクティベーションの即時の分析を用いて、個々のアクティベーションごとに精度を動的に調整するデータ並列型ハードウェアアクセラレータ「DPRedストライプ(DPRS)」を実装する。
  • 実行時メカニズムを用いてアクティベーション値の範囲を検出し、個々の値または小さなグループの粒度で最適な精度幅を選択する。
  • 設計全体で奇数および偶数の精度幅をサポートするが、エネルギー効率を向上させるために、偶数精度幅に制限された低コストバージョンを用意する。
  • モデルの再トレーニングやネットワークの変更を必要とせず、既存のモデルとの互換性を保ちながら、DPRSを推論パイプラインに統合する。
  • 重みとアクティベーションの両方の精度選択を適応させるようにフレームワークを拡張し、全結合層における精度を最適化することで、密度の高い層の効率を向上させる。

実験結果

リサーチクエスチョン

  • RQ1畳み込みニューラルネットワーク推論において、固定精度計算と比較して、個々のアクティベーションごとの動的精度選択が、速度およびエネルギー効率の面で優れているか?
  • RQ2層レベルよりも細かい粒度での即時の精度調整が、アクセラレータの性能向上に顕著な効果をもたらすか?
  • RQ3DPRSは、固定精度ベースラインと比較して、多様な畳み込みニューラルネットワークアーキテクチャにおいてどのように動作するか?
  • RQ4精度適応を全結合層にまで拡張できる範囲はどの程度で、高い性能と効率を維持できるか?
  • RQ5アクセラレータ設計において偶数精度幅のみをサポートする場合、ハードウェア複雑性とエネルギー効率のトレードオフはどのようなものか?

主な発見

  • DPRedストライプ(DPRS)は、複数の畳み込みニューラルネットワークにおいて、固定精度アクセラレータと比較して2.61倍の高速化と1.84倍のエネルギー効率の向上を達成した。
  • 全結合層への拡張を経た拡張版DPRSでは、固定精度ベースラインと比較して、平均的な性能が2.59倍向上し、エネルギー効率が1.19倍向上した。
  • 偶数精度幅のみをサポートするDPRSの低コストバージョンは、フル精度バージョンよりもエネルギー効率が高く、ハードウェアの複雑性も低減された。
  • DPRSにおける動的精度選択メカニズムにより、モデルの再トレーニングやアーキテクチャ変更なしに顕著な性能向上が実現された。
  • このアプローチは、細かい粒度での精度調整により、一般的なケースのアクティベーション値に的を射た。これにより、各層ごとの固定精度設計の最悪ケースを回避できた。
  • 結果として、モデルの精度を損なわずに、個々の値ごとに精度を顕著に低減可能であることが示され、大幅な効率向上が達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。