Skip to main content
QUICK REVIEW

[論文レビュー] Precision Gating: Improving Neural Network Efficiency with Dynamic Dual-Precision Activations

Yichi Zhang, Ritchie Zhao|arXiv (Cornell University)|Feb 17, 2020
Advanced Neural Network Applications参考文献 30被引用数 16
ひとこと要約

本稿では、入力に応じた特徴量の重要度に応じて、大部分の特徴量を低精度で計算しつつ、重要な特徴量のみを微分可能ゲーティング機構を用いて高精度に昇格させる、エンド・ト・エンドで学習可能な動的二精度量子化手法であるPrecision Gating (PG) を提案する。PGは、最大4.5倍の計算コスト削減を実現しつつ、精度の損失を最小限に抑え、LSTMでは1.2%低い perplexity と2.7倍の計算削減を達成し、ImageNetでは3.5%高い精度と2.4倍の計算削減を実現した。

ABSTRACT

We propose precision gating (PG), an end-to-end trainable dynamic dual-precision quantization technique for deep neural networks. PG computes most features in a low precision and only a small proportion of important features in a higher precision to preserve accuracy. The proposed approach is applicable to a variety of DNN architectures and significantly reduces the computational cost of DNN execution with almost no accuracy loss. Our experiments indicate that PG achieves excellent results on CNNs, including statically compressed mobile-friendly networks such as ShuffleNet. Compared to the state-of-the-art prediction-based quantization schemes, PG achieves the same or higher accuracy with 2.4$ imes$ less compute on ImageNet. PG furthermore applies to RNNs. Compared to 8-bit uniform quantization, PG obtains a 1.2% improvement in perplexity per word with 2.7$ imes$ computational cost reduction on LSTM on the Penn Tree Bank dataset. Code is available at: https://github.com/cornell-zhang/dnn-gating

研究の動機と目的

  • 深層ニューラルネットワーク (DNN) における静的量子化の非効率性、すなわち入力依存の特徴量の重要度に関わらず固定精度を割り当てる問題に対処すること。
  • 特にリソース制限のあるエッジデバイスへのデプロイを想定し、モデル精度を損なわずに DNN 推論における計算コストを低減すること。
  • 個々の特徴量レベルでの入力に適応した精度割り当てをエンド・ト・エンドで学習可能にすることにより、効率性と精度を向上させること。
  • バックプロパゲーションがどの特徴量を高精度にすべきかを学習できる微分可能ゲーティング機構を導入すること。
  • CNN や RNN を含む多様なアーキテクチャにおいて、ImageNet や Penn Tree Bank といった標準ベンチマークで PG の有効性を示すこと。

提案手法

  • PG は主に低精度(例:3ビット)で DNN レイヤーを計算し、学習されたゲーティング関数を用いて出力特徴量の大きさが大きいものを重要と特定する。
  • スパースな高精度更新が、選択された重要な特徴量にのみ適用され、特徴量レベルでの二精度計算が実現される。
  • ゲーティング関数は微分可能であり、バックプロパゲーションによりどの特徴量をアップグレードすべきかを最適化できるため、エンド・ト・エンド学習が可能になる。
  • 低精度領域における量子化誤差を低減するため、PG は PACT(パラメトリック ReLU 活性化クリッピング)を統合している。
  • 更新フェーズは、スパarsity を効率的に活用するためのサンプリングされた密行列乗算(SDDMM)カーネルによって実装されており、高速化を実現する。
  • バックプロパゲーション中にもスパarsity が維持され、前方伝搬および逆伝搬の両方で顕著な計算コスト削減が可能になる。

実験結果

リサーチクエスチョン

  • RQ1動的かつ入力に適応した精度割り当ては、精度の低下を伴わずに DNN 推論の効率性を向上させることができるか?
  • RQ2微分可能なゲーティング機構により、最小限のオーバーヘッドで二精度 DNN のエンド・ト・エンド学習が可能になるか?
  • RQ3CNN や RNN において、PG は静的量子化および予測ベースの量子化手法と比較して、精度および計算コストの点で優れているか?
  • RQ4更新フェーズにおけるスパarsity は、CPU や GPU アーキテクチャにおいて計算速度向上にどの程度寄与するか?
  • RQ5PG は畳み込みネットワークおよび再帰的ネットワーク、特に ShuffleNet や LSTMs といったモバイルフレンドリーなモデルに対しても効果的に適用可能か?

主な発見

  • ImageNet では、基準となる8ビット量子化と比較して、PG はトップ-1精度を3.5%向上させるとともに、計算コストを2.4倍削減した。
  • CIFAR-10 では、8ビットベースラインと比較して、PG は精度を0.6%向上させ、計算コストを最大4.5倍削減した。
  • Penn Tree Bank データセットでは、PG は単語あたりの perplexity (PPW) を1.2%改善し、計算コストを2.7倍削減した。
  • SDDMM カーネルの実装は、CPU において密行列乗算(GEMM)と比較して最大8.3倍のウォルククラック速度向上を達成し、ResNet-20 の各レイヤーで76%~99%のスパarsity を達成した。
  • PG は逆伝搬中に前方伝搬よりも6~21%高いスパarsity を誘発し、学習および推論の両方で顕著な計算コスト削減を実現した。
  • 本手法は専用アクセラレータと互換性があり、専用ハードウェアでは少なくとも3倍の速度向上と5倍のエネルギー効率向上が見込まれる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。