Skip to main content
QUICK REVIEW

[論文レビュー] Blended Coarse Gradient Descent for Full Quantization of Deep Neural Networks

Penghang Yin, Shuai Zhang|arXiv (Cornell University)|Aug 15, 2018
Advanced Neural Network Applications参考文献 34被引用数 12
ひとこと要約

本稿では、極めて低ビットの重みと活性化を持つ完全に量子化された深層ニューラルネットワークのトレーニングのための新しい最適化手法、ブレンドド粗い勾配降下法(BCGD)を提案する。フルプレシジョンと量子化された重みをブレンドし、真の勾配と正に相関する粗い勾配を使用することで、安定的かつ収束性のあるトレーニングが可能となり、ResNet-18でバイナリ重みと4ビット活性化を使用した場合にImageNetで64.36%のトップ1精度を達成した。

ABSTRACT

Quantized deep neural networks (QDNNs) are attractive due to their much lower memory storage and faster inference speed than their regular full precision counterparts. To maintain the same performance level especially at low bit-widths, QDNNs must be retrained. Their training involves piecewise constant activation functions and discrete weights, hence mathematical challenges arise. We introduce the notion of coarse gradient and propose the blended coarse gradient descent (BCGD) algorithm, for training fully quantized neural networks. Coarse gradient is generally not a gradient of any function but an artificial ascent direction. The weight update of BCGD goes by coarse gradient correction of a weighted average of the full precision weights and their quantization (the so-called blending), which yields sufficient descent in the objective value and thus accelerates the training. Our experiments demonstrate that this simple blending technique is very effective for quantization at extremely low bit-width such as binarization. In full quantization of ResNet-18 for ImageNet classification task, BCGD gives 64.36\% top-1 accuracy with binary weights across all layers and 4-bit adaptive activation. If the weights in the first and last layers are kept in full precision, this number increases to 65.46\%. As theoretical justification, we show convergence analysis of coarse gradient descent for a two-linear-layer neural network model with Gaussian input data, and prove that the expected coarse gradient correlates positively with the underlying true gradient.

研究の動機と目的

  • 区分けされた定数関数の活性化関数と離散的重みを有する完全に量子化されたニューラルネットワークのトレーニングの課題に対処する。これは、標準的な誤差逆伝播法が適用できないことを意味する。
  • 量子化ネットワークにおけるゼロまたはほぼゼロの確率的勾配の問題を克服するため、勾配に依存しない上昇方向(粗い勾配)を導入する。
  • 量子化層の微分不能性にもかかわらず、損失関数における十分な減少を保証するトレーニングアルゴリズムを開発する。
  • ガウス分布入力の仮定の下で、真の勾配と粗い勾配の正の相関関係を理論的に証明することで、粗い勾配の有効性を正当化する。
  • ImageNetなどの標準ベンチマークにおいて、特にバイナリ化(1ビット)を含む低ビット量子化で最先端の性能を示す。

提案手法

  • 真の勾配とは異なり、非微分可能な量子化されたネットワークにおける最適化を導くために設計された、人工的な上昇方向である「粗い勾配」の概念を導入する。
  • フルプレシジョン重みとその量子化された対応物の重み付き平均に基づく重み更新を行う、ブレンドド粗い勾配降下(BCGD)アルゴリズムを提案する。
  • 量子化されたReLU活性化関数に対して、三値の粗い偏微分を用いることで、量子化層を介した誤差逆伝播を可能にする。
  • ほとんど至るところで正確な一般化代理導関数を備えたストレートスラッシュ推定法を適用し、勾配近似の安定性を向上させる。
  • 適応的ステップサイズを用いた確率的最適化フレームワークに粗い勾配を統合し、目的関数が単調に減少することを保証する。
  • 理論的分析は、ガウス分布入力データを有する二層ニューラルネットワークモデルに基づき、期待される粗い勾配が真の勾配と正に相関することを証明する。

実験結果

リサーチクエスチョン

  • RQ1離散的重みと活性化を持つ完全に量子化された深層ニューラルネットワークのトレーニングに、勾配に依存しない上昇方向(粗い勾配)を効果的に使用できるか?
  • RQ2BCGDアルゴリズムにおけるフルプレシジョン重みと量子化重みのブレンドが、トレーニング中に損失関数における十分な減少を保証するか?
  • RQ3区分けされた定数関数の活性化関数が存在する状況下で、期待される粗い勾配と真の勾配の間の相関関係はどのように関係するか?
  • RQ4ガウス分布入力を持つ簡略化された二層ネットワークにおいて、BCGDアルゴリズムの理論的収束性を確立できるか?
  • RQ5従来の手法と比較して、BCGDを用いることで低ビット量子化(例:バイナリ化)でどの程度の性能向上が達成できるか?

主な発見

  • BCGDは、すべての層にバイナリ重みと4ビットの適応的活性化量子化を用いたResNet-18を用いて、ImageNetで64.36%のトップ1精度を達成した。
  • 最初の層と最後の層をフルプレシジョンに保った場合、BCGDは65.46%のトップ1精度を達成し、混合精度の微調整による利点を示した。
  • 理論的分析により、期待される粗い勾配が真の勾配と正の内積を持つことが証明され、最適化における下降方向の保証が得られた。
  • ガウス分布入力を持つ二層ネットワークにおいて、粗い勾配が真の勾配と十分に相関していることが示され、収束保証の根拠が得られた。
  • BCGDアルゴリズムは、適切なステップサイズ条件のもとで、目的関数の単調減少と勾配ノルムのゼロへの収束を保証する。
  • 特に1ビット(バイナリ化)のような極端なビット幅において、標準的な誤差逆伝播法の代替として安定的かつ効果的な手法を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。