[論文レビュー] Relaxed Quantization for Discretized Neural Networks
本稿では、離散的量子化を連続的代理分布に緩和することで、勾配ベース最適化が可能な微分可能量子化手法であるリラクスト量子化(RQ)を提案する。重みと活性化を学習可能な量子化グリッド上のカテゴリカル分布としてモデル化し、コンクリート緩和を用いることで、勾配を介した最適化を可能にした。この手法により、ImageNet、CIFAR-10、MNISTで最先端の精度・効率トレードオフを達成し、量子化後の精度低下を最小限に抑えることができる。
Neural network quantization has become an important research area due to its great impact on deployment of large models on resource constrained devices. In order to train networks that can be effectively discretized without loss of performance, we introduce a differentiable quantization procedure. Differentiability can be achieved by transforming continuous distributions over the weights and activations of the network to categorical distributions over the quantization grid. These are subsequently relaxed to continuous surrogates that can allow for efficient gradient-based optimization. We further show that stochastic rounding can be seen as a special case of the proposed approach and that under this formulation the quantization grid itself can also be optimized with gradient descent. We experimentally validate the performance of our method on MNIST, CIFAR 10 and Imagenet classification.
研究の動機と目的
- 量子化の非微分性がニューラルネットワーク学習における勾配ベース最適化を妨える問題に対処すること。
- スケールとオフセットを含む量子化グリッドパラメータを勾配降下法を用いてネットワーク重みと同時に最適化できるようにすること。
- 確率的リダクションと標準的量子化が特別なケースとして統合可能な統一フレームワークを提供すること。
- 本物の量子化効果を模倣する緩和的で微分可能な量子化を用いた学習により、量子化モデルの精度を向上させること。
- エンドツーエンドで訓練可能な量子化により、リソース制約のあるデバイスへの低精度モデルの効率的デプロイを可能にすること。
提案手法
- 連続的な重みおよび活性化の分布を、離散的量子化グリッド上のカテゴリカル分布に変換する。
- バックプロパゲーション用の連続的で微分可能な代替関数を得るために、カテゴリカル分布のコンクリート緩和を導入する。
- 量子化グリッドを学習可能なスケールとオフセットでパrameter化し、グリッド自体の勾配ベース最適化を可能にする。
- 緩和温度を1に設定した場合、本手法は確率的リダクションを特別なケースとして一般化する。
- 緩和された代替関数を通じて量子化操作に勾配が流れることで、エンドツーエンド学習を可能にする。
- 低精度ハードウェア上の実デプロイ条件を反映させるために、訓練中にバッチ正規化をエミュレートする。
実験結果
リサーチクエスチョン
- RQ1事前に固定するのではなく、勾配降下法を用いて量子化グリッド自体を学習可能にすることができるか?
- RQ2低ビットネットワークのエンドツーエンド学習を可能にするために、量子化操作を微分可能にする方法は何か?
- RQ3確率的リダクションは、より一般的な微分可能量子化フレームワークの特別なケースであると示せるか?
- RQ4緩和的量子化を用いた学習により、量子化モデルの精度・効率トレードオフを改善できるか?
- RQ5本手法は、既存の量子化技術と比較して、精度および計算効率の面で優れているか?
主な発見
- RQは、ResNet-18およびMobileNetにおいて、精度対BOPs(秒間ビット演算数)トレードオフのパレートフロンティアを形成し、最先端の精度・効率トレードオフを達成した。
- ImageNetでは、SR+DR、BWN、XNOR-Net、および単純なリダクションと比較して、特に低ビット領域(4〜5ビット)で優れた性能を示した。
- 8ビット量子化では、Jacobら(2017)の手法と同等またはそれを上回る性能を達成したが、Jacobらとは異なり、事前学習モデルの性能を低下させないで済んだ。
- 緩和温度を1に設定した場合、確率的リダクションはRQの特別なケースであることが示され、統一的な微分可能フレームワークに統合された。
- RQを用いない単純なリダクションでは、MobileNetの全ビット設定でほぼランダムな性能にとどまり、微分可能学習の必要性が明確になった。
- 本手法により、量子化グリッドとネットワーク重みを同時に最適化できるため、より堅牢で正確な量子化モデルが得られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。