[論文レビュー] Fast Adjustable Threshold For Uniform Neural Network Quantization (Winning solution of LPIRC-II)
本論文では、後処理量子化における精度低下を顕著に低減する、高速でトレーナブルなしきい値調整手法を提案する。短いファインチューニング段階(最大8エポック)において、量子化しきい値のスケール因子を学習することで、最小限のデータおよび計算コストで高精度な量子化モデルを実現する。MNASNetを用いたImageNetでは、75.3%のフルプレシジョンモデルと比較して74.8%のトップ1精度を達成する。
Neural network quantization procedure is the necessary step for porting of neural networks to mobile devices. Quantization allows accelerating the inference, reducing memory consumption and model size. It can be performed without fine-tuning using calibration procedure (calculation of parameters necessary for quantization), or it is possible to train the network with quantization from scratch. Training with quantization from scratch on the labeled data is rather long and resource-consuming procedure. Quantization of network without fine-tuning leads to accuracy drop because of outliers which appear during the calibration. In this article we suggest to simplify the quantization procedure significantly by introducing the trained scale factors for quantization thresholds. It allows speeding up the process of quantization with fine-tuning up to 8 epochs as well as reducing the requirements to the set of train images. By our knowledge, the proposed method allowed us to get the first public available quantized version of MNAS without significant accuracy reduction - 74.8% vs 75.3% for original full-precision network. Model and code are ready for use and available at: https://github.com/agoncharenko1992/FAT-fast_adjustable_threshold.
研究の動機と目的
- キャリブレーション段階での外れ値が原因で生じる後処理量子化における精度の低下を是正すること。
- モデルの精度を損なわずに、量子化ファインチューニングに必要な計算およびデータ要件を低減すること。
- 最小限のパフォーマンス損失で、モバイルデバイスへの効率的な量子化モデルのデプロイを可能にすること。
- シンプルでトレーナブルなしきい値メカニズムを用いて、公開可能で高精度なMNASNetの量子化バージョンを提供すること。
提案手法
- 固定されたキャリブレーションベースのしきい値に代わって、量子化しきい値の学習可能なスケール因子を導入する。
- ラベル付きデータを用いて、これらのスケール因子を短いファインチューニング段階(最大8エポック)で学習する。
- 対称または非対称範囲を用いた均一量子化を適用し、学習済みパラメータでしきい値を調整する。
- エンドツーエンドの訓練が可能になるように、微分可能な量子化関数を採用する。
- ファインチューニング段階でロバストなしきい値を学習することで、大規模なキャリブレーションデータセットへの依存度を低減する。
- MNASNetのようなフルプレシジョンモデルにこの手法を適用し、デプロイ用に準備された量子化バージョンを実現する。
実験結果
リサーチクエスチョン
- RQ1長期間のファインチューニングを要せず、トレーナブルなしきい値メカニズムが後処理量子化における精度低下を低減できるか?
- RQ2この手法を用いた高精度な量子化モデルを達成するために、どの程度のファインチューニングが必要か?
- RQ3この手法は、モデルパフォーマンスを維持したまま、キャリブレーションに必要なデータ要件を低減できるか?
- RQ4この手法が、MNASNetのような最先端モデルに与える精度への影響は何か?
- RQ5この手法は、さまざまなニューラルネットワークアーキテクチャに一般化可能か?
主な発見
- ファインチューニングの必要量を最大8エポックまで低減し、量子化プロセスの高速化を顕著に実現した。
- MNASNetを用いたImageNetでは、75.3%のフルプレシジョンモデルと比較して74.8%のトップ1精度を達成した。
- この手法により、精度の低下を最小限に抑えた、初めての公開可能なMNASNetの量子化バージョンが実現された。
- ファインチューニング段階でロバストなしきい値を学習することで、大規模なキャリブレーションデータセットへの依存度が低下した。
- モデルとコードは公開されており、モバイルデバイスへの即時デプロイが可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。