Skip to main content
QUICK REVIEW

[論文レビュー] Retraining-Based Iterative Weight Quantization for Deep Neural Networks

Dongsoo Lee, Byeongwook Kim|arXiv (Cornell University)|May 29, 2018
Advanced Neural Network Applications参考文献 21被引用数 12
ひとこと要約

本稿では、訓練プロセスを変更せずに、PTBデータセット上でのLSTMモデルの1ビット量子化を可能にする反復的再訓練に基づく重み量子化手法を提案する。各量子化ステップの後、完全精度の重みを用いて繰り返し再訓練することで、量子化誤差を低減し、平坦な最小値に収束させ、精度の劣化を防ぐ。特に、プルーニングと組み合わせることで、最小限の精度損失で高圧縮を実現できる。

ABSTRACT

Model compression has gained a lot of attention due to its ability to reduce hardware resource requirements significantly while maintaining accuracy of DNNs. Model compression is especially useful for memory-intensive recurrent neural networks because smaller memory footprint is crucial not only for reducing storage requirement but also for fast inference operations. Quantization is known to be an effective model compression method and researchers are interested in minimizing the number of bits to represent parameters. In this work, we introduce an iterative technique to apply quantization, presenting high compression ratio without any modifications to the training algorithm. In the proposed technique, weight quantization is followed by retraining the model with full precision weights. We show that iterative retraining generates new sets of weights which can be quantized with decreasing quantization loss at each iteration. We also show that quantization is efficiently able to leverage pruning, another effective model compression method. Implementation issues on combining the two methods are also addressed. Our experimental results demonstrate that an LSTM model using 1-bit quantized weights is sufficient for PTB dataset without any accuracy degradation while previous methods demand at least 2-4 bits for quantized weights.

研究の動機と目的

  • 深層ニューラルネットワークにおける重み量子化に必要なビット数を減らすが、訓練手順を変更しないこと。
  • 特にメモリ集約的で大規模なRNN(例:LSTM)において、過酷な量子化によって生じる精度劣化を是正すること。
  • 反復的再訓練により量子化品質を向上させ、完全精度重みと量子化重みの間の平均二乗誤差(MSE)を最小化すること。
  • プルーニングと反復的量子化の相乗効果を調査し、圧縮率と精度の両立を図ること。
  • 1ビット量子化が、言語モデル化などの系列モデルタスクにおいて、完全精度モデルの性能に達成可能であることを実証すること。

提案手法

  • 本手法は反復的量子化を適用する:低ビット表現に重みを量子化した後、完全精度重みを用いてモデルを再訓練することで、解を改善する。
  • 各反復で、現在の量子化重みから再訓練を実行し、損失関数の平坦な最小値に収束させる。
  • 量子化はグリーディーな交互最適化アプローチを用いる:kビット量子化では、各ビットを逐次最適化し、残差誤差を最小化する。
  • 1ビットでは符号ベースのバイナリゼーションを、より高いビット数では再帰的残差最小化を用い、各層ごとにスケーリング係数を調整する。
  • 量子化の前段階としてプルーニングを適用し、パラメータ数を削減することで、収束を加速させ、量子化品質を向上させる。
  • 元の訓練アルゴリズムを変更せず、再訓練を繰り返し適用することで、量子化の忠実度を段階的に向上させるフレームワークを構築する。

実験結果

リサーチクエスチョン

  • RQ1完全精度重みを用いた反復的再訓練は、過酷な重み量子化後の量子化誤差を低減し、モデル精度を向上させることができるか?
  • RQ2プルーニングと反復的量子化を組み合わせることで、収束が速くなり、ビット幅の要件が低下するか?
  • RQ31ビット量子化は、LSTMモデルが言語モデル化タスク(例:PTB)で完全精度の性能を達成できるか?
  • RQ4反復的再訓練は損失関数の形状にどのような影響を与え、平坦な最小値を形成し、一般化性能を向上させるか?
  • RQ5圧縮比と精度の観点から、プルーニングと反復的量子化の最適な相乗効果は何か?

主な発見

  • PTBのスモールモデルにおいて、1ビット量子化のみでテストパープレキシティが113.426に達し、完全精度ベースラインの115.111と同等の性能を示した。
  • 80%のプルーニングと21回の再訓練反復を施したPTBのミディアムモデルでは、1ビット量子化でテストパープレキシティ85.540を達成した。
  • 85%のプルーニングを施したPTBのラージモデルでも、1ビット量子化でテストパープレキシティ80.308を達成し、完全精度の結果に非常に近い性能を示した。
  • Text8データセットでは、6ビット量子化でテストパープレキシティ105.632を達成し、同ビット幅で105.972を報告したベースラインのAlternating手法を上回った。
  • プルーニングと反復的量子化の組み合わせにより、再訓練の反復回数が削減され、収束が加速した(図8のMSE低下の速さから明らか)。
  • 本手法は、1ビット量子化がPTBで最先端の性能を達成可能であることを示したが、先行手法では少なくとも2〜4ビットが必要であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。