Skip to main content
QUICK REVIEW

[論文レビュー] Weight Normalization based Quantization for Deep Neural Network Compression

Wen-Pu Cai, Wu-Jun Li|arXiv (Cornell University)|Jul 1, 2019
Advanced Neural Network Applications参考文献 36被引用数 10
ひとこと要約

この論文では、重みの長尾分布を軽減するための重み正則化を適用する新しい手法であるWeight Normalization based Quantization (WNQ) を提案する。これにより、量子化誤差が低減され、CIFAR-100およびImageNetで最先端の性能を達成する。特に2ビットおよび3ビットの低ビット幅において、LQ-Net や QIL などの既存手法を上回り、相対的平均二乗量子化誤差を顕著に低減する。

ABSTRACT

With the development of deep neural networks, the size of network models becomes larger and larger. Model compression has become an urgent need for deploying these network models to mobile or embedded devices. Model quantization is a representative model compression technique. Although a lot of quantization methods have been proposed, many of them suffer from a high quantization error caused by a long-tail distribution of network weights. In this paper, we propose a novel quantization method, called weight normalization based quantization (WNQ), for model compression. WNQ adopts weight normalization to avoid the long-tail distribution of network weights and subsequently reduces the quantization error. Experiments on CIFAR-100 and ImageNet show that WNQ can outperform other baselines to achieve state-of-the-art performance.

研究の動機と目的

  • 長尾分布に起因する低ビットDNN量子化における高い量子化誤差を是正すること。
  • 重み正則化を用いて量子化誤差を最小化することで、モデル圧縮性能を向上させること。
  • モデル量子化における重み分布の影響を調査すること。これは、従来の研究で十分に検討されていなかった要因である。
  • モデル精度を損なわず、低ビット重み量子化で最先端の性能を達成すること。

提案手法

  • WNQは、量子化の前に各フィルタに対して重み正則化を適用し、重み分布を平滑化して長尾効果を低減する。
  • 層全体ではなく、各フィルタごとに重みを量子化することで、より正確で安定した量子化を実現する。
  • 学習可能なスケールおよびシフトパラメータを有する標準的な量子化関数を用い、スケールは正則化された重みのL2ノルムから導出される。
  • 重み正則化は学習段階で適用され、推論時には量子化された重みが使用され、精度の低下が最小限に抑えられる。
  • 従来の量子化フレームワークと互換性があり、活性化量子化とも組み合わせ可能である。
  • 分布の安定性を比較するための指標として、相対的平均二乗量子化誤差(mse)を用いて評価する。

実験結果

リサーチクエスチョン

  • RQ1ネットワーク重みの長尾分布は、低ビットDNNにおける量子化誤差にどのように影響するか?
  • RQ2重み正則化により重み分布を平滑化することで、量子化誤差を効果的に低減できるか?
  • RQ3LQ-Net や QIL といった既存の最先端手法と比較して、WNQは低ビット環境で優れた性能を示せるか?
  • RQ4最初の層および最後の層を含むすべての層を量子化しても、WNQは高い精度を維持できるか?(過去の手法ではこれらが除外される傾向がある。)
  • RQ5異なる層における重み分布の影響は、相対的平均二乗量子化誤差にどのように現れるか?

主な発見

  • ImageNetでは3ビット量子化でWNQがTop1ギャップ0.24を達成し、LQ-Net(0.38ギャップ)およびQIL(0.30ギャップ)を上回り、すべての層を量子化している。
  • CIFAR-100では3ビット量子化でWNQのTop1ギャップは0.39にまで低下し、LQ-Netの0.66と比較して量子化誤差が低いことが示された。
  • ImageNetにおけるResNet18では、2ビットでWNQがTop1ギャップ0.03を達成し、LQ-Netの0.28ギャップを著しく上回った。
  • 最後の全結合層における相対的平均二乗量子化誤差(mse)は、WNQがLQ-Netに比べ5.29倍低い結果となり、量子化誤差の低減が確認された。
  • WNQの重み分布は、特に最後の層でLQ-Netよりも滑らかく長尾が少ないことが確認され、性能向上と相関していた。
  • MobileNetv1では、WNQはLQ-Netに比べ2ビットで1.24%、3ビットで2.06%のTop1精度向上を達成し、アーキテクチャを問わず一貫した向上効果を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。