Skip to main content
QUICK REVIEW

[論文レビュー] On Periodic Functions as Regularizers for Quantization of Neural Networks

Maxim Naumov, Utku Diril|arXiv (Cornell University)|Nov 24, 2018
Neural Networks and Applications参考文献 31被引用数 14
ひとこと要約

この論文は、トレーニング中に周期的関数(正弦、余弦、ハット関数など)を正則化項として用いる、ニューラルネットワークのための新規量子化手法を提案する。時間経過とともにこれらの関数の振幅と周波数を調整することで、CIFAR-10およびImageNetにおいて、完全精度モデルとほぼ同等の精度を達成する8ビット量子化モデルを実現し、精度の低下を最小限に抑える。

ABSTRACT

Deep learning models have been successfully used in computer vision and many other fields. We propose an unorthodox algorithm for performing quantization of the model parameters. In contrast with popular quantization schemes based on thresholds, we use a novel technique based on periodic functions, such as continuous trigonometric sine or cosine as well as non-continuous hat functions. We apply these functions component-wise and add the sum over the model parameters as a regularizer to the model loss during training. The frequency and amplitude hyper-parameters of these functions can be adjusted during training. The regularization pushes the weights into discrete points that can be encoded as integers. We show that using this technique the resulting quantized models exhibit the same accuracy as the original ones on CIFAR-10 and ImageNet datasets.

研究の動機と目的

  • リソース制限のあるエッジデバイスへのディープニューラルネットワークのデプロイを容易にするために、モデルサイズと推論コストを量子化によって低減すること。
  • 固定しきい値に依存する従来の量子化手法の限界を克服し、重み分布の歪みや精度の損失を回避すること。
  • トレーニング中に周期的関数が、ネットワーク重みを離散的かつ量子化可能な値へ誘導する有効な正則化項として機能するかを検証すること。
  • 振幅スケジューリング付き周期的正則化が、特別なレイヤー単位またはエポック単位のトレーニング戦略を必要とせず、高精度な8ビット量子化を可能にすることを実証すること。

提案手法

  • トレーニング中にモデル重みに対して周期的関数(例:正弦、余弦、ハット関数)を要素ごとに適用する正則化項を導入する。
  • 正則化項は損失関数に加算され、すべての重みの和として表される:$ \sum_i \text{periodic}(w_i) $、周波数と振幅は調整可能。
  • 振幅はトレーニングエポックに伴い徐々に増加する(例:$10^{-4}$ から $10^{-1}$ へ)、これにより正則化の強度が効果的にスケーリングされる。
  • 周期的関数は、その極小値と極大値が望ましい量子化レベルと一致するように設計されており、重みが離散的整数値へ向かって押し込まれる。
  • トレーニング終了後、対称一様量子化を用いてモデルを量子化する:$ Q(w) = \gamma \cdot \text{round}(w / \gamma) $、ここで $ \gamma = c / (2^{t-1} - 1) $、$ c $ は絶対値の最大重み。
  • 量子化後、再トレーニングやファインチューニングを必要とせず、標準的な量子化パイプラインと互換性を持つ。

実験結果

リサーチクエスチョン

  • RQ1周期的関数は、トレーニング中にニューラルネットワークの重みを離散的かつ量子化可能な値へ誘導する有効な正則化項として機能するか?
  • RQ2振幅スケジューリング付き周期的正則化は、標準ベンチマークにおいて、顕著な精度低下を伴わず、高精度な8ビット量子化を可能にするか?
  • RQ3異なるビット幅において、周期的関数正則化は、標準的な量子化方式と比較して、精度と耐性の面で優れているか?
  • RQ4この手法は、ResNet-20(CIFAR-10)やResNet-50(ImageNet)といった異なるネットワークアーキテクチャおよびデータセットに一般化可能か?
  • RQ5周期的関数の選択(例:正弦関数 vs. ハット関数)は性能に重要か、それとも同等の結果をもたらすか?

主な発見

  • 正弦関数ベースの正則化を用いた8ビット量子化では、ImageNetで1.29% Top1のテスト誤差を達成し、元のモデルの75.84% Top1誤差と同一水準に到達した。
  • CIFAR-10では、動的振幅スケジューリングを用いた2ビット量子化で10.20%のテスト誤差を達成し、固定振幅またはベースライン手法を顕著に上回った。
  • CIFAR-10における8ビット量子化では、動的振幅スケジューリングで16.66%のテスト誤差を達成したのに対し、固定振幅では29.26%にとどまり、適応的スケジューリングの有効性が示された。
  • ImageNetでは正弦関数とハット関数の両方が同等の性能を示し、Top1誤差はそれぞれ75.57%と75.77%であり、関数の選択が性能に顕著な影響を与えないことが示された。
  • 異なるビット幅においても高い精度を維持したが、8ビット未満では明確な性能低下が見られたことから、この手法では8ビットが実用的な下限とされる。
  • 量子化後、ファインチューニングや早期・後期レイヤー専用の特別なトレーニング手順を必要とせず、完全精度モデルとほぼ同一の精度を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。