Skip to main content
QUICK REVIEW

[論文レビュー] FAT: Learning Low-Bitwidth Parametric Representation via Frequency-Aware Transformation

Chaofan Tao, Rui Lin|arXiv (Cornell University)|Feb 15, 2021
Anomaly Detection Techniques and Applications参考文献 32被引用数 4
ひとこと要約

本稿では、ネットワーク重みの周波数ドメイン変換を学習することで、低ビット幅畳み込みニューラルネットワーク(CNN)の訓練を向上させる、新しい量子化フレームワーク「周波数に配慮した変換(FAT)」を提案する。冗長な高周波成分を抑制し、情報量の多い低周波成分を保持することで、FATは単純な均一量子化器が最先端の精度を達成可能にする。4ビットのResNet-18ではImageNetで70.5%のトップ1精度を達成し、4ビットのMobileNet-V2では69.2%を達成。全精度モデルと比較して計算量を最大54.9倍まで削減する。

ABSTRACT

Learning convolutional neural networks (CNNs) with low bitwidth is challenging because performance may drop significantly after quantization. Prior arts often discretize the network weights by carefully tuning hyper-parameters of quantization (e.g. non-uniform stepsize and layer-wise bitwidths), which are complicated and sub-optimal because the full-precision and low-precision models have a large discrepancy. This work presents a novel quantization pipeline, Frequency-Aware Transformation (FAT), which has several appealing benefits. (1) Rather than designing complicated quantizers like existing works, FAT learns to transform network weights in the frequency domain before quantization, making them more amenable to training in low bitwidth. (2) With FAT, CNNs can be easily trained in low precision using simple standard quantizers without tedious hyper-parameter tuning. Theoretical analysis shows that FAT improves both uniform and non-uniform quantizers. (3) FAT can be easily plugged into many CNN architectures. When training ResNet-18 and MobileNet-V2 in 4 bits, FAT plus a simple rounding operation already achieves 70.5% and 69.2% top-1 accuracy on ImageNet without bells and whistles, outperforming recent state-of-the-art by reducing 54.9X and 45.7X computations against full-precision models. We hope FAT provides a novel perspective for model quantization. Code is available at \url{https://github.com/ChaofanTao/FAT_Quantization}.

研究の動機と目的

  • 全精度モデルと低精度モデルの間の容量ギャップが原因で生じる低ビット幅CNN量子化における性能低下を是正すること。
  • 複雑な量子化器が多数のハイパーパrameterチューニングを必要とし、離散的重み空間での勾配消失を引き起こすという限界を克服すること。
  • 専用ハードウェアや複雑な量子化方式に依存することを減らし、標準的な量子化器が学習された表現変換を通じて効果的に機能できるようにすること。
  • 重みの周波数ドメインでの包括的分析により、ニューロン間相関を活用することで、低ビット幅設定における訓練の安定性と性能を向上させること。

提案手法

  • 2段階の量子化パイプラインを提案:まず、全精度重みに可学習な周波数ドメイン変換T(·)を適用し、次に標準量子化器Q(·)を適用する。
  • 空間ドメインの重みを周波数ドメインにマッピングするために離散フーリエ変換(DFT)を用い、重みの相関関係を包括的に分析可能にする。
  • 周波数スペクトルにソフトマスクを導入し、重要な周波数成分を効果的に保持するとともに、ノイズに似た高周波成分を抑制する。
  • バックプロパゲーションを用いて変換をエンドツーエンドで学習する。微分可能変換により勾配が明示的に制御され、離散化の影響にもかかわらず効果的な学習が可能になる。
  • 変換後は均一量子化器を用いることで、混合精度や適応的量子化戦略といった複雑な手法を回避する。
  • 推論時においては変換を削除し、デプロイメントにあたっては標準量子化器のみを残すことで、汎用ハードウェアとの互換性を確保する。

実験結果

リサーチクエスチョン

  • RQ1学習された周波数ドメイン変換により、低ビット幅CNN訓練における単純な量子化器の性能向上が可能か?
  • RQ2重みを周波数ドメインで変換することで、量子化誤差がどのように低減され、全精度モデルと低ビット幅モデルの容量ギャップがどのように埋められるか?
  • RQ3周波数に配慮した変換が、低精度学習における勾配の流れにどの程度寄与するか?
  • RQ4提案手法が、最小限のアーキテクチャ的・量子化的複雑性で最先端の精度を達成できるか?
  • RQ5直接量子化と比較して、周波数ドメイン変換が低ビット幅モデルの一般化性能およびロバスト性を向上させるか?

主な発見

  • FATは、ハイパーパrameterチューニングや複雑な量子化方式を一切用いずに、4ビットのResNet-18でImageNetで70.5%のトップ1精度を達成し、最先端の手法を上回る。
  • 4ビットのMobileNet-V2では、FATが69.2%のトップ1精度を達成。全精度モデルと比較して計算量が45.7倍削減された最近のSOTA結果を上回る。
  • モデルサイズは最大10倍(例:3ビットのResNet-18で4.7MB)削減され、BOPsは最大86.7倍削減され、高い圧縮効率を示した。
  • 学習された周波数マスクにより、大部分の高周波成分が抑制され、重み表現のノイズ除去が効果的に行われ、量子化の忠実度が向上した。
  • モバイルARMボードでの推論では、FAT後に均一量子化を適用した場合、遅延が398msにまで低下。LQ-Net(929ms)やAPoT(857ms)といった複雑な量子化器よりも顕著に高速であった。
  • 理論的分析により、FATが周波数ドメインにおけるニューロン間関係を活用することで、量子化誤差を低減し、情報量豊富な勾配を可能にすることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。