Skip to main content
QUICK REVIEW

[論文レビュー] FracBits: Mixed Precision Quantization via Fractional Bit-Widths

Linjie Yang, Qing Jin|arXiv (Cornell University)|Jul 4, 2020
Advanced Neural Network Applications被引用数 4
ひとこと要約

FracBitsは、整数ビット幅の間の連続的で分数値となるビット幅(例:3.2ビット)としてビット幅を扱う、微分可能でワンショットの混合精度量子化手法を提案する。層ごと・カーネルごとの精度をエンドツーエンドで最適化可能であり、隣接するビット幅からの量子化重みを補間し、微分可能な正則化項を用いることで、ImageNetにおいてモデルサイズと計算コストの制約が厳しい条件下でも最先端の精度を達成する。

ABSTRACT

Model quantization helps to reduce model size and latency of deep neural networks. Mixed precision quantization is favorable with customized hardwares supporting arithmetic operations at multiple bit-widths to achieve maximum efficiency. We propose a novel learning-based algorithm to derive mixed precision models end-to-end under target computation constraints and model sizes. During the optimization, the bit-width of each layer / kernel in the model is at a fractional status of two consecutive bit-widths which can be adjusted gradually. With a differentiable regularization term, the resource constraints can be met during the quantization-aware training which results in an optimized mixed precision model. Further, our method can be naturally combined with channel pruning for better computation cost allocation. Our final models achieve comparable or better performance than previous quantization methods with mixed precision on MobilenetV1/V2, ResNet18 under different resource constraints on ImageNet dataset.

研究の動機と目的

  • 強化学習ベースの混合精度量子化手法の非効率さと高い探索コストを解消すること。
  • 量子化ニューラルネットワークにおける層またはカーネルごとのビット幅割り当てを、エンドツーエンドで微分可能に最適化すること。
  • 分数ビット幅を許容することで、モデルサイズと計算コストの厳しい制約下でもモデル精度を向上させること。
  • 統一的で微分可能なフレームワーク内で、層単位およびカーネル単位の混合精度量子化をサポートすること。
  • 複数のモデルバージョンの探索やトレーニングにかかるコストを削減し、連続的なビット幅パラメータを用いたワンショットトレーニングを可能にすること。

提案手法

  • 各層またはカーネルに対して、2つの隣接する整数ビット幅(例:3.2ビット)の間で連続的かつ学習可能なパラメータとしてビット幅を定式化する。
  • 2つの隣接ビット幅における量子化出力の重み付き平均として、量子化活性化および量子化重みを計算する微分可能な補間関数を用いる。
  • トレーニング中にターゲット制約(モデルサイズまたはFLOPs)を満たすために、リソース使用量をペナルティとする微分可能な正則化項を導入する。
  • 連続的ビット幅パラメータを用いて、ネットワーク全体をエンドツーエンドでトレーニングし、精度割り当ての勾配ベース最適化を可能にする。
  • 量子化操作を通過する勾配をバックプロパゲートするために、ストレートスラッシュ推定(STE)を適用し、微分可能性を維持する。
  • 各畳み込みカーネルまたはチャネルグループに個別の分数ビット幅を割り当てることで、チャネル単位およびカーネル単位の精度割り当てをサポートする。

実験結果

リサーチクエスチョン

  • RQ1混合精度量子化を連続的ビット幅上の微分可能な最適化問題として定式化できるか?
  • RQ2ワンショットトレーニング手順が、強化学習ベースや反復的探索ベースの混合精度手法よりも精度と効率性において優れているか?
  • RQ3整数ビット幅や離散的混合精度と比較して、分数ビット幅を許容することで、モデルサイズと計算コストの厳しい制約下でもモデル精度が向上するか?
  • RQ4低ビット量子化において、カーネル単位の精度割り当てが層単位の割り当てを上回る性能向上をもたらすか?
  • RQ5SAT や AutoQ といった強力なベースラインと比較して、本手法は精度とリソース効率性の両面で優れているか?

主な発見

  • 2ビットのMobileNet V1では、FracBits-SATが均一量子化ベースラインのSATに対して3.0%のトップ1精度の絶対的向上を達成し、2ビットのMobileNet V2では2.8%の向上を示した。
  • 挑戦的な3ビット設定において、FracBits-SATはMobileNet V1でトップ1精度が0.6%向上、MobileNet V2では0.8%向上した。
  • カーネル単位の量子化において、FB-SAT-Kは3ビットと4ビットのMobileNet V2において、それぞれSATに対して1.0%および0.8%のトップ1精度向上を達成した。
  • FB-SAT-Kは、層単位のFracBits-SATよりも3ビットと4ビットのMobileNet V2でそれぞれ0.4%および0.3%のトップ1精度向上を示し、カーネル単位の精度割り当ての利点を裏付けた。
  • ResNet18では、3ビットおよび4ビットの両設定で、FB-SAT-KがSATに対して0.5%のトップ1精度向上を達成し、両ビット幅で一貫した改善を示した。
  • 本手法は、モデルサイズと計算コストの制約下でも最先端のパフォーマンスを達成し、HAQ、AutoQ、SATを含むすべての評価設定で優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。