Skip to main content
QUICK REVIEW

[論文レビュー] Channel-wise Hessian Aware trace-Weighted Quantization of Neural Networks

Xu Qian, Victor C. Li|arXiv (Cornell University)|Aug 19, 2020
Adversarial Robustness in Machine Learning参考文献 24被引用数 9
ひとこと要約

本稿では、Hessianトレースを用いてチャネル感度をランク付けし、DDPGエージェントを用いて重みと活性化の両方のチャネルにわたる混合精度ビット割り当てを最適化する、深層強化学習に基づくChannel-wise Hessian Aware trace-Weighted Quantization (CW-HAWQ) を提案する。本手法は、同等の圧縮比においてResNet-50、ResNet-18、MobileNetV2で、AutoQ や HAWQ-V2 よりも低いトップ1精度低下で最先端の精度を達成する。

ABSTRACT

Second-order information has proven to be very effective in determining the redundancy of neural network weights and activations. Recent paper proposes to use Hessian traces of weights and activations for mixed-precision quantization and achieves state-of-the-art results. However, prior works only focus on selecting bits for each layer while the redundancy of different channels within a layer also differ a lot. This is mainly because the complexity of determining bits for each channel is too high for original methods. Here, we introduce Channel-wise Hessian Aware trace-Weighted Quantization (CW-HAWQ). CW-HAWQ uses Hessian trace to determine the relative sensitivity order of different channels of activations and weights. What's more, CW-HAWQ proposes to use deep Reinforcement learning (DRL) Deep Deterministic Policy Gradient (DDPG)-based agent to find the optimal ratios of different quantization bits and assign bits to channels according to the Hessian trace order. The number of states in CW-HAWQ is much smaller compared with traditional AutoML based mix-precision methods since we only need to search ratios for the quantization bits. Compare CW-HAWQ with state-of-the-art shows that we can achieve better results for multiple networks.

研究の動機と目的

  • 既存の混合精度量子化手法が層単位でのビット幅最適化にとどまっているという制限を解決すること。これは、層内における顕著な再冗長性の差異があるにもかかわらず、チャネル単位での最適化が行われていないためである。
  • チャネル単位の混合精度量子化における探索空間の複雑性を低減すること。これは、全探索や標準的な強化学習アプローチでは現実的でないほど巨大なためである。
  • 2次感度情報を利用することで、重みと活性化の両方のチャネルの量子化ビット幅を同時に最適化し、モデル精度と圧縮効率を向上させること。
  • 状態空間をビットレート構成に限定することで、計算コストを著しく低減し、効率的かつ効果的な方策学習が可能なスケーラブルな強化学習フレームワークを構築すること。

提案手法

  • 重みと活性化の各チャネルに対してHessianトレースを計算し、量子化誤差に対する相対的感度を評価する。
  • Hessianトレースに基づいてチャネルを感度順にソートし、ビット割り当ての意思決定をガイドする。
  • Deep Deterministic Policy Gradient (DDPG)エージェントを訓練し、個々のチャネルのビット割り当てではなく、チャネル全体の量子化ビット幅比(例:2, 3, 4, 5, 6, 7, 8)の最適な組み合わせを探索する。
  • エージェントは、従来のAutoMLベースの探索と比較して著しく計算コストが低い、ビットレート構成のみからなる縮小された状態空間で動作する。
  • 2段階の量子化を実施する:まずDDPGエージェントを用いて活性化のビット幅を最適化し、その後、得られたモデルに対して微調整と重みのビット幅最適化を実施する。
  • 活性化量子化にはPACTを採用し、学習可能なクリッピングしきい値を備える。重みの量子化には、量子化誤差を低減するための対称的3値または2ビットSAWBスタイルのバインディングを用いる。

実験結果

リサーチクエスチョン

  • RQ1Hessianトレースは、混合精度量子化における重みおよび活性化の両方のチャネルレベル感度を効果的にランク付けできるか?
  • RQ2状態空間がビットレート構成に制限された場合、DDPGベースの強化学習エージェントはチャネル単位の混合精度探索空間を効率的に探索できるか?
  • RQ3チャネル単位の混合精度量子化は、層単位または均一量子化に比べ、精度および圧縮効率において優れているか?
  • RQ4提案手法は、AutoQ や HAWQ-V2 といった最先端手法よりも高い精度を達成できるか、かつトップ1精度の低下を最小限に抑えることができるか?

主な発見

  • ResNet-50では、CW-HAWQは平均重みビット数2.61、活性化ビット数4.00でトップ1精度76.65%を達成し、全精度ベースラインと比較してトップ1精度低下はわずか-0.2%にとどまる。
  • 重みの圧縮比14.48倍の条件下で、CW-HAWQはトップ1精度75.57%を達成し、平均重みビット数2.21、活性化ビット数3.07であった。これはAutoQより1.2%の精度向上を達成し、トップ1精度低下を0.88%低減した。
  • ResNet-18では、CW-HAWQは平均重みビット数2.19、活性化ビット数3.02でトップ1精度69.02%を達成し、AutoQより1.6%の精度向上とトップ1精度低下の0.85%低減を実現した。
  • MobileNetV2では、CW-HAWQは平均重みビット数2.26、活性化ビット数3.13でトップ1精度69.85%を達成し、AutoQより1.2%の精度向上とトップ1精度低下の0.47%低減を達成した。
  • 本手法は、評価されたすべてのモデルで最先端の結果を達成しており、DDPGを用いたチャネル感度に配慮したビット割り当てが、優れた精度と効率性をもたらすことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。