Skip to main content
QUICK REVIEW

[論文レビュー] Differentiable Joint Pruning and Quantization for Hardware Efficiency

Ying Wang, Yadong Lu|arXiv (Cornell University)|Jul 20, 2020
Advanced Neural Network Applications参考文献 35被引用数 5
ひとこと要約

本稿では、ハードウェア効率な推論を実現するため、構造的プルーニングとミックス・プレシジョン量子化を統合的に最適化する、微分可能で統一されたフレームワークであるDifferentiable Joint Pruning and Quantization (DJPQ) を提案する。変動的情報ボトルネックに基づくプルーニングと微分可能量子化を1つの損失関数に統合することで、DJPQは、ImageNet上でのResNet18で53倍、MobileNetV2で43倍のBOPs削減を達成し、トップ-1精度を維持するという最先端の性能を発揮する。2段階的手法を上回り、2の累乗ビット幅制限付きのミックス・プレシジョン量子化をサポートし、精度の損失を最小限に抑える。

ABSTRACT

We present a differentiable joint pruning and quantization (DJPQ) scheme. We frame neural network compression as a joint gradient-based optimization problem, trading off between model pruning and quantization automatically for hardware efficiency. DJPQ incorporates variational information bottleneck based structured pruning and mixed-bit precision quantization into a single differentiable loss function. In contrast to previous works which consider pruning and quantization separately, our method enables users to find the optimal trade-off between both in a single training procedure. To utilize the method for more efficient hardware inference, we extend DJPQ to integrate structured pruning with power-of-two bit-restricted quantization. We show that DJPQ significantly reduces the number of Bit-Operations (BOPs) for several networks while maintaining the top-1 accuracy of original floating-point models (e.g., 53x BOPs reduction in ResNet18 on ImageNet, 43x in MobileNetV2). Compared to the conventional two-stage approach, which optimizes pruning and quantization independently, our scheme outperforms in terms of both accuracy and BOPs. Even when considering bit-restricted quantization, DJPQ achieves larger compression ratios and better accuracy than the two-stage approach.

研究の動機と目的

  • プルーニングと量子化を別々に最適化する従来の2段階圧縮パイプラインの非効率性を解消する。
  • 統一された微分可能目的関数を通じて、モデルのスパarsityとビット精度のトレードオフを包括的に最適化する。
  • ほとんどのデジタルアクセラレータでネイティブに効率的な2の累乗ビット幅を持つミックス・プレシジョン量子化をサポートすることで、ハードウェア効率を向上させる。
  • 1回の学習プロセスでエンドツーエンドの圧縮を可能にすることで、繰り返しの訓練やファインチューニングの必要性を低減する。
  • プルーニングと量子化の共同最適化により、極めて高い圧縮比を達成しながらも、高いモデル精度を維持する。

提案手法

  • 構造的プルーニングに変動的情報ボトルネック(VIB)を、ミックス・プレシジョンに微分可能量子化(DQ)を用いた損失関数を統合することで、モデル圧縮を統合的で微分可能な最適化問題として定式化する。
  • 学習可能な温度パラメータを備えたVIBベースのチャネルプルーニングを導入し、層ごとに勾配ベースのスパarsity制御を可能にする。
  • 各層ごとに学習可能なビット幅を備えた微分可能量子化を適用し、各層の精度を勾配ベースで最適化可能にする。
  • ビット幅制約を満たすために、微分可能なリラクゼーションを適用することで、2の累乗ビット幅制限付き量子化をサポートするフレームワークを拡張する。
  • 確率的勾配降下法を用いて共同目的関数を最適化し、1回のフォワード・バックワードパスでエンドツーエンドの訓練を可能にする。
  • 圧縮効率の評価と最適化のガイドラインとして、ハードウェアに配慮した代替指標としてビット演算数(BOPs)を用いる。

実験結果

リサーチクエスチョン

  • RQ1微分可能学習によるプルーニングと量子化の共同最適化は、2段階的手法に比べてより優れたハードウェア効率性を達成できるか?
  • RQ2独立的なプルーニングと量子化と比較して、共同最適化はモデル精度とBOPs削減にどのように影響を与えるか?
  • RQ3実用的な2の累乗ビット幅制限下でも、本手法は効果的にミックス・プレシジョンのビット幅を学習できるか?
  • RQ4ネットワーク内の各層において、プルーニング比と学習されたビット幅分布の関係は何か?
  • RQ5ヒューリスティックまたは固定ビット幅の量子化戦略と比較して、共同最適化はより効率的かつ正確なモデル圧縮を実現できるか?

主な発見

  • DJPQ は、ImageNet 上の ResNet18 に対して、完全精度モデルと比較して 0.5% の精度低下でビット演算数(BOPs)を 53 倍削減した。
  • MobileNetV2 では、DJPQ が BOPs を 43 倍削減しながら、元の浮動小数点モデルと比較してトップ-1精度を 0.75% 以内に維持した。
  • 2段階的手法(プルーニング → 量子化)と比較して、DJPQ は同等の BOPs 削減レベルで高い精度(69.27% 対 68.52%)を達成した。
  • ビット制限付きのDJPQバージョン(DJPQ-restrict)は、ResNet18 で52倍のBOPs削減を達成し、精度の劣化はほとんどなく、DQ-restrict や固定ビットベースラインを上回った。
  • 層ごとの分析から、初期層は強くプルーニングされており、MobileNetV2 の残差接続やポイントワイド畳み込みでは高いビット幅が割り当てられていることが判明し、圧縮に対する感受性を反映している。
  • VIBにおける学習可能な温度パラメータはプルーニング強度と相関しており、低い値は高いプルーニングを示し、プルーニングが行われない層では温度が1付近くなる。これは、プルーニングと量子化の動的な相互作用を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。