Skip to main content
QUICK REVIEW

[論文レビュー] OPQ: Compressing Deep Neural Networks with One-shot Pruning-Quantization

Peng Hu, Xi Peng|arXiv (Cornell University)|May 23, 2022
Advanced Neural Network Applications被引用数 8
ひとこと要約

本稿では、微調整中に反復的または手動によるチューニングを必要とせず、唯一事前学習済み重みのみを用いて最適なプルーニングマスクと量子化コードブックを解析的に決定する、新しい手法One-shot Pruning-Quantization (OPQ) を提案する。OPQは、1層あたり1つのコードブックを共有する統一されたチャネルワイド量子化方式を導入することで、オーバーヘッドを低減し、特に高い圧縮率においても最小限の精度低下で最先端の圧縮率を達成する。

ABSTRACT

As Deep Neural Networks (DNNs) usually are overparameterized and have millions of weight parameters, it is challenging to deploy these large DNN models on resource-constrained hardware platforms, e.g., smartphones. Numerous network compression methods such as pruning and quantization are proposed to reduce the model size significantly, of which the key is to find suitable compression allocation (e.g., pruning sparsity and quantization codebook) of each layer. Existing solutions obtain the compression allocation in an iterative/manual fashion while finetuning the compressed model, thus suffering from the efficiency issue. Different from the prior art, we propose a novel One-shot Pruning-Quantization (OPQ) in this paper, which analytically solves the compression allocation with pre-trained weight parameters only. During finetuning, the compression module is fixed and only weight parameters are updated. To our knowledge, OPQ is the first work that reveals pre-trained model is sufficient for solving pruning and quantization simultaneously, without any complex iterative/manual optimization at the finetuning stage. Furthermore, we propose a unified channel-wise quantization method that enforces all channels of each layer to share a common codebook, which leads to low bit-rate allocation without introducing extra overhead brought by traditional channel-wise quantization. Comprehensive experiments on ImageNet with AlexNet/MobileNet-V1/ResNet-50 show that our method improves accuracy and training efficiency while obtains significantly higher compression rates compared to the state-of-the-art.

研究の動機と目的

  • DNN圧縮における従来のプルーニング・量子化手法の反復的または手動によるチューニングの非効率性に対処すること。
  • 事前学習済みモデルパラメータのみを用いて、同時に層ごとのプルーニング比と量子化コードブックを解析的に決定できることを実現すること。
  • 1層あたり1つのコードブックを強制することで、チャネルワイド量子化の計算およびハードウェアオーバーヘッドを低減すること。
  • 特に極端な圧縮レベルにおいても、モデルの精度を損なわず高い圧縮率を達成すること。
  • 微調整中に圧縮モジュールを固定するワンショットで反復的でないフレームワークを提供し、訓練効率を向上させること。

提案手法

  • ラプラス確率密度関数を用いて統一されたプルーニング誤差を定式化し、事前学習済み重みから解析的に層ごとのプルーニング比を計算する。
  • 反復的なマスク最適化を必要とせず、事前学習済みモデルから直接マグニチュードベースのプルーニングマスクを導出する。
  • 1層内のすべてのチャネルが1つの量子化器を共有する統一されたチャネルワイド量子化手法を提案し、チャネルごとのコードブックオーバーヘッドを排除する。
  • プルーニングされた重みの分散を用いて、近似された量子化誤差を最小化することで、1層あたりの量子化ステップ(Δi)を解析的に計算する。
  • 微調整中にプルーニングマスクと量子化パラメータを固定し、圧縮に起因する精度損失を補償するためにネットワーク重みのみを更新する。
  • 誤差近似技術を用いて解析的解の妥当性を検証し、理論的誤差と実際のプルーニングおよび量子化誤差の間で強い一致を示す。

実験結果

リサーチクエスチョン

  • RQ1反復的最適化を必要とせず、事前学習済み重みのみからプルーニングと量子化の割り当てを解析的に決定できるか?
  • RQ21層あたり1つのコードブックを共有する統一されたチャネルワイド量子化方式は、オーバーヘッドを低減しながらも高い圧縮効率を維持できるか?
  • RQ3ワンショットプルーニング・量子化は、顕著な精度低下を伴わずに、従来の手法よりも高い圧縮率を達成できるか?
  • RQ4理論的誤差近似は、実際のモデルにおけるプルーニングおよび量子化誤差とどの程度一致するか?
  • RQ5提案手法は、AlexNet、MobileNet-V1、ResNet-50といった多様なアーキテクチャにおいて、極端な圧縮レベルでも有効であるか?

主な発見

  • OPQは、AlexNet、MobileNet-V1、ResNet-50を用いたImageNet上で最先端の圧縮率を達成し、先行手法を顕著に上回る。
  • 極めて高い圧縮率においても精度が向上する傾向を示し、過酷なプルーニングと量子化に対しても強靭であることを実証した。
  • 解析的プルーニングおよび量子化誤差近似は、実際の誤差と非常に近い一致を示し、本手法の理論的基盤の妥当性を裏付けた。
  • 統一されたチャネルワイド量子化により、従来のチャネルワイド手法と比較してハードウェアオーバーヘッドが低減され、効率的なデプロイメントが可能になった。
  • 圧縮モジュールを微調整中に固定することで、反復的最適化アプローチと比較して訓練の複雑さが軽減され、効率が向上した。
  • 実験により、事前学習済みモデルの情報のみで、ワンショットで最適なプルーニングおよび量子化戦略を決定可能であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。