Skip to main content
QUICK REVIEW

[論文レビュー] Deep Neural Network Compression with Single and Multiple Level Quantization

Yuhui Xu, Yongzhuang Wang|arXiv (Cornell University)|Mar 6, 2018
Advanced Image and Video Retrieval Techniques被引用数 43
ひとこと要約

本論文は、高ビット量子化には single-level quantization (SLQ)、極めて低ビット量子化(3値量子化)には multi-level quantization (MLQ) を提案し、幅と深さの分割を活用してモデルサイズを削減しつつ精度を維持する。

ABSTRACT

Network quantization is an effective solution to compress deep neural networks for practical usage. Existing network quantization methods cannot sufficiently exploit the depth information to generate low-bit compressed network. In this paper, we propose two novel network quantization approaches, single-level network quantization (SLQ) for high-bit quantization and multi-level network quantization (MLQ) for extremely low-bit quantization (ternary).We are the first to consider the network quantization from both width and depth level. In the width level, parameters are divided into two parts: one for quantization and the other for re-training to eliminate the quantization loss. SLQ leverages the distribution of the parameters to improve the width level. In the depth level, we introduce incremental layer compensation to quantize layers iteratively which decreases the quantization loss in each iteration. The proposed approaches are validated with extensive experiments based on the state-of-the-art neural networks including AlexNet, VGG-16, GoogleNet and ResNet-18. Both SLQ and MLQ achieve impressive results.

研究の動機と目的

  • 大規模なパラメータ数と資源制限デバイスでのデプロイによる効率的なDNN圧縮の必要性を動機付ける。
  • 重み分布と層毎の重要性を考慮した2つの量子化戦略(SLQとMLQ)を提案する。
  • クラスタリング、損失ベースの分割、重み共有、再学習を組み込んだ実用的なフレームワークを開発する。
  • 標準アーキテクチャ(AlexNet、VGG-16、GoogleNet、ResNet-18)およびデータセット(ImageNet、CIFAR-10)での有効性を示す。

提案手法

  • 重みのコードブックを形成するために層毎のk-meansクラスタリングを使用する。
  • クラスタを量子化されたグループと再訓練されたグループに分割する損失ベースの分割を適用する。
  • 選択したグループの重みをクラスタのセントロイドに割り当てて量子化し、残りの重みを再訓練する。
  • すべての重みが量子化されるまで、クラスタリング、分割、量子化、再訓練を繰り返す。
  • SLQを ESLQ で拡張し、セントロイドを特定の値タイプ(例:2のべき乗)に向けて制約する。
  • MLQに incremental layer compensation (ILC) を導入し、損失の大きい層を先に量子化して他を洗練させることで、3値量子化を可能にする。

実験結果

リサーチクエスチョン

  • RQ1重み分布を考慮した量子化(クラスタリングと損失ベースの分割)によって、高ビット幅(例:5ビット)で精度を維持できるか?
  • RQ2深さを考慮した戦略(ILC)が、ネットワークアーキテクチャを変更することなく、極めて低ビット(3値)量子化を信頼性高く実現できるか?
  • RQ3層別・中心別の制約を取り入れることで、アーキテクチャ(AlexNet、VGG-16、GoogleNet、ResNet-18)全体で量子化性能が向上するか?
  • RQ4SLQとMLQは、ImageNetとCIFAR-10などのベンチマークで既存の量子化手法(例:INQ、TWN、TTQ)と比較してどうか?

主な発見

  • ImageNet由来のネットワーク(例:VGG-16)では、5-bit SLQが一部ケースで完全精度参照よりTop-1/Top-5精度が高い。
  • ImageNetで、5-bit SLQはINQよりも改善を示すネットワークがいくつか(例:VGG-16: Top-1 72.23% vs 68.54% 参照; Top-5 91.0% vs 88.65%)。
  • 4-bit SLQと3-bit SLQの結果は、セントロイド数に応じて精度が維持されるか、またはわずかに低下することを示す(例:VGG-16 4-bit: Top-1 71.18%、Top-5 90.25%)。
  • MLQはCIFAR-10で最小限の精度低下で3値量子化を可能にする(Light CNN: 78.46% vs 78.66% の Top-1; ResNet20: 90.02% vs 91.70%);ImageNetのAlexNetはBNレイヤーを追加せずに同等の結果を達成。
  • MLQはBNなしのImageNetで54.24% Top-1と77.78% Top-5(BNなし)を達成し、アーキテクチャ変更なしで競争力のある性能を示す。
  • 5-bit AlexNet with SLQ は約6倍の圧縮を実現; プルーニングと組み合わせると、精度低下なしで約53xの圧縮が可能。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。