Skip to main content
QUICK REVIEW

[論文レビュー] Layer-Wise Data-Free CNN Compression

Maxwell Horton, Yanzi Jin|arXiv (Cornell University)|Nov 18, 2020
Advanced Neural Network Applications被引用数 4
ひとこと要約

本論文は、実際のデータを一切使用せずに、バッチ正規化統計のみを用いて合成入力を生成することで、事前学習済みCNNの階層的・データフリーな圧縮手法を提案する。この手法により、実データを再学習せずに、効率的な量子化とプルーニングが可能となる。8ビット量子化では最先端の精度を達成(+0.34%)、5ビットでは最大28.50%の向上を達成し、効率的ベースラインや高コストな生成手法を上回る性能を発揮する。

ABSTRACT

We present a computationally efficient method for compressing a trained neural network without using real data. We break the problem of data-free network compression into independent layer-wise compressions. We show how to efficiently generate layer-wise training data using only a pretrained network. We use this data to perform independent layer-wise compressions on the pretrained network. We also show how to precondition the network to improve the accuracy of our layer-wise compression method. We present results for layer-wise compression using quantization and pruning. When quantizing, we compress with higher accuracy than related works while using orders of magnitude less compute. When compressing MobileNetV2 and evaluating on ImageNet, our method outperforms existing methods for quantization at all bit-widths, achieving a $+0.34\%$ improvement in $8$-bit quantization, and a stronger improvement at lower bit-widths (up to a $+28.50\%$ improvement at $5$ bits). When pruning, we outperform baselines of a similar compute envelope, achieving $1.5$ times the sparsity rate at the same accuracy. We also show how to combine our efficient method with high-compute generative methods to improve upon their results.

研究の動機と目的

  • エッジデプロイメントに適した、データフリーな事前学習済みCNN圧縮を可能にすること。
  • プライバシー、法的制約、またはストレージ制限により、元の学習データが入手できない状況でのモデル圧縮の課題に対処すること。
  • 再学習に実データを必要とせず、量子化やプルーニングにおいて高い精度を維持できる計算効率の良い手法を開発すること。
  • 合成データ生成を用いた階層的最適化を可能にすることで、既存のデータフリー手法を改善すること。
  • 高計算コストの生成手法と効率的な生成データを組み合わせ、性能をさらに向上させること。

提案手法

  • ネットワーク圧縮を独立した階層的最適化問題に分解し、各層を教師ネットワークの対応層からの知識蒸留によって学習する学生ネットワークとして扱う。
  • 各層の合成入力データは、教師ネットワークのバッチ正規化統計を逆算することで生成され、その層の活性化統計と一致するノイズ入力を用いる。
  • 訓練の安定化と精度向上を図るため、前処理技術であるAFCLE(適応的特徴単位チャネル単位線形等化)を適用する。
  • 学生ネットワークは、教師の出力ログィットが学生の学習をガイドする知識蒸留により訓練され、蒸留損失を最小化する。
  • プルーニングのため、スパarsity誘導型重み減衰が適用され、各層のスパarsity予算が学習され、スパarsityパターンをガイドする。
  • 高コストな生成手法(例:DI, AKD)と組み合わせることで、実データを必要とせずにそれらの性能を向上させることができる。層ごとの損失を目的関数に追加することで、性能が向上する。

実験結果

リサーチクエスチョン

  • RQ1実際の学習データにアクセスできない状況下でも、CNN圧縮を独立した階層的最適化問題に分解できるか?
  • RQ2事前学習ネットワークの特定の層の入力分布を近似するため、効率的な合成データ生成法は何か?
  • RQ3極端な量子化やプルーニング下でも、データフリー圧縮の精度を向上させるための技術は何か?
  • RQ4計算効率の良いデータフリー手法と高計算コストな生成手法を組み合わせ、それらの性能を向上させられるか?
  • RQ5本手法は、既存のデータフリーおよびデータ軽量ベースラインと比較して、精度と効率の面でどのように差をつけるか?

主な発見

  • ImageNet上のMobileNetV2における8ビット量子化では、先行研究より+0.34%の精度向上を達成。低ビット幅ではより顕著な向上を示す。
  • 5ビット量子化では、既存のデータフリー手法と比較して+28.50%の相対的精度向上を達成し、低ビット性能が優れていることが示された。
  • プルーニングにおいて、同程度の精度で、同等の効率的ベースラインの1.5倍のスパarsityを達成。グローバル、均一、ERKプルーニングベースラインを上回る性能を発揮。
  • アブレーションスタディにより、入力スケーリングとAFCLEの両方が重要であることが確認された。いずれかを省略すると精度が著しく低下し、特に入力スケーリングを省いた場合、MobileNetV1のプルーニングで1.5%の低下を示した。
  • DIやAKDと組み合わせることで、それらの性能が向上し、特にEfficientNet B0およびMobileNetV2において、スパarsity-精度トレードオフが両方の手法単体よりも優れた結果を達成した。
  • 本手法は高い効率性を維持しており、高計算コストな生成手法と比較して、計算量が桁違いに少ないにもかかわらず、同等または優れた結果を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。