Skip to main content
QUICK REVIEW

[論文レビュー] Asymptotic Soft Filter Pruning for Deep Convolutional Neural Networks

Yang He, Xuanyi Dong|arXiv (Cornell University)|Aug 22, 2018
Advanced Neural Network Applications参考文献 63被引用数 7
ひとこと要約

本稿では、再訓練中にプルーニングされたフィルタを更新することで、深層畳み込みニューラルネットワーク(CNN)のフィルタを動的にプルーニングする、漸近的ソフトフィルタプルーニング(ASFP)を提案する。再訓練中にフィルタを更新することでモデル容量を維持し、安定的かつ段階的な情報集中を実現する。ResNet-50では40%以上のFLOPs削減が達成され、トップ5精度は0.14%の低下にとどまり、先行するソフトプルーニング手法を上回る性能を示す。

ABSTRACT

Deeper and wider Convolutional Neural Networks (CNNs) achieve superior performance but bring expensive computation cost. Accelerating such over-parameterized neural network has received increased attention. A typical pruning algorithm is a three-stage pipeline, i.e., training, pruning, and retraining. Prevailing approaches fix the pruned filters to zero during retraining, and thus significantly reduce the optimization space. Besides, they directly prune a large number of filters at first, which would cause unrecoverable information loss. To solve these problems, we propose an Asymptotic Soft Filter Pruning (ASFP) method to accelerate the inference procedure of the deep neural networks. First, we update the pruned filters during the retraining stage. As a result, the optimization space of the pruned model would not be reduced but be the same as that of the original model. In this way, the model has enough capacity to learn from the training data. Second, we prune the network asymptotically. We prune few filters at first and asymptotically prune more filters during the training procedure. With asymptotic pruning, the information of the training set would be gradually concentrated in the remaining filters, so the subsequent training and pruning process would be stable. Experiments show the effectiveness of our ASFP on image classification benchmarks. Notably, on ILSVRC-2012, our ASFP reduces more than 40% FLOPs on ResNet-50 with only 0.14% top-5 accuracy degradation, which is higher than the soft filter pruning (SFP) by 8%.

研究の動機と目的

  • ハードフィルタプルーニングによる性能劣化を是正すること。ハードプルーニングはフィルタを恒久的に削除し、モデル容量を低下させる。
  • 一度に多数のフィルタをプルーニングすることで生じる回復不能な情報損失を軽減すること。
  • 再訓練中にプルーニングされたフィルタを更新可能にすることで、最適化の安定性と精度を向上させること。
  • 訓練の進行に伴い段階的にプルーニング率を増加させる戦略を開発し、急激な情報損失を最小限に抑えること。
  • 事前学習を必要としない状況でも高い圧縮率と最小限の精度低下を達成すること。

提案手法

  • プルーニングは各訓練エポックの終了時に繰り返し実行され、最初にℓ₂ノルムが最小のフィルタが選択される。
  • プルーニングされたフィルタはゼロ固定ではなく、再訓練中に更新され、最適化空間を完全に保持する。
  • プルーニング率は訓練の進行に従い漸近的に増加し、初期は少数のフィルタを、徐々に多くのフィルタを除去する。
  • フィルタの重要度評価にℓ₂ノルムが用いられ、重みが大きいフィルタが優遇され、識別的特徴が保持される。
  • 本手法は3段階のパイプラインに従う:訓練、再訓練を伴う繰り返しソフトプルーニング、最終的なプルーニング(更新なし)。
  • 本手法はImageNetおよびCIFAR-10ベンチマークを用いてResNet-50およびResNet-110で評価された。

実験結果

リサーチクエスチョン

  • RQ1再訓練可能なソフトプルーニングが、ハードプルーニングと比較して高いモデル容量を維持し、精度を向上させられるか?
  • RQ2時間経過に伴いプルーニングフィルタ数を段階的に増加させる漸近的プルーニングは、より安定した訓練と優れた性能をもたらすか?
  • RQ3フィルタ選択基準(ℓ₁ノルム対ℓ₂ノルム)の選択が、最終的なモデル精度に与える影響は何か?
  • RQ4事前学習を必要としない状況でもASFPは競争力のある性能を達成できるか?また、既存のソフトプルーニング手法と比較してどうか?
  • RQ5ASFPの性能はハイパーパrameter(ASFP間隔およびプルーニングスケジュールパラメータD)にどれほど敏感か?

主な発見

  • ILSVRC-2012でASFPはResNet-50に対して40%以上のFLOPs削減を達成し、トップ5精度は0.14%の低下にとどまり、ソフトフィルタプルーニング(SFP)を8%上回る。
  • 40%を超えるプルーニング率では、ASFPはSFPを著しく上回り、高圧縮率下でも優れたロバストネスを示す。
  • 23%未満のプルーニング率では、プルーニング後のモデルがベースラインよりも高い精度を達成しており、正則化効果が確認された。
  • ℓ₂ノルムをフィルタ選択基準に用いることで、ℓ₁ノルムよりも高い精度が得られ、大規模な識別的重みを持つフィルタをより効果的に保持できる。
  • ASFPの性能はパrameter Dに対して相対的に不感であり、Dを7から16に変更しても精度の変動は0.3%未満にとどまる。
  • 1エポックより長い間隔(例:10エポック)を用いたASFPは、デフォルトの1エポック間隔よりも高い精度を達成でき、ハイパーパrameterチューニングの余地があることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。