Skip to main content
QUICK REVIEW

[論文レビュー] PruneNet: Channel Pruning via Global Importance

Ashish Khetan, Zohar Karnin|arXiv (Cornell University)|May 22, 2020
Advanced Neural Network Applications参考文献 34被引用数 11
ひとこと要約

PruneNetは、軽量な最適化ステップを用いて各層のチャネル幅をデータ駆動で決定する、グローバルに最適化されたチャネルプルーニング手法を提案する。この手法により、優れた精度とFLOPs効率が達成される。ImageNetでは、PruneNetでプルーニングされたResNet-50は、精度においてResNet-34およびResNet-18を上回り、FLOPsを削減している。また、プルーニングされたResNet-101は、元のResNet-50を上回る性能を示している。

ABSTRACT

Channel pruning is one of the predominant approaches for accelerating deep neural networks. Most existing pruning methods either train from scratch with a sparsity inducing term such as group lasso, or prune redundant channels in a pretrained network and then fine tune the network. Both strategies suffer from some limitations: the use of group lasso is computationally expensive, difficult to converge and often suffers from worse behavior due to the regularization bias. The methods that start with a pretrained network either prune channels uniformly across the layers or prune channels based on the basic statistics of the network parameters. These approaches either ignore the fact that some CNN layers are more redundant than others or fail to adequately identify the level of redundancy in different layers. In this work, we investigate a simple-yet-effective method for pruning channels based on a computationally light-weight yet effective data driven optimization step that discovers the necessary width per layer. Experiments conducted on ILSVRC-$12$ confirm effectiveness of our approach. With non-uniform pruning across the layers on ResNet-$50$, we are able to match the FLOP reduction of state-of-the-art channel pruning results while achieving a $0.98\%$ higher accuracy. Further, we show that our pruned ResNet-$50$ network outperforms ResNet-$34$ and ResNet-$18$ networks, and that our pruned ResNet-$101$ outperforms ResNet-$50$.

研究の動機と目的

  • 均一または統計に基づくチャネルプルーニングの限界を克服し、層固有のデータ駆動型チャネル幅選択を可能にすること。
  • グループlassoのような高コストな正則化を避ける一方で、微調整済みのプルーニングモデルを上回る計算効率の高い手法を開発すること。
  • 大規模ネットワーク(例:ResNet-50)のプルーニング版が、手動で設計された小さなアーキテクチャ(例:ResNet-34)を上回る精度と効率を達成できることを示すこと。
  • 層間で非一様にプルーニングすることで、均一プルーニングや標準的なモデルバージョンよりも優れた性能が得られることを検証すること。

提案手法

  • PruneNetは、軽量でデータ駆動な最適化ステップに基づくグローバル重要度スコアを導入し、各層の最適なチャネル数を決定する。
  • この手法は、微調整中にチャネル幅とネットワーク重みを同時に最適化する微分可能で微分可能なプルーニング戦略を用いる。
  • チャネルプルーニングを制約付き最適化問題として定式化し、精度の低下を最小限に抑えつつFLOPsを削減することを目的とする。
  • アーキテクチャ全体の性能に与える寄与度に基づき、適応的にチャネルを削除するプルーニングスケジュールを用いる。
  • 2段階の訓練プロセスを採用する:第一に、活性化統計を用いてグローバル重要度指標を計算する。第二に、選択されたチャネル幅でネットワークを微調整する。
  • この手法は事前学習後に行われ、再訓練から始めたり、グループlassoのような複雑な正則化を必要としない。

実験結果

リサーチクエスチョン

  • RQ1データ駆動で非一様なチャネルプルーニング戦略は、ResNet-34 や ResNet-18 といった標準的な小さなアーキテクチャを上回ることができるか?
  • RQ2グローバルに最適化されたチャネルプルーニング手法は、均一または統計に基づくプルーニングよりも優れた精度-FLOPsトレードオフを達成できるか?
  • RQ3プルーニングされたResNet-50は、元の未プルーニングのResNet-101を上回る性能を示せるか?
  • RQ4精度と効率の観点から、PruneNetの性能はDCP や ThiNet といった最先端のチャネルプルーニング手法と比べてどうか?

主な発見

  • プルーニングされたResNet-50は、最先端のチャネルプルーニング手法と同等のFLOPs削減を達成しながら、0.98%高いトップ-1精度を示した。
  • プルーニングされたResNet-50は、FLOPsが少ないにもかかわらず、精度とスループットの両面でResNet-34およびResNet-18を上回った。
  • プルーニングされたResNet-101は、元のResNet-50よりも高い精度と高速なスループットを達成し、手動で設計された小さなバージョンよりも効率的なアーキテクチャを生成できることを示した。
  • Caltech-256では、FLOPsを最大10倍まで削減した場合でも、プルーニングされたResNet-50は元の未プルーニングモデルと同等またはそれ以上の精度を維持し、FLOPsを5.75倍削減した際にはトップ-1精度が7.53%向上した。
  • 極端なプルーニング(例:10倍のFLOPs削減)においても、PruneNetは均一プルーニングやDCP や ThiNet といった最先端のベースラインに対して顕著な精度優位性を維持した。
  • PruneNetのGCP-fバージョンは、FLOPsを5倍削減した状態でResNet-50よりも3.86%高い精度を達成し、パラメータ数も3.09倍削減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。