Skip to main content
QUICK REVIEW

[論文レビュー] A Closer Look at Structured Pruning for Neural Network Compression

Elliot J. Crowley, Jack Turner|arXiv (Cornell University)|Oct 10, 2018
Advanced Neural Network Applications参考文献 47被引用数 22
ひとこと要約

本稿はニューラルネットワーク圧縮における構造的プルーニングを調査し、CIFAR-10およびImageNetにおいて、スクラッチから訓練された小さな、幅が縮小されたネットワークが、プルーニングおよびファインチューニングを経たモデルを常に上回ることを発見した。著者らは、プルーニングされたアーキテクチャが容易に近似可能であり、競争力のある「コピーキャット」ネットワークを構築できることを示し、幅が縮小されたネットワークがCPUおよびGPUの両方でより優れたリソース効率を発揮するため、推論が高速化されることを示した。これは、速度と精度の観点からプルーニングの必要性を疑問視するものである。

ABSTRACT

Structured pruning is a popular method for compressing a neural network: given a large trained network, one alternates between removing channel connections and fine-tuning; reducing the overall width of the network. However, the efficacy of structured pruning has largely evaded scrutiny. In this paper, we examine ResNets and DenseNets obtained through structured pruning-and-tuning and make two interesting observations: (i) reduced networks---smaller versions of the original network trained from scratch---consistently outperform pruned networks; (ii) if one takes the architecture of a pruned network and then trains it from scratch it is significantly more competitive. Furthermore, these architectures are easy to approximate: we can prune once and obtain a family of new, scalable network architectures that can simply be trained from scratch. Finally, we compare the inference speed of reduced and pruned networks on hardware, and show that reduced networks are significantly faster. Code is available at https://github.com/BayesWatch/pytorch-prunes.

研究の動機と目的

  • 構造的プルーニングとファインチューニングの有効性を、スクラッチから訓練された小さな、幅が縮小されたネットワークと比較して、ニューラルネットワーク圧縮の観点から評価すること。
  • 構造的プルーニングによって得られたアーキテクチャが、改善された性能を得るために再利用可能で、トレーニング可能なアーキテクチャ(コピーキャットネットワーク)として再利用可能かどうかを調査すること。
  • 標準的なハードウェア(CPUおよびGPU)上でプルーニング済みおよび縮小ネットワークの推論速度をベンチマークすることにより、実世界の効率性を評価すること。
  • 推論速度とパラメータ効率が優先される状況において、構造的プルーニングが効率的な展開に不可欠であるという仮定を疑問視すること。

提案手法

  • CIFAR-10およびImageNetデータセット上で、WideResNetおよびDenseNetアーキテクチャにℓ₁ノルムおよびフィッシャーのプルーニングを適用すること。
  • 感度指標に基づくチャネルプルーニングと、精度を維持するためのプルーニング後ファインチューニングを交互に実行すること。
  • 元のネットワークの幅を体系的に縮小することで、スクラッチから訓練する方法で縮小ネットワークを作成すること。
  • プルーニングされたモデルから残存するチャネル構造を保持し、スクラッチから再訓練することで「コピーキャット」アーキテクチャを導出すること。
  • CPU(Intel Core i7)およびGPU(NVIDIA 1080Ti)上で、プルーニング済みおよび縮小モデルを同一条件下で推論速度をベンチマークすること。
  • すべてのモデルに対してパラメータ数、MACs、トップ1精度、および推論時間を比較し、効率性とパフォーマンスのトレードオフを評価すること。

実験結果

リサーチクエスチョン

  • RQ1構造的プルーニングとファインチューニングにより、スクラッチから訓練された幅が縮小されたネットワークを上回るモデルが得られるか?
  • RQ2構造的プルーニングによって得られたアーキテクチャパターンは、スクラッチから再訓練することで、競争力のあるモデルを構築するために再利用可能か?
  • RQ3一般用途のハードウェア上で、プルーニング済みネットワークと縮小ネットワークの推論速度はどのように比較されるか?
  • RQ4プルーニングがMACs/パラメータ比に与える影響は何か? これはリソース効率にどのように影響するか?
  • RQ5推論速度とパラメータ効率が重要な展開制約である場合、構造的プルーニングは依然として有益か?

主な発見

  • パラメータ予算が同じ場合、スクラッチから訓練された縮小ネットワークは、CIFAR-10およびImageNetの両方において、プルーニングおよびファインチューニングを経たモデルを常に上回る。
  • スクラッチから再訓練されたプルーニング済みネットワーク(コピーキャットアーキテクチャ)は、元のプルーニングおよびファインチューニング済みモデル、および縮小ネットワークをすべて上回る精度を達成しており、特にリサンプルネットワークにおいて顕著である。
  • CPUおよびGPUの両方で、縮小ネットワークはプルーニング済みネットワークよりも顕著に高速な推論時間を達成しており、パラメータあたりのMACs比はプルーニングモデルの最大3.5倍に達する。
  • 誤差率がResNet-18と同等のプルーニング済みResNet-34-Bは、パラメータ数が少ないにもかかわらず、推論速度が33%遅く、リソース効率が低いことが示された。
  • パラメータ数がResNet-18とほぼ同等のResNet-34-Aは、誤差率が低いが、推論速度が33%遅く、これはプルーニングがスループット効率を低下させることを示している。
  • 本研究の結論として、構造的プルーニングは一般用途のハードウェアにおいて推論スループットを損なうことが判明し、速度と効率を重視する場合には、縮小深さネットワークがより優れた代替手段であると結論づけた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。