Skip to main content
QUICK REVIEW

[論文レビュー] Lossless CNN Channel Pruning via Gradient Resetting and Convolutional Re-parameterization

Xiaohan Ding, Tianxiang Hao|arXiv (Cornell University)|Jul 7, 2020
Advanced Neural Network Applications参考文献 4被引用数 5
ひとこと要約

この論文は、深層畳み込みニューラルネットワーク(CNN)を「記憶」と「忘却」の2つのコンponentに再パラメータ化する、新しいチャネルプルーニング手法を提案する。前者には標準的なSGDを、後者にはペナルティ勾配更新を用いることで構造的スパarsityを誘導する。この手法により、精度の低下を伴わずResNet-50のFLOPsを43.9%まで削減でき、ImageNet上でのトップ1精度は76.15%を維持する。

ABSTRACT

Channel pruning (a.k.a. filter pruning) aims to slim down a convolutional neural network (CNN) by reducing the width (i.e., numbers of output channels) of convolutional layers. However, as CNN's representational capacity depends on the width, doing so tends to degrade the performance. A traditional learning-based channel pruning paradigm applies a penalty on parameters to improve the robustness to pruning, but such a penalty may degrade the performance even before pruning. Inspired by the neurobiology research about the independence of remembering and forgetting, we propose to re-parameterize a CNN into the remembering parts and forgetting parts, where the former learn to maintain the performance and the latter learn for efficiency. By training the re-parameterized model using regular SGD on the former but a novel update rule with penalty gradients on the latter, we achieve structured sparsity, enabling us to equivalently convert the re-parameterized model into the original architecture with narrower layers. With our method, we can slim down a standard ResNet-50 with 76.15\% top-1 accuracy on ImageNet to a narrower one with only 43.9\% FLOPs and no accuracy drop. Code and models are released at this https URL.

研究の動機と目的

  • 深層CNNにおけるチャネルプルーニングによって引き起こされる性能劣化を是正すること。これは、表現能力の低下に起因する。
  • プルーニングの前から性能が劣化する、従来の正則化ベースのプルーニング手法の限界を克服すること。
  • 精度の維持と効率性の両立を実現する神経生物学的インスピレーションに基づいた、学習の分離による構造的スパarsityの実現。
  • 標準的なSGDで訓練可能なメインネットワークを維持しつつ、性能の低下を伴わずチャネルをプルーニングできる再パラメータ化戦略の開発。
  • 標準的なImageNetベンチマークで、元の精度を維持したまま顕著なFLOPs削減を達成すること。

提案手法

  • CNNを「記憶」と「忘却」の2つの異なるコンponentに再パラメータ化する。前者は性能を維持し、後者は効率性を実現する。
  • 記憶コンponentを標準的な確率的勾配降下法(SGD)で訓練し、表現能力を維持する。
  • 忘却コンponentに新しい更新ルール(ペナルティ勾配を用いる)を適用し、チャネル重みにおける構造的スパarsityを促進する。
  • 勾配リセットを用いて忘却プロセスをメインネットワークの学習ダイナミクスから分離し、生物学的記憶メカニズムを模倣する。
  • 訓練後、プルーニングされたチャネルを削除することで、コンactで狭いアーキテクチャに再パラメータ化し、再パラメータ化されたモデルをスリム化されたCNNに変換する。
  • 畳み込み再パラメータ化を活用し、プルーニング後の推論効率とモデル精度を維持する。

実験結果

リサーチクエスチョン

  • RQ1性能の劣化を伴わず、性能維持とチャネルプルーニングの両立を実現するため、CNNを記憶と忘却のコンponentに再パラメータ化できるか?
  • RQ2専用の「忘却」コンponentにペナルティ勾配更新ルールを適用することで、従来の正則化手法に比べて構造的スパarsityをより効果的に実現できるか?
  • RQ3提案手法が、ResNet-50のような標準的なCNNで顕著なFLOPs削減を達成しながら、元の精度を維持できるか?
  • RQ4記憶と忘却の独立的学習という神経生物学的アナロジーは、エンドツーエンドのファインチューニングに比べて、プルーニング性能をどのように向上させるか?
  • RQ5再訓練なしに、他のアーキテクチャやデータセットへ一般化できる範囲はどの程度か?

主な発見

  • 提案手法により、ResNet-50でFLOPsを43.9%削減し、ImageNet上でのトップ1精度に低下は認めず、76.15%を維持した。
  • 性能の劣化を伴わず効果的なチャネルプルーニングを可能にする、新しい勾配リセットメカニズムを介して構造的スパarsityを実現した。
  • 記憶と忘却の学習の分離により、ネットワークは表現能力を維持しつつ、効率的なプルーニングが可能になった。
  • プルーニングプロセス中に性能が劣化するのを回避するため、従来の正則化ベースのプルーニング手法に比べて優れた性能を示した。
  • 再パラメータ化されたモデルは、同等の性能を有する標準的で狭いCNNアーキテクチャに変換可能であり、リソース制限のある環境でのデプロイが可能になった。
  • 標準ベンチマークにおいて有効であることが実証され、アーキテクチャの再パラメータ化と標的の勾配更新を組み合わせることで、損失なしプルーニングが達成可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。