Skip to main content
QUICK REVIEW

[論文レビュー] DMCP: Differentiable Markov Channel Pruning for Neural Networks

Shaopeng Guo, Yujie Wang|arXiv (Cornell University)|May 7, 2020
Advanced Neural Network Applications参考文献 22被引用数 15
ひとこと要約

DMCPは、チャネルプルーニングをマルコフ過程としてモデル化することで、FLOPs正則化を伴うエンドツーエンドの勾配最適化を可能にする微分可能マルコフチャネルプルーニング手法を提案する。ResNetおよびMobileNetV2の両アーキテクチャにおいて、さまざまなFLOPs制約下でImageNetで最先端の精度を達成し、AMC、MetaPruning、AutoSlimなどの手法を一貫した向上幅で上回る。

ABSTRACT

Recent works imply that the channel pruning can be regarded as searching optimal sub-structure from unpruned networks. However, existing works based on this observation require training and evaluating a large number of structures, which limits their application. In this paper, we propose a novel differentiable method for channel pruning, named Differentiable Markov Channel Pruning (DMCP), to efficiently search the optimal sub-structure. Our method is differentiable and can be directly optimized by gradient descent with respect to standard task loss and budget regularization (e.g. FLOPs constraint). In DMCP, we model the channel pruning as a Markov process, in which each state represents for retaining the corresponding channel during pruning, and transitions between states denote the pruning process. In the end, our method is able to implicitly select the proper number of channels in each layer by the Markov process with optimized transitions. To validate the effectiveness of our method, we perform extensive experiments on Imagenet with ResNet and MobilenetV2. Results show our method can achieve consistent improvement than state-of-the-art pruning methods in various FLOPs settings. The code is available at https://github.com/zx55/dmcp

研究の動機と目的

  • 既存のチャネルプルーニング手法が多数のサブ構造のトレーニングと評価を必要とするスケーラビリティの制限に対処すること。
  • プルーニングされたニューラルネットワークにおける最適なサブ構造の効率的で微分可能な探索を可能にすること。
  • チャネルプルーニングを学習可能な遷移確率を持つマルコフ過程としてモデル化し、エンドツーエンド最適化を可能にすること。
  • 勾配ベース最適化を通じて、厳密なFLOPs予算下でも高精度でコンactなモデルを達成すること。

提案手法

  • チャネルプルーニングは、各状態がチャネルの保持を表し、遷移が次のチャネルを保持する確率を表すマルコフ過程としてモデル化される。
  • チャネルの保持確率(マージナル確率)は、遷移確率の積として計算され、特徴マップのスケーリング係数として学習可能となる。
  • 学習可能な遷移確率は、標準的なタスク損失とFLOPs正則化を勾配降下法でエンドツーエンド最適化される。
  • 最適化後、学習されたマルコフ過程からの期待値サンプリング(Expected Sampling)を用いて最終的なプルーニングモデルが抽出され、再びスクラッチから微調整される。
  • DARTSにおける独立した演算選択とは異なり、チャネル数の論理的依存関係(例:k+1チャネルはkチャネルを必要とする)を保持する微分可能アーキテクチャ探索をサポートする。
  • 本手法は、多数のサブ構造の繰り返しトレーニングを伴わず、効率的でスケーラブルなプルーニングを実現する。

実験結果

リサーチクエスチョン

  • RQ1チャネルプルーニングは、エンドツーエンド最適化を可能にする微分可能なマルコフ過程として効果的にモデル化可能か?
  • RQ2チャネル数の論理的依存関係(例:k+1チャネルはkチャネルを必要とする)が、微分可能なプルーニングフレームワークでどのように保持されるか?
  • RQ3微分可能なマルコフ過程は、強化学習や進化的手法に比べて、プルーニングの効率性と精度で優れているか?
  • RQ4アーキテクチャと重みの共同最適化が、プルーニングモデルの性能にどの程度向上をもたらすか?
  • RQ5本手法は、FLOPs制約が異なるMobileNetV2やResNetなど、多様なアーキテクチャに一般化可能か?

主な発見

  • ImageNetにおいて、MobileNetV2では211M FLOPsで72.2%のtop-1精度を達成し、ベースラインを1.2%上回り、AutoSlim、AMC、MetaPruningをも上回る。
  • ResNet-50では、FLOPsを44%削減(4.1Gから2.2Gに)し、精度の低下は0.4%にとどまり、76.2%のtop-1精度を達成する。
  • 59M FLOPsの条件下で、MobileNetV2では62.7%のtop-1精度を達成し、同じFLOPs設定での非プルーニングベースラインより9.6%の向上を示す。
  • スリムラブル手法でトレーニングした場合、300M FLOPsで74.6%のtop-1精度を達成し、AutoSlimを2.3%上回る。
  • アブレーションスタディの結果、アーキテクチャと重みの共同最適化は分離したトレーニングよりも優れた性能を示し、59M FLOPsで62.7%のtop-1精度を達成する。
  • 本手法は、すべてのFLOPs設定において、均一プルーニング、MetaPruning、AMC、FPGMを、MobileNetV2およびResNetアーキテクチャの両方で一貫して上回る。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。