Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Prune Deep Neural Networks via Reinforcement Learning

Manas Gupta, Siddharth Aravindan|arXiv (Cornell University)|Jul 9, 2020
Advanced Neural Network Applications参考文献 14被引用数 7
ひとこと要約

この論文では、各 pruning ステップで密集した報酬を用いる強化学習ベースの手法 PuRL を提案する。これにより、トレーニングの高速化とサンプル効率の向上が図られる。PuRL は、ImageNet で Top-1 精度 75.37% を達成しながら、ResNet-50 で 80.27% のスパarsity を実現し、RL トレーニングエピソード数を AMC の 400 からわずか 55 に削減した。性能は最先端水準に達している。

ABSTRACT

This paper proposes PuRL - a deep reinforcement learning (RL) based algorithm for pruning neural networks. Unlike current RL based model compression approaches where feedback is given only at the end of each episode to the agent, PuRL provides rewards at every pruning step. This enables PuRL to achieve sparsity and accuracy comparable to current state-of-the-art methods, while having a much shorter training cycle. PuRL achieves more than 80% sparsity on the ResNet-50 model while retaining a Top-1 accuracy of 75.37% on the ImageNet dataset. Through our experiments we show that PuRL is also able to sparsify already efficient architectures like MobileNet-V2. In addition to performance characterisation experiments, we also provide a discussion and analysis of the various RL design choices that went into the tuning of the Markov Decision Process underlying PuRL. Lastly, we point out that PuRL is simple to use and can be easily adapted for various architectures.

研究の動機と目的

  • 強化学習を用いた自動化されたニューラルネットワーク pruning を実現し、効率性とスケーラビリティを向上させること。
  • エピソード終了時にのみ与えられるスパース報酬に依存する従来の RL ベースの pruning 手法の収束遅さを解決すること。
  • 密集報酬と効率的な行動空間を備えたマルコフ意思決定過程 (MDP) を設計し、より速く効果的な pruning ポリシーの学習を可能にすること。
  • ResNet-50、MobileNet-V2、EfficientNet-B2 など多様なアーキテクチャにおいて PuRL を評価し、汎用性と容易な適応性を示すこと。
  • MDP の各構成要素(状態、行動、報酬)に対するアブレーションスタディを提供し、将来の RL ベースの pruning 設計を支援すること。

提案手法

  • 状態、行動、報酬、遷移、割引率を備えたマルコフ意思決定過程 (MDP) としてネットワーク pruning を定式化する。
  • 各 pruning ステップ後にフィードバックを提供する密集報酬関数を用い、エピソード終了時の報酬に比べてより速いポリシー学習を可能にする。
  • 重みの標準偏差に基づく閾値を用いたマグニチュードベースの pruning 原則を採用:|w| < ασ(w) を満たす重みを pruning する。
  • α 値(例:0.0, 0.1, ..., 2.2)に対する離散的行動空間を導入し、探索の複雑さを軽減するためにステップサイズを 0.2 まで増加させる実験を実施。
  • 段階的なスパarsity 目標と微調整を繰り返し行うイテレーティブ pruning を採用し、圧縮中に精度を維持する。
  • 2 種類の状態表現を採用:低次元のタプル(レイヤーインデックス、精度、pruned 比率)と、各レイヤーの精度およびスパarsity を表す高次元ベクトル。

実験結果

リサーチクエスチョン

  • RQ1エピソードの途中で密集報酬を提供することで、スパース報酬に比べて学習効率と収束速度が顕著に向上するか?
  • RQ2異なる状態表現が、エージェントが効果的な pruning ポリシーを学習する能力に与える影響は何か?
  • RQ3行動空間の行動数を減らすことで、より良い探索とポリシー学習が可能となり、性能向上が達成できるか?
  • RQ4提案手法は、MobileNet-V2 や EfficientNet-B2 といった効率的なモデルを含む、さまざまなニューラルネットワークアーキテクチャにどれほど汎用的に適応できるか?
  • RQ5報酬形状、行動空間設計、状態表現の相対的な影響が、最終的なスパarsity と精度に与える影響は何か?

主な発見

  • PuRL は、ResNet-50 において AMC の 400 エピソードから 55 エピソードに削減し、競争力のある精度を維持しながら 85% 少ないエピソード数を実現した。
  • 密集報酬は、スパース報酬に比べて最終精度を 24 パーセンテージポイント、スパarsity を 4 パーセンテージポイント向上させ、学習効率の優位性を示した。
  • 行動ステップサイズを 0.2(0.1 ではなく)に増加させた場合、ベースラインに比べてスパarsity と精度の両方を向上させるパレート支配解が得られた。
  • PuRL は、ResNet-50 で 80.27% のスパarsity を達成し、ImageNet で 75.37% の Top-1 精度を記録し、最先端の性能に一致した。
  • 効率的アーキテクチャへの汎用性も良好である:PuRL は、ハイパーパramータチューニングなしで、MobileNet-V2 および EfficientNet-B2 において AMC よりも 1.5 倍以上のスパarsity を達成した。
  • アブレーションスタディにより、密集報酬と縮小された行動空間が、速い収束と高い性能に不可欠であることが確認された。状態表現の選択の影響は最小限であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。