Skip to main content
QUICK REVIEW

[論文レビュー] Directional Pruning of Deep Neural Networks

Shih-Kang Chao, Zhanyu Wang|arXiv (Cornell University)|Jun 16, 2020
Advanced Neural Network Applications参考文献 56被引用数 12
ひとこと要約

本稿では、勾配降下法の解におけるヘッセ行列のほぼゼロ固有値に対応する固有ベクトルの張る部分空間(平坦な最小値の谷)内に、スパースな最小化子を特定するための新しい手法、方向的 pruning を提案する。この手法は、近接勾配法を用いて再訓練を必要とせずに、最大92%のスパースさを達成可能であり、SGDと比較して最小限の計算コストで、ImageNet における ResNet50 で最先端の性能を達成する。

ABSTRACT

In the light of the fact that the stochastic gradient descent (SGD) often finds a flat minimum valley in the training loss, we propose a novel directional pruning method which searches for a sparse minimizer in or close to that flat region. The proposed pruning method does not require retraining or the expert knowledge on the sparsity level. To overcome the computational formidability of estimating the flat directions, we propose to use a carefully tuned $\ell_1$ proximal gradient algorithm which can provably achieve the directional pruning with a small learning rate after sufficient training. The empirical results demonstrate the promising results of our solution in highly sparse regime (92% sparsity) among many existing pruning methods on the ResNet50 with the ImageNet, while using only a slightly higher wall time and memory footprint than the SGD. Using the VGG16 and the wide ResNet 28x10 on the CIFAR-10 and CIFAR-100, we demonstrate that our solution reaches the same minima valley as the SGD, and the minima found by our solution and the SGD do not deviate in directions that impact the training loss. The code that reproduces the results of this paper is available at https://github.com/donlan2710/gRDA-Optimizer/tree/master/directional_pruning.

研究の動機と目的

  • 再訓練や専門家が定めたスパース性の閾値を必要とせずに、深層ニューラルネットワークの pruning を行う課題に対処すること。
  • 訓練損失への影響を最小限に抑えるために、損失関数の平坦な最小値の谷内に位置するスパースモデルを特定すること。
  • 特にヘッセ行列の小さな固有値に関連する平坦な方向に注目し、損失関数の局所的幾何構造を活用する pruning 方法を開発すること。
  • 特にリソース制約のあるデプロイメント環境において、モデルの精度を維持したまま高いスパース性(例:92%)を達成すること。
  • 再訓練を回避し、収束性が保証された修正された最適化スキームを用いることで、計算コストを最小限に抑えること。

提案手法

  • 本手法は、平坦な方向の部分空間内での摂動として pruning を定式化する。この部分空間は、SGD 解におけるヘッセ行列のほぼゼロ固有値に対応する固有ベクトルの張る空間として定義される。
  • 損失を維持する方向にパラメータを段階的に縮小するため、ℓ₁正則化項を含む近接勾配法を用いる。これにより摂動が平坦領域内に保たれる。
  • 重要なステップは、訓練済み重みの符号ベクトルを平坦部分空間に射影することであり、これにより損失の増加を最小限に抑える方向ベクトルが得られ、pruning をガイドする。
  • アルゴリズムは、ソフトスレッショルド処理と小さな学習率を組み合わせた修正された最適化手法 gRDA を通じて実装され、平坦な谷内のスパース解への収束が保証される。
  • pruning 方向が平坦部分空間内にあることを保証することで、再訓練を回避し、pruning 中に損失が安定する。
  • 理論的にも根拠がある:摂動方向は重みの符号ベクトルとのℓ₂距離を最小化するように選ばれ、安全に削除可能なパラメータの数を最大化する。

実験結果

リサーチクエスチョン

  • RQ1再訓練を必要とせずに、損失関数の平坦な最小値の谷内に位置するスパースモデルを特定できるか?
  • RQ2スパース化中に訓練損失の増加を最小化する最適な pruning 方向は何か?
  • RQ3ResNet50 を用いた ImageNet で、92%程度の高いスパース性を達成しながらも、モデルの精度を維持できるか?
  • RQ4本手法の計算コストは、標準的な SGD と比較して、ウォールタイムおよびメモリ使用量の観点でどの程度か?
  • RQ5pruned モデルは SGD と同じ最小値に到達するのか? また、損失と一般化誤差は保持されるか?

主な発見

  • 提案手法である方向的 pruning は、ImageNet における ResNet50 で92%のスパース性を達成しながら、完全なモデルと同等のテスト精度を維持し、特に極めてスパースな領域において既存手法を上回る性能を示した。
  • CIFAR-10 における VGG16 および CIFAR-100 における WRN28x10 でも、本手法は SGD と同等の最小値に到達し、損失やテスト誤差に顕著なずれは認められなかった。
  • gRDA 最適化手法はウォールタイムでわずか15%程度の遅延(SGD よりもやや遅い)と、最小限の追加メモリ使用量で実行され、gRDA と SGD 間のピーク GPU メモリ使用量の差は1標準偏差未満であった。
  • 符号ベクトルをヘッセ行列の核部分空間に射影した結果、パラメータが平坦部分空間に沿って適切に削除されていることが確認され、損失の増加が最小限に抑えられた。
  • 実験的結果から、pruned モデルは一般化性能を維持しており、複数のアーキテクチャおよびデータセットにおいて、gRDA と SGD のテスト誤差曲線がほぼ完全に重なっていた。
  • コードは公開されており、方向的 pruning の手法の再現性とさらなるベンチマークが可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。