Skip to main content
QUICK REVIEW

[論文レビュー] Effective Sparsification of Neural Networks with Global Sparsity Constraint

Xiao Zhou, Weizhong Zhang|arXiv (Cornell University)|May 3, 2021
Advanced Neural Network Applications参考文献 41被引用数 4
ひとこと要約

本稿では、確率をグローバル基準として用いることで、全層にわたり重みの重要度とスパarsityレベルを自動的に決定する、新しいネットワークスパース化手法ProbMaskを提案する。手動でのプルーニングレートチューニングを回避する。プルーニングを確率空間上の連続最適化問題として定式化し、グローバルスパarsity制約を課し、Gumbel-Softmaxのテクニックを用いることで、特に高スパarsity率において最先端の精度を達成する。ImageNetではトップ1精度で、先行手法に比べ最大10%の優位性を示す。

ABSTRACT

Weight pruning is an effective technique to reduce the model size and inference time for deep neural networks in real-world deployments. However, since magnitudes and relative importance of weights are very different for different layers of a neural network, existing methods rely on either manual tuning or handcrafted heuristic rules to find appropriate pruning rates individually for each layer. This approach generally leads to suboptimal performance. In this paper, by directly working on the probability space, we propose an effective network sparsification method called {\it probabilistic masking} (ProbMask), which solves a natural sparsification formulation under global sparsity constraint. The key idea is to use probability as a global criterion for all layers to measure the weight importance. An appealing feature of ProbMask is that the amounts of weight redundancy can be learned automatically via our constraint and thus we avoid the problem of tuning pruning rates individually for different layers in a network. Extensive experimental results on CIFAR-10/100 and ImageNet demonstrate that our method is highly effective, and can outperform previous state-of-the-art methods by a significant margin, especially in the high pruning rate situation. Notably, the gap of Top-1 accuracy between our ProbMask and existing methods can be up to 10\%. As a by-product, we show ProbMask is also highly effective in identifying supermasks, which are subnetworks with high performance in a randomly weighted dense neural network.

研究の動機と目的

  • ニューラルネットワークスパース化における、各層に特有の最適なプルーニングレートを設定する課題に取り組む。これは手動で行うと困難であり、最適でない。
  • すべての層にわたって一貫性のある、重みの重要度を測るグローバルで比較可能な基準を確立する。これは、マグニチュードベースや正規化スコアベースの手法に起因する制限を克服する。
  • 各層のプルーニングレートの手動チューニングの必要性を排除する。確率空間におけるグローバルスパarsity制約を通じて、冗長性予算を自動で学習する。
  • 特に大規模データセット(ImageNetなど)において顕著に見られる、訓練時とテスト時の性能差を是正する。
  • ランダムに初期化されたネットワーク内で、高性能なサブネットワーク(スーパーマスク)を効果的に同定する。

提案手法

  • 各マスク要素を学習可能な確率を持つベルヌーイ確率変数として扱う確率空間上での連続的最適化問題として、ネットワークプルーニングを定式化する。
  • 全確率の合計を制限するグローバルスパarsity制約を導入し、全体のモデルスパarsityを制御する。これにより、各層における自動的な冗長性検出が可能になる。
  • Gumbel-Softmaxの再パrameter化テクニックを用いて、確率パラメータの微分可能訓練を可能にし、離散的マスクサンプリングを通じたバックプロパゲーションを可能にする。
  • Gumbel-Softmaxの温度パrameterにアニーリングスケジュールを適用し、確率が0または1に収束するように促進し、決定的でスパースなマスクを形成する。
  • 確率空間にℓ₁正則化を適用することで、スパarsityを促進し、低分散かつ決定的なマスクへの収束を改善する。
  • 最終的なマスクをスパースでバイナリなネットワークとして扱い、再訓練なしに効率的な推論を可能にする。

実験結果

リサーチクエスチョン

  • RQ1確率は、深層ニューラルネットワークの異なる層において、重みの重要度をグローバルに比較可能な指標として機能できるか?
  • RQ2確率空間におけるグローバルスパarsity制約は、層別の均一なスパarsity制約に比べ、特に高プルーニングレートにおいて精度で優れているか?
  • RQ3提案手法は、手動チューニングなしに、各層に適切なスパarsity予算を自動で学習できるか?
  • RQ4ProbMaskは、大規模データセットにおいて先行手法で観察された訓練時とテスト時の性能差を是正できるか?
  • RQ5ProbMaskは、ランダムに初期化された密度型ネットワーク内で、高精度なスーパーマスクを効果的に同定できるか?

主な発見

  • ImageNetにおけるResNet50を用いた99.9%のプルーニング率でも、ProbMaskはトップ1精度74.68%を達成し、先行SOTA手法を最大10ポイント上回る。
  • CIFAR-100におけるResNet32では、ProbMaskは99.9%のプルーニング率でも高い精度を維持するが、PBWやMLPruneは崩壊する。これは、確率ベースの重要度スコアの優れたグローバル比較性を示している。
  • CIFAR-10で99.9%のプルーニング率において、確率空間におけるグローバルスパarsity制約は、層別均一スパarsityに比べ57.75%高い精度を達成し、各層の予算適応の重要性を示している。
  • CIFAR-100では、ProbMaskが初期化時重みのわずか2%の重みで構成されるスーパーマスクを同定し、重みを初期化状態に固定した状態でほぼ50%の精度を達成した。
  • 最終マスクの確率分布が、すべての層で0または1に収束していることから、トレーニング後にマスクが決定的かつスパースになることが確認された。
  • 本手法は、モデル(ResNet、VGG、DenseNet)およびデータセット(CIFAR-10/100、ImageNet)にわたり、マグニチュードベースおよびヘッセ行列ベースのプルーニングベースラインを一貫して上回る。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。