Skip to main content
QUICK REVIEW

[論文レビュー] Neural Pruning via Growing Regularization

Huan Wang, Can Qin|arXiv (Cornell University)|Dec 16, 2020
Domain Adaptation and Few-Shot Learning参考文献 63被引用数 4
ひとこと要約

本論文は、L2正則化の強度を徐々に増加させる成長型正則化アプローチを提案し、ニューラルネットワークの prune における性能向上を図るものであり、pruning スケジュールと重みの重要度スコアリングの両方を改善する。明示的なヘシアン計算を伴わずにヘシアンに起因する大きさの分離を活用することで、CIFAR-10/100 および ImageNet における構造的・非構造的 prune において、最先端の精度を達成する。

ABSTRACT

Regularization has long been utilized to learn sparsity in deep neural network pruning. However, its role is mainly explored in the small penalty strength regime. In this work, we extend its application to a new scenario where the regularization grows large gradually to tackle two central problems of pruning: pruning schedule and weight importance scoring. (1) The former topic is newly brought up in this work, which we find critical to the pruning performance while receives little research attention. Specifically, we propose an L2 regularization variant with rising penalty factors and show it can bring significant accuracy gains compared with its one-shot counterpart, even when the same weights are removed. (2) The growing penalty scheme also brings us an approach to exploit the Hessian information for more accurate pruning without knowing their specific values, thus not bothered by the common Hessian approximation problems. Empirically, the proposed algorithms are easy to implement and scalable to large datasets and networks in both structured and unstructured pruning. Their effectiveness is demonstrated with modern deep neural networks on the CIFAR and ImageNet datasets, achieving competitive results compared to many state-of-the-art algorithms. Our code and trained models are publicly available at https://github.com/mingsuntse/regularization-pruning.

研究の動機と目的

  • 性能に顕著な影響を与えるが、研究の注目が薄いニューラルネットワーク prune における pruning スケジュールの未解明な問題に取り組む。
  • 明示的なヘシアン計算や近似を必要とせずに、ヘシアン情報を利用した正確な重みの重要度スコアリングの手法を開発する。
  • スケーラブルで実装が簡単な正則化スキームを通じて、prune 中のモデル表現力の向上を実現し、効果的な非構造的および構造的 prune を可能にする。
  • 成長型正則化を組み合わせることで、大きさに基づく prune がヘシアンに基づく prune の性能に達成できることを示し、2つの主要な prune パラダイムを統合する。

提案手法

  • 固定された小さな値に保つのではなく、訓練中に徐々に増加する L2 正則化係数を採用する成長型 L2 正則化スキームを提案する。
  • 増加する正則化により、重要でない重みがゼロに近づくように促し、単純な大きさ基準による正確な prune が可能になる。
  • 重みの局所的二次構造(ヘシアン)を暗黙的に活用する:曲率が大きい重みはより強く正則化され、大きさの分離が向上する。
  • 2つの変種を設計する:GReg-1 は構造的 prune(フィルターレベル)用、GReg-2 は非構造的 prune 用であり、両者とも増加する L2 正則化を採用する。
  • 公平な比較のため、標準的な訓練プロトコルに従い、小規模(CIFAR)および大規模(ImageNet)のデータセットに適用する。
  • ヘシアンの近似を回避し、成長型正則化の自然なダイナミクスに依存して、重み間の曲率差を反映させる。

実験結果

リサーチクエスチョン

  • RQ1固定された正則化によるワンショット prune と比較して、成長型正則化スケジュールが prune 性能を顕著に向上させられるか?
  • RQ2明示的なヘシアン計算や近似を必要とせず、成長型正則化がヘシアン情報を暗黙的に活用して重みの重要度スコアリングに寄与できるか?
  • RQ3提案手法は、大規模ベンチマークにおける最先端の構造的および非構造的 prune 手法と比較して、競争力あるか、優れた精度を達成できるか?
  • RQ4pruning スケジュールは、最終的なモデル性能を決定づける要因として、重みの重要度基準と同等に重要であるか?
  • RQ5成長型正則化フレームワークを用いることで、大きさに基づく prune がヘシアンに基づく prune の性能に達成できるか?

主な発見

  • ImageNet における ResNet50 で約 2.5× の高速化を達成した場合、GReg-2 はトップ-1 精度 74.93% を達成し、Taylor-FO(71.69%)を 3.24 パcent 点上回り、最高性能を記録した。
  • ImageNet で約 3× の高速化を達成した場合、GReg-2 はトップ-1 精度 73.90% を達成し、Taylor-FO よりも 2.23 パcent 点優れており、より高いスパarsity でも優れた性能を示した。
  • CIFAR-100 で 2.5× の高速化を達成した場合、GReg-2 はトップ-1 精度 74.85% を達成し、ベースラインを 1.28 パcent 点上回り、最先端の手法と同等またはそれを上回った。
  • ImageNet における非構造的 prune では、GReg-2 が 82.7% のスパarsity でトップ-1 精度 75.45% を達成し、Hessian 近似を用いないにもかかわらず、WoodFisher(75.20%)を精度で上回り、低下量(drop)は同等だった。
  • より単純なバージョンである GReg-1 は、82.7% のスパarsity でトップ-1 精度 75.45% を達成し、改善された pruning スケジュールそのものでも強力な性能を示した。
  • 本手法は、構造的および非構造的 prune の両方でスケーラブルかつ効果的であり、複雑なヘシアン推定や反復的再訓練の必要がなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。