Skip to main content
QUICK REVIEW

[論文レビュー] Layer-adaptive sparsity for the Magnitude-based Pruning

Jaeho Lee, Sejun Park|arXiv (Cornell University)|Oct 15, 2020
Advanced Neural Network Applications参考文献 45被引用数 69
ひとこと要約

LAMP はレイヤー適応の大きさベースのプルーニングスコアを導入し、レイヤーごとの歪み指標で重みをグローバルに剪定し、ハイパーパラメータ調整なしでさまざまなアーキテクチャとデータセットに対して sparsity-accuracy トレードオフを改善する。

ABSTRACT

Recent discoveries on neural network pruning reveal that, with a carefully chosen layerwise sparsity, a simple magnitude-based pruning achieves state-of-the-art tradeoff between sparsity and performance. However, without a clear consensus on "how to choose," the layerwise sparsities are mostly selected algorithm-by-algorithm, often resorting to handcrafted heuristics or an extensive hyperparameter search. To fill this gap, we propose a novel importance score for global pruning, coined layer-adaptive magnitude-based pruning (LAMP) score; the score is a rescaled version of weight magnitude that incorporates the model-level $\ell_2$ distortion incurred by pruning, and does not require any hyperparameter tuning or heavy computation. Under various image classification setups, LAMP consistently outperforms popular existing schemes for layerwise sparsity selection. Furthermore, we observe that LAMP continues to outperform baselines even in weight-rewinding setups, while the connectivity-oriented layerwise sparsity (the strongest baseline overall) performs worse than a simple global magnitude-based pruning in this case. Code: https://github.com/jaeho-lee/layer-adaptive-sparsity

研究の動機と目的

  • 手動でのチューニングを必要とせずに、マグニチュードベースの剪定のためのレイヤーごとの sparsity の標準的な手法を動機づける。
  • 実用的な剪定スコアを導くためのモデルレベルの歪み最小化の視点を開発する。
  • LAMP を提案する。ハイパーパラメータなしで、剪定時にもモデル出力の完全性を保つスコア。
  • 複数のアーキテクチャとデータセットを通じて、 weight rewinding の有無に関わらず LAMP を検証する。
  • LAMP 由来のスパース性パターンが、手作業のヒューリスティックや以前のベースラインとどう比較されるかを分析する。

提案手法

  • LAMPスコアを score(u;W) = (W[u])^2 / sum_{v>=u} (W[v])^2 として、各重みをレイヤー内で大きさ順に並べたときに適用する。
  • グローバルなスパース性制約を満たすように最小の LAMP スコアを選択してグローバル剪定を適用する。これは自動的に選択されたレイヤーごとの sparsity と等価で、マグニチュードベースの剪定と同等である。
  • 出力歪みの観点から LAMP を正当化する。層ごとの MP が緩和された Frobenius 歪み最小化を解くことを示すことで、貪欲で歪み最小化の剪定過程につながる。
  • 分母には層ごとの二乗和の累積和だけを要することで、最小限のオーバーヘッドで LAMP を計算できることを示す。
  • LAMP がハイパーパラメータ不要で、モデル特有の知識に依存しないことを示す一方、モデルレベルの歪みを良く近似する。
  • VGG-16、ResNet-18/34、DenseNet-121、EfficientNet-B0 の複数の CNN アーキテクチャを CIFAR-10/100、SVHN、および Restricted ImageNet で評価する。

実験結果

リサーチクエスチョン

  • RQ1レイヤー適応型でハイパーパラメータフリーな剪定スコアは、マグニチュードベースの剪定における既存のレイヤーごとの sparsity スキームを上回ることができるか。
  • RQ2LAMP スコアは、さまざまなアーキテクチャとデータセットにわたって剪定時のモデルレベルの出力歪みを効果的に近似するか。
  • RQ3LAMP は weight rewinding および one-shot pruning と他のベースラインと比較してどのように相互作用するか。
  • RQ4LAMP が層全体にどのような sparsity パターンを誘導するか、そしてそれが最初の層を高密度のままにするといった手作業ヒューリスティックや最後の層の sparsity 制約とどう比較されるか。

主な発見

  • LAMP は CIFAR-10 で VGG-16、ResNet-18/34、DenseNet-121、EfficientNet-B0 における sparsity-accuracy トレードオフで、ベースラインのレイヤーごとの sparsity スキームを一貫して上回る。
  • CIFAR-10 では、LAMP が重みの生存比が 1.44% のみで 88.1% のテスト精度を達成し、77.8% を達成する Erdős-Rényi カーネルを上回る。
  • LAMP も SVHN、CIFAR-100、Restricted ImageNet の実験でベースラインを上回る一方、Erdős-Rényi カーネルは一部のケースで競争力を維持。
  • LAMP は one-shot pruning と weight rewinding の下で安定して良好な性能を示す一方、Erdős-Rényi は rewinding に敏感な場合がある。
  • SNIP 設定では LAMP は Global SNIP に匹敵する性能を達成し、標準的な MP シナリオを超えた頑健性を示唆する。
  • LAMP によって誘導されるレイヤー単位の sparsity は、最初と最後の層を相対的に高密度のままに保つ傾向があり、高 sparsity で層間の非ゼロ重みの分布をより均一に促進する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。