[論文レビュー] Group Sparsity: The Hinge Between Filter Pruning and Decomposition for Network Compression
本論文は、グループスパarsityを中継ぎとして用いることで、フィルタープルーニングと低ランク分解を統合するフレームワークを提案する。可学習なスパarsity誘導行列にグループスパarsity正則化を適用することにより、列スパarsityによるプルーニングと行スパarsityによる分解の間で動的に切り替えが可能となり、CIFAR-10、CIFAR-100、ImageNetベンチマークで、精度と圧縮のトレードオフをSOTA水準にまで向上させる、統合的かつエンドツーエンド最適化が可能な手法を実現した。
In this paper, we analyze two popular network compression techniques, i.e. filter pruning and low-rank decomposition, in a unified sense. By simply changing the way the sparsity regularization is enforced, filter pruning and low-rank decomposition can be derived accordingly. This provides another flexible choice for network compression because the techniques complement each other. For example, in popular network architectures with shortcut connections (e.g. ResNet), filter pruning cannot deal with the last convolutional layer in a ResBlock while the low-rank decomposition methods can. In addition, we propose to compress the whole network jointly instead of in a layer-wise manner. Our approach proves its potential as it compares favorably to the state-of-the-art on several benchmarks.
研究の動機と目的
- ニューラルネットワーク圧縮のための統合的最適化フレームワークを構築し、フィルタープルーニングと低ランク分解を統合する。
- 残差接続を持つ残差ネットワークにおけるフィルタープルーニングの限界、特にResBlock内の最後の畳み込み層をプルーニングするとスキップ接続が破壊されることを解決する。
- 層ごとの圧縮ではなく、全ネットワークを統合的に圧縮することで、全体的なモデル効率を向上させる。
- プルーニング(パrameter削減)と分解(計算量削減)の相補的利点を、柔軟な統合的メカニズムで活用する。
- 複数のベンチマークで、精度とFLOP削減の両面でSOTAの性能を達成する。
提案手法
- フィルタープルーニングと分解の間を中継する役割を果たす、可学習なスパarsity誘導行列Aを導入し、その列または行にグループスパarsityを適用する。
- 行列Aの列にグループスパarsity正則化を適用することで、出力チャネル数を削減し、行列積W × A^cによるフィルタープルーニングと同等の効果を発揮する。
- 行列Aの行にグループスパarsity正則化を適用することで、内部次元数を削減し、2つの軽量畳み込み層W^rとA^rによる低ランク分解を可能にする。
- プロキシマル勾配降下法を用い、適応的学習率、層バランス、正則化係数の冷却を組み合わせて最適化問題を解く。
- 微調整段階で知識蒸留を採用し、圧縮中に精度を維持する。
- 層ごとの圧縮ではなく、全ネットワークを統合的に最適化することで、グローバルな圧縮効率を向上させる。
実験結果
リサーチクエスチョン
- RQ1フィルタープルーニングと低ランク分解を、単一の最適化フレームワークで統合可能か?
- RQ2スパarsity誘導行列におけるグループスパarsityが、プルーニングモードと分解モードの間で動的に切り替えを可能にする仕組みは何か?
- RQ3全ネットワークを統合的にエンドツーエンドで圧縮することで、層ごとの圧縮戦略を上回る性能が得られるか?
- RQ4本手法は、スキップ接続を持つ層において、フィルタープルーニングの限界を克服できるか?
- RQ5正則化タイプと冷却戦略の影響は、圧縮性能と一般化性能にどのように現れるか?
主な発見
- CIFAR-10では、50%の圧縮比でTop-1誤差率6.37%を達成し、SSS(25.82%)や他のSOTA手法を上回った。
- CIFAR-100のResNet-164では、正則化の冷却を適用した本手法が、知識蒸留なしでもCGESやSSSを上回る性能を示した。
- ImageNet-2012では、Top-1誤差率とFLOP圧縮比の両面でSOTAのトレードオフを達成し、KSE や SSS より優れた性能を発揮した。
- アブレーションスタディの結果、ℓ₁正則化(T=0.005、α=0.01)が最も優れた性能を示し、ハイパーパrameterの変化に極めて感受性が低かった。
- VGGとDenseNetでは、類似した圧縮比下で、それぞれ0.41%および1.51%のTop-1誤差率の低減を達成し、先行研究を上回った。
- FLOPとパラメータ削減は、KSEと比較してすべての圧縮レベルで顕著に優れており、同等の誤差率下でより低いFLOPsを達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。