Skip to main content
QUICK REVIEW

[論文レビュー] Sparse Model Soups: A Recipe for Improved Pruning via Model Averaging

Max Zimmer, Christoph Spiegel|arXiv (Cornell University)|Jun 29, 2023
Advanced Neural Network ApplicationsComputer Science被引用数 3
ひとこと要約

この論文では、再訓練中に学習率スケジュールや重み減衰などの異なるハイパーパrameterを用いて訓練された複数のprunedモデルを平均化することで、反復的マグニチュードプルーニング(IMP)を向上させるSparse Model Soups(SMS)という手法を紹介している。モデル間で同一のスパース接続性を保証することで、SMSはスパarsityを維持したまま一般化性能と分布外性能を著しく向上させ、個々のprunedモデルや標準的なIMPよりも優れており、訓練時間も短縮される。

ABSTRACT

Neural networks can be significantly compressed by pruning, yielding sparse models with reduced storage and computational demands while preserving predictive performance. Model soups (Wortsman et al., 2022) enhance generalization and out-of-distribution (OOD) performance by averaging the parameters of multiple models into a single one, without increasing inference time. However, achieving both sparsity and parameter averaging is challenging as averaging arbitrary sparse models reduces the overall sparsity due to differing sparse connectivities. This work addresses these challenges by demonstrating that exploring a single retraining phase of Iterative Magnitude Pruning (IMP) with varied hyperparameter configurations such as batch ordering or weight decay yields models suitable for averaging, sharing identical sparse connectivity by design. Averaging these models significantly enhances generalization and OOD performance over their individual counterparts. Building on this, we introduce Sparse Model Soups (SMS), a novel method for merging sparse models by initiating each prune-retrain cycle with the averaged model from the previous phase. SMS preserves sparsity, exploits sparse network benefits, is modular and fully parallelizable, and substantially improves IMP's performance. We further demonstrate that SMS can be adapted to enhance state-of-the-art pruning-during-training approaches.

研究の動機と目的

  • プルーディッドニューラルネットワークにおけるモデル平均化とスパarsityの統合の課題に取り組む。
  • 推論コストを増加させることなく一般化性能と分布外性能を向上させる。
  • 複数の再訓練済みモデル間で共有される同一のスパース接続性パターンを再利用することで、スパースモデルの効率的かつ並列可能な訓練を可能にする。
  • IMP中に異なるハイパーパrameterを用いた再訓練が、スパarsityを維持したまま平均化に適したモデルを生成することを示す。
  • 平均化されたモデルから次のプルーニングサイクルを初期化することで、性能がさらに向上することを示す。

提案手法

  • 同一の初期重みを用い、学習率スケジュールや重み減衰などの異なるハイパーパrameterを用いて、反復的マグニチュードプルーニング(IMP)で複数のprunedモデルを訓練する。
  • 再訓練前にプルーニングを適用することで、すべてのモデルが同じスパース接続性パターンを持つように保証し、直接的なパラメータ平均化を可能にする。
  • 複数の再訓練済みモデルのパラメータを平均化することで単一のスパースモデルを構築し、スパarsityと推論効率性を維持する。
  • 各次のプルーニングサイクルを、以前に平均化されたモデルから開始することで、段階的な性能向上を実現する。
  • 収束性と安定性を確保するため、一貫した再訓練スケジュール(例:ALLR)を用いる。
  • アプローチのモジュール型かつ並列処理可能な性質を活用し、推論コストを増加させることなく複数モデルにスケーリング可能である。

実験結果

リサーチクエスチョン

  • RQ1スパース構造を保ちつつ、スパarsityを損なわず、推論コストを増加させずにモデル平均化をプルーディッドニューラルネットワークに効果的に統合できるか?
  • RQ2異なるハイパーパrameterで訓練された複数のprunedモデルを平均化することで、個々のモデルと比較して一般化性能と分布外性能が向上するか?
  • RQ3平均化されたモデルから次のプルーニングサイクルを初期化することで、反復的マグニチュードプルーニングの性能を向上させられるか?
  • RQ4再訓練中にどのようなハイパーパramータ設定が、平均化に適した十分な多様性と同一のスパース接続性を両立させるか?
  • RQ5再訓練の長さとスケジュールは、最終的なスパースモデルスープの性能にどのように影響するか?

主な発見

  • Sparse Model Soups(SMS)は、95%のスパarsityでCIFAR-100で99.52%のテスト精度を達成し、同じ条件下で標準的なIMP(98.79%)を上回る。
  • 97%のスパarsityでもSMSは97.68%の精度を達成したが、IMPは98.90%であった。これは、高スパarsityレベルでも一貫した性能向上を示している。
  • 同じ期間を再訓練する個々のモデルと比較して、訓練時間を短縮できる。これは、複数のモデルが共有される接続性を介して並列に訓練されるためである。
  • アブレーションスタディの結果、適切な学習率スケジュール(例:ALLR)と組み合わせると、単一の再訓練エポックでも顕著な改善が得られることが分かった。
  • 再訓練中に学習率スケジュールや重み減衰などの多様なハイパーパラメータを用いることで、平均化に適した十分な類似性と、一般化性能の向上に寄与する多様性を備えたモデルが得られる。
  • 平均化されたモデルから次のプルーニングサイクルを初期化することで、その後の再訓練フェーズで性能が向上することが示され、このアプローチの段階的利点(カスケード効果)が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。