[論文レビュー] The Emergence of Essential Sparsity in Large Pre-trained Models: The Weights that Matter
本論文は、大規模事前学習トランスフォーマーにおける「本質的スパarsity(essential sparsity)」— 一括プルーニングで最小の重みを削除すると、臨界スパarsity閾値を超えると急激な性能低下が発生する現象—を導入する。著者らは、再訓練を経ずに、高品質なスパースサブネットワークが密度のあるチェックポイント内に存在することを示し、これにより、現代の大規模言語モデル(例:Vicuna-7B)でさえも、無料で転送可能なプルーニングが可能であることを示している。
Large pre-trained transformers are show-stealer in modern-day deep learning, and it becomes crucial to comprehend the parsimonious patterns that exist within them as they grow in scale. With exploding parameter counts, Lottery Ticket Hypothesis (LTH) and its variants, have lost their pragmatism in sparsifying them due to high computation and memory bottleneck of repetitive train-prune-retrain routine of iterative magnitude pruning (IMP) which worsens with increasing model size. This paper comprehensively studies induced sparse patterns across multiple large pre-trained vision and language transformers. We propose the existence of -- essential sparsity defined with a sharp dropping point beyond which the performance declines much faster w.r.t the rise of sparsity level, when we directly remove weights with the smallest magnitudes in one-shot without re-training. We also find essential sparsity to hold valid for N:M sparsity patterns as well as on modern-scale large language models (Vicuna-7B). We also present an intriguing emerging phenomenon of abrupt sparsification during the pre-training of BERT, i.e., BERT suddenly becomes heavily sparse in pre-training after certain iterations. Moreover, our observations also indicate a counter-intuitive finding that BERT trained with a larger amount of pre-training data tends to have a better ability to condense knowledge in comparatively relatively fewer parameters. Lastly, we investigate the effect of the pre-training loss on essential sparsity and discover that self-supervised learning (SSL) objectives trigger stronger emergent sparsification properties than supervised learning (SL). Our codes are available at \url{https://github.com/VITA-Group/essential_sparsity}.
研究の動機と目的
- 大規模事前学習トランスフォーマーに、これまで無視されてきた構造的性質「本質的スパarsity」を同定・検証すること。
- 一括マグニチュードプルーニングにより、最小の重みを削除することで、再訓練を経ずに高品質なスパースサブネットワークを同定できることを示すこと。
- 本質的スパarsityが、Vicuna-7Bのような現代の大規模言語モデルを含む多様なアーキテクチャにわたって成立するかを調査すること。
- 特にBERTにおいて、事前学習の過程でスパース化がどのように出現するかを調査し、事前学習データと損失目的関数との関係を分析すること。
- ワンショットプルーニング(OMP)と反復的マグニチュードプルーニング(LTH)の性能を比較し、下流タスク間での転送性を評価すること。
提案手法
- 一括マグニチュードプルーニング(OMP)において、性能低下が急激に進行する臨界スパarsity閾値として「本質的スパarsity」を提唱する。
- 微調整や再訓練を一切行わず、最小の重みを持つ重みを削除することで、事前学習済みチェックポイントにOMPを適用する。
- 下流タスクでの性能を、プルーニングされたサブネットワークを用いて評価し、OMPとランセット・チケット仮説(LTH)およびSparseGPTを比較する。
- データサイズと事前学習目的関数を変化させることで、BERTにおけるスパース化の出現を分析するアブレーションスタディを実施する。
- LTHとOMPのプルーニングマスク間のコサイン類似度を用いて、タスク間でのマスク類似度と転送性を評価する。
- Vicuna-7Bに対して、OMPおよびSparseGPTによるプルーニング後にMMLUベンチマークを用いてゼロショット性能を評価し、現代の大規模言語モデル(LLM)における本質的スパarsityの有効性を検証する。

実験結果
リサーチクエスチョン
- RQ1本質的スパarsityは、大規模事前学習トランスフォーマー(視覚・自然言語処理)に存在するか? また、下流タスク間で転送可能か?
- RQ2ワンショットマグニチュードプルーニング(OMP)は、反復的トレーニング(LTH)で得られるものと同等の高品質なスパースサブネットワークを同定できるか?
- RQ3BERTの事前学習中にスパース化が急激に出現するか? もし出現するならば、いつ、なぜそうなるか?
- RQ4事前学習データ量が、モデルが少ないパラメータに知識を凝縮する能力に与える影響は?
- RQ5自己教師あり学習(SSL)目的関数は、教師あり学習(SL)目的関数よりも強い発現的スパース化を引き起こすか?
主な発見
- 本質的スパarsityは、ViT、BERT、Vicuna-7Bを含む多様な大規模事前学習モデルに共通して存在し、臨界スパarsity閾値を超えると急激な性能低下が発生する。
- スパarsityが50%未満の範囲では、ワンショットマグニチュードプルーニング(OMP)がLTHと同等の性能を達成しており、再訓練を経ずに、密度のあるチェックポイント内に高品質なスパースサブネットワークが存在することを示している。
- 本質的スパarsity範囲において、OMPとLTHのマスク間のコサイン類似度が高く、OMPが追加コストなしに類似した転送可能なサブネットワークを同定していることが示唆されている。
- BERTは、事前学習の過程で急激なスパース化を示し、ある一定の訓練イテレーション数を経て、急激にスパースな構造へと変化する。これは、動的かつ構造的な出現を示している。
- より大きなデータセットで事前学習されたモデルは、少ないパラメータに知識を凝縮する能力が高いため、パラメータ効率が向上していることが示唆される。
- 自己教師あり学習(SSL)目的関数は、教師あり学習(SL)目的関数よりも強い発現的スパース化を誘発しており、SSLがより内蔵されたスパarsityを促進していることが示唆されている。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。