[論文レビュー] Lottery Jackpots Exist in Pre-trained Models
この論文は、VGGNet-19 や ResNet-50 などの展開されていない事前学習済みモデル内に、重みの微調整を必要とせずに存在する高精度でスパースな部分ネットワーク(『ロトスジャックポット』)を導入する。マグニチュードに基づくマスク初期化と、効率的なマスク探索のための新しい短い制限機構を活用することで、ImageNet で 5 エポック未満で最大 90% のパラメータ削減を達成し、最先端の精度を実現。従来の手法と比較して、 pruning コストを顕著に低減する。
Network pruning is an effective approach to reduce network complexity with acceptable performance compromise. Existing studies achieve the sparsity of neural networks via time-consuming weight training or complex searching on networks with expanded width, which greatly limits the applications of network pruning. In this paper, we show that high-performing and sparse sub-networks without the involvement of weight training, termed "lottery jackpots", exist in pre-trained models with unexpanded width. Furthermore, we improve the efficiency for searching lottery jackpots from two perspectives. Firstly, we observe that the sparse masks derived from many existing pruning criteria have a high overlap with the searched mask of our lottery jackpot, among which, the magnitude-based pruning results in the most similar mask with ours. Consequently, our searched lottery jackpot removes 90% weights in ResNet-50, while it easily obtains more than 70% top-1 accuracy using only 5 searching epochs on ImageNet. In compliance with this insight, we initialize our sparse mask using the magnitude-based pruning, resulting in at least 3x cost reduction on the lottery jackpot searching while achieving comparable or even better performance. Secondly, we conduct an in-depth analysis of the searching process for lottery jackpots. Our theoretical result suggests that the decrease in training loss during weight searching can be disturbed by the dependency between weights in modern networks. To mitigate this, we propose a novel short restriction method to restrict change of masks that may have potential negative impacts on the training loss. Our code is available at https://github.com/zyxxmu/lottery-jackpots.
研究の動機と目的
- 重みの微調整を必要とせずに、事前学習済みモデル内に高精度でスパースな部分ネットワーク(ロトスジャックポット)が存在するかどうかを調査すること。
- 従来の手法では計算コストが高いため、このような部分ネットワークの探索コストを低減すること。
- マスク更新のためのより良い初期化と動的制限機構を導入することで、ロトスジャックポット探索の効率性と収束性を向上させること。
- 事前学習済みモデル内のロトスジャックポットが、最先端の重み学習ベースの pruning 手法を上回るか同等の性能を達成できることを示すこと。
提案手法
- マグニチュードに基づくプルーニングによるスパースマスクの初期化を活用し、最終的なジャックポットマスクと高い重複度を示す新しい手法 SR-popup を提案。これにより、事前学習済みモデル内でのロトスジャックポット探索を効率的に行える。
- 深層ネットワークにおける重み依存性の理論的分析に基づき、マスク探索中に重みの入れ替えを制限する短い制限機構を導入。これにより、訓練損失に悪影響を及ぼすのを防ぐ。
- 反復ごとの重み入れ替え数を動的スケジュールで制限する。初期段階では高い探索性を確保し、徐々に制限を強化することで収束性を向上させ、振動を低減する。
- 微分可能リラクゼーションを用いた緩和されたマスク定式化を採用。これにより、元の事前学習済み重みを保持したまま、マスクのエンドツーエンド学習が可能になる。
- エッジ・ポップ(edge-popup)アルゴリズムをベースフレームワークとして採用するが、改善された初期化と制限機構により、探索コストを少なくとも 3 倍以上削減。
- VGGNet-19 および ResNet-50 を用いて、CIFAR-10 および ImageNet で手法を検証。最小限の再学習で高い性能を達成。
![Figure 1 : Training/Search cost v.s. top-1 accuracy of ResNet-50 [ 21 ] with a sparse rate of $90\%$ on ImageNet [ 22 ] . Search epoch differs from training epoch in that it only trains the mask for indicating the removal or preserve of weights, without modifying the weight value. Our method can qui](https://ar5iv.labs.arxiv.org/html/2104.08700/assets/x1.png)
実験結果
リサーチクエスチョン
- RQ1展開されておらず、重みの微調整を必要としない事前学習済みモデル内に、高精度でスパースな部分ネットワーク(ロトスジャックポット)が存在するか?
- RQ2このようなロトスジャックポットの探索コストを、性能を維持または向上させつつ顕著に低減できるか?
- RQ3初期マスクの選択(例:マグニチュードに基づくプルーニング)が、ロトスジャックポット探索の効率性と結果に与える影響は何か?
- RQ4マスク探索中に重みの入れ替えを制限することはどのような影響を持つのか?最適な収束を実現するためには、制限スケジュールをどのように設計すべきか?
- RQ5理論的根拠に基づくメカニズムは、マスク探索プロセスにおける重み依存性の悪影響を緩和できるか?
主な発見
- VGGNet-19 において、元のパラメータの 10% のみを有するロトスジャックポットが、重みの変更なしに CIFAR-10 でフルモデルと同等の性能を達成。
- 提案手法は、ベースラインの edge-popup と比較して、ロトスジャックポット探索コストを少なくとも 3 倍以上低減。性能は同等または上回る。
- マグニチュードに基づくプルーニングは、最終的なロトスジャックポットマスクと最も高い重複度を示すスパースマスクを生成する。これにより、効果的な初期化戦略であることが裏付けられる。
- 提案された短い制限機構により、マスク探索の収束が速くなり、振動が低減。ランダムおよび逆順スケジューリングのバリエーションを上回る性能を示す。
- ImageNet では、5 エポックの再学習で、ResNet-50 において 90% のスパarsity を達成し、トップ-1 精度が 70% を超える。高い効率性を示す。
- アブレーションスタディにより、マグニチュードに基づく初期化と動的制限スケジュールが、最適性能を達成する上で不可欠な要素であることが確認された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。