[論文レビュー] Network Pruning That Matters: A Case Study on Retraining Variants
本論文は、 pruning されたニューラルネットワークの再訓練における学習率スケジューリングの重要な役割を調査し、特に学習率のリセットを用いた大規模な学習率が、従来のファインチューニングを顕著に上回ることを示している。驚くべきことに、ランダムに pruning されたネットワークを大規模な学習率で再訓練すると、体系的に pruning されたネットワークを上回ることすら可能であり、再訓練のハイパーパramータが pruning の手法自体よりも重要であることが明らかになった。
Network pruning is an effective method to reduce the computational expense of over-parameterized neural networks for deployment on low-resource systems. Recent state-of-the-art techniques for retraining pruned networks such as weight rewinding and learning rate rewinding have been shown to outperform the traditional fine-tuning technique in recovering the lost accuracy (Renda et al., 2020), but so far it is unclear what accounts for such performance. In this work, we conduct extensive experiments to verify and analyze the uncanny effectiveness of learning rate rewinding. We find that the reason behind the success of learning rate rewinding is the usage of a large learning rate. Similar phenomenon can be observed in other learning rate schedules that involve large learning rates, e.g., the 1-cycle learning rate schedule (Smith et al., 2019). By leveraging the right learning rate schedule in retraining, we demonstrate a counter-intuitive phenomenon in that randomly pruned networks could even achieve better performance than methodically pruned networks (fine-tuned with the conventional approach). Our results emphasize the cruciality of the learning rate schedule in pruned network retraining - a detail often overlooked by practitioners during the implementation of network pruning. One-sentence Summary: We study the effective of different retraining mechanisms while doing pruning
研究の動機と目的
- 学習率リワインド(LRW)が、pruning されたネットワークの再訓練において、従来のファインチューニングを上回る理由を調査すること。
- LRW の成功が、特定のスケジュールに起因するのか、それとも大規模な学習率の使用に起因するのかを特定すること。
- 大規模な学習率を用いた単純な再訓練戦略が、複雑な pruning アルゴリズムを上回れるかどうかを評価すること。
- pruning アルゴリズムの公平な比較のための標準化された再訓練設定を提唱すること。
- ネットワーク pruning パipelaineにおいて、学習率スケジューリングの見過ごされがちな重要性を強調すること。
提案手法
- ファインチューニング、学習率リワインド(LRW)、学習率リスタート(CLR)を含む、さまざまな再訓練戦略を比較する広範な実験。
- 1サイクル学習率スケジュール(CLR)を用いて、pruning されたモデルを再訓練し、特に大規模な初期学習率に注目した。
- 一様にランダムな重要度スコアを用いてフィルタをランダムに pruning した後、大規模な学習率で再訓練し、性能を評価した。
- 学習率スケジューリングの影響を隔離するために、すべての手法で一貫したハイパーパramータを用いた標準的なトレーニングレシピの適用。
- CIFAR-10、ImageNet といった複数のデータセットと、ResNet、DenseNet、VGG、ResNet-50 といった複数のモデルを用い、さまざまな圧縮比下での性能を比較した。
- pruning 後の最終精度に与える学習率の大きさとスケジュールの影響を隔離するためのアブレーションスタディ
実験結果
リサーチクエスチョン
- RQ1なぜ学習率リワインド(LRW)は、pruning されたネットワークの再訓練において、従来のファインチューニングを上回るのか?
- RQ2LRW の成功は、特定のスケジュールに起因するのか、それとも大規模な学習率の使用に起因するのか?
- RQ3大規模な学習率を用いた単純な再訓練戦略が、複雑な pruning アルゴリズムを上回れるか?
- RQ4再訓練ハイパーパramータの選択が、pruning 手法間の比較の公平性に影響を与えるか?
- RQ5最適な学習率で再訓練された場合、ランダムに pruning されたネットワークが体系的に pruning されたネットワークと同等またはそれ以上の性能を達成できるか?
主な発見
- 学習率リワインド(LRW)がファインチューニングを上回る主な理由は、特定のスケジュールとの結合ではなく、大規模な学習率の使用にある。
- 1サイクルスケジュール(CLR)を用いた大規模な学習率による再訓練は、pruning の手法や圧縮比にかかわらず、すべてのモデルとデータセットで一貫して性能を向上させた。
- CLR を用いて再訓練したランダムに pruning されたネットワークは、同じ pruning 準拠を用いた体系的な pruning を行ったネットワークを上回る精度を達成し、再訓練のハイパーパramータが pruning 戦略を上回ることを示した。
- CIFAR-10 では、ランダム pruning に CLR を適用した場合、ResNet-110 で 93.40±0.16% の top-1 精度を達成し、HRankPlus の 93.37±0.04% や MWP の 93.23% を上回った。
- ImageNet では、81% の圧縮比下で、ランダム pruning に CLR を適用した場合、ResNet-50 で 75.54% の top-1 精度を達成し、同程度の圧縮比での Taylor Pruning の 75.48% や PFEC の 73.47% を上回った。
- 本研究は、大規模な学習率による再訓練が、単純なノルムベースの pruning を、洗練された pruning アルゴリズムと同等に競争可能にする可能性を示し、洗練された pruning メトリクスが必須であるという仮定に疑問を呈した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。