[論文レビュー] Pruning Randomly Initialized Neural Networks with Iterative Randomization
本稿では、重みを繰り返しランダム化することで、初期化されたニューラルネットワークの構造的プルーニングを実行する新規手法 IteRand を提案する。この手法により、パラメータ効率が著しく向上する。理論的には、IteRand は、完全に訓練されたネットワークに近い定数倍のネットワーク幅で勝利チケット(winning ticket)を発見するのに必要な幅を低減し、先行研究で指摘された対数的幅ペナルティを克服する。実験的にも、CIFAR-10、ImageNet、IMDB におけるプルーニングのみの設定で、最先端の性能を達成する。
Pruning the weights of randomly initialized neural networks plays an important role in the context of lottery ticket hypothesis. Ramanujan et al. (2020) empirically showed that only pruning the weights can achieve remarkable performance instead of optimizing the weight values. However, to achieve the same level of performance as the weight optimization, the pruning approach requires more parameters in the networks before pruning and thus more memory space. To overcome this parameter inefficiency, we introduce a novel framework to prune randomly initialized neural networks with iteratively randomizing weight values (IteRand). Theoretically, we prove an approximation theorem in our framework, which indicates that the randomizing operations are provably effective to reduce the required number of the parameters. We also empirically demonstrate the parameter efficiency in multiple experiments on CIFAR-10 and ImageNet. The code is available at: https://github.com/dchiji-ntt/iterand
研究の動機と目的
- 重みプルーニング最適化におけるパラメータ非効率性を解決すること。これは、同等の精度を達成するためには、重み最適化に比べてはるかに幅広いネットワークを必要とする。
- Pensia ら(2020年)の先行研究で指摘された、プルーニングのみの手法が訓練ベースの手法に比べてより広いネットワークを必要とする対数的幅ペナルティを克服すること。
- メモリ使用量を増加させることなく、プルーニングのみの最適化の効果を高める手法を開発すること。
- 繰り返しランダム化が、勝利チケット発見に必要なネットワーク幅を証明可能に低減できることを示すこと。
- 視覚および自然言語処理(NLP)のタスクを含む、多様なアーキテクチャとデータセットにおいて、厳密なメモリ制約下で手法の有効性を検証すること。
提案手法
- 繰り返しランダム化を導入:各プルーニングステップの後、プルーニングされた接続の重みを再ランダム化することで、追加のメモリを要せず、より広いネットワークを模倣する。
- アクティブな重みを追跡するバイナリマスクを維持しつつ、各イテレーションでプルーニングされた重みの値を新しいランダム値に再初期化する。
- 微分可能スコアベースのマスク最適化(edge-popup に類似)を用いて重要な重みを同定し、その後に繰り返しプルーニングとランダム化を実行する。
- 複数の訓練サイクルにわたりランダム化プロセスを適用し、各訓練フェーズで固定回数のランダム化を実施することで安定性を確保する。
- 収束性と性能向上を確保するため、ハイパーパrameter $K_{\text{per}}$ と $r$ を用いてランダム化の頻度と大きさを制御する。
- OpenLTH などの既存のプルーニングフレームワークに統合することで、IMP や edge-popup との公平な比較を可能にする。
実験結果
リサーチクエスチョン
- RQ1繰り返しランダム化は、プルーニングのみの最適化において、勝利チケット発見に必要なネットワーク幅を、完全に訓練されたネットワークに近い定数倍にまで低減できるか?
- RQ2固定メモリ制約下で、繰り返しランダム化は edge-popup や IMP に比べ、プルーニングのみの手法の精度を向上させるか?
- RQ3VGG、ResNet、WideResNet、LSTM などの多様なアーキテクチャおよび CIFAR-10、ImageNet、IMDB などのデータセットにおいて、この手法はどのように性能を発揮するか?
- RQ4スパarsity 水準やランダム化の頻度・大きさといったハイパーパrameter の変化に対して、IteRand の性能向上は頑健か?
- RQ5視覚および NLP タスクの両方において、繰り返しランダム化の理論的利点が実験的に検証可能か?
主な発見
- IteRand は、完全に訓練されたネットワークに近い定数倍のネットワーク幅で勝利チケット発見が可能となり、先行研究の対数的幅ペナルティを克服した。
- CIFAR-10 では、ResNet18 を用い、幅係数 ρ=1.0 の条件下で 92.47% の精度を達成した。これに対して edge-popup は同性能を達成するためには ρ=1.3 必要であった。
- ImageNet では、WideResNet-50-2(68.8M パラメータ)を用い、73.57% のトップ-1 精度を達成した。これは、同じパラメータ予算下で edge-popup(71.59%)を上回った。
- IMDB のテキスト分類タスクでは、LSTM で 88.44%、BiLSTM で 88.51% の精度を達成した。これは edge-popup(88.16% および 88.34%)および SGD(87.39% および 87.62%)を上回った。
- この手法は、複数のアーキテクチャおよびタスクにおいて有効であり、メモリ使用量を増加させることなく一貫した精度向上を示した。
- 繰り返しランダム化プロセスにより、プルーニングのみの最適化が、IMP などの再訓練ベース手法に近い性能にまで到達でき、厳密なメモリ制約下でも有効である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。