Skip to main content
QUICK REVIEW

[論文レビュー] Lottery Ticket Preserves Weight Correlation: Is It Desirable or Not?

Ning Liu, Geng Yuan|arXiv (Cornell University)|Feb 19, 2021
Video Analysis and Summarization参考文献 29被引用数 9
ひとこと要約

この論文は、ロットゥリーチケット仮説が初期化時の重みと最終的重みの相関に依存しており、良好に訓練されたネットワークではこの相関が低下することを特定している。これを克服するために、VGG、ResNet、MobileNet-v2モデルにおいて、同じ pruning および訓練設定下でロットリーチケットスパarsity訓練を常に上回る性能を示す微調整手法を提案している。

ABSTRACT

In deep model compression, the recent finding Lottery Ticket Hypothesis (LTH) (Frankle & Carbin, 2018) pointed out that there could exist a winning ticket (i.e., a properly pruned sub-network together with original weight initialization) that can achieve competitive performance than the original dense network. However, it is not easy to observe such winning property in many scenarios, where for example, a relatively large learning rate is used even if it benefits training the original dense model. In this work, we investigate the underlying condition and rationale behind the winning property, and find that the underlying reason is largely attributed to the correlation between initialized weights and final-trained weights when the learning rate is not sufficiently large. Thus, the existence of winning property is correlated with an insufficient DNN pretraining, and is unlikely to occur for a well-trained DNN. To overcome this limitation, we propose the & fine-tuning method that consistently outperforms lottery ticket sparse training under the same pruning algorithm and the same total training epochs. Extensive experiments over multiple deep models (VGG, ResNet, MobileNet-v2) on different datasets have been conducted to justify our proposals.

研究の動機と目的

  • ロットリーチケット仮説が、特に大きな学習率を用いた場合、多くの実用的シナリオで成立しない理由を調査すること。
  • 勝利チケットの存在を可能にする背後要因を特定することに焦点を当て、初期化時の重みと最終的な訓練済み重みの間の重み相関を分析すること。
  • 勝利チケットが良好に事前訓練された深層畳み込みニューラルネットワークでは実現しにくいという制限を解決すること。
  • 同じ pruning および訓練レジーム下で、ロットリーチケットスパarsity訓練を常に上回る性能を発揮する手法を提案すること。
  • 提案手法の有効性を、VGG、ResNet、MobileNet-v2 といった多様なアーキテクチャおよびデータセットで検証すること。

提案手法

  • 本手法は、勝利チケットの存在を決定づける要因として、初期化された重みと最終的な訓練済み重みの相関を分析する。
  • 高い重み相関がロットリーチケットの成功に不可欠であることが特定されたが、これは大きな学習率で訓練すると相関が低下することを示している。
  • 提案手法は、pruning 後に微調整ステージを追加することで、標準的な訓練で失われた有益な重み相関を保持する。
  • 微調整は、小規模な学習率を用いて pruned チャンクネットワークに適用され、初期重み相関を回復および安定化する。
  • 本手法は、ベースラインのロットリーチケット訓練と同一の総訓練エポック数および pruning アルゴリズムを維持しており、公平な比較を保証している。
  • 本手法は、複数のモデルおよびデータセットにわたってエンドツーエンドに適用され、一般化性を確保している。

実験結果

リサーチクエスチョン

  • RQ1なぜロットリーチケット仮説が、特に大きな学習率を用いた多くの実用的訓練シナリオで現れないのか?
  • RQ2pruned チャンクネットワークに勝利チケットが存在できる背後要因は何か?
  • RQ3初期化時の重みと最終的重みの間の重み相関は、ロットリーチケットのパフォーマンスにどのように影響するか?
  • RQ4ロットリーチケットが重み相関が不十分なために失敗する状況で、微調整戦略が性能を回復できるか?
  • RQ5提案手法は、同一の訓練および pruning 条件下で、標準的なロットリーチケットスパarsity訓練を一貫して上回る性能を発揮するか?

主な発見

  • 勝利チケットの存在は、初期化された重みと最終的な訓練済み重みの間の高い相関と強く相関している。
  • 大きな学習率でモデルを訓練すると、この重み相関が顕著に低下し、このような設定下でロットリーチケットが失敗する理由が説明できる。
  • 良好に訓練された深層畳み込みニューラルネットワークでは、重み相関が低く、勝利チケットの候補として不適切である。
  • 提案された微調整手法は、pruned チャンクネットワークにおける重み相関を回復および強化することで、性能を効果的に回復させた。
  • 本手法は、評価されたすべてのモデルおよびデータセットで、標準的なロットリーチケットスパarsity訓練を一貫して上回った。
  • 総訓練エポック数を増加させず、pruning アルゴリズムを変更せずとも、性能向上が達成されたため、公平な比較が保証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。