Skip to main content
QUICK REVIEW

[論文レビュー] Rare Gems: Finding Lottery Tickets at Initialization

Kartik K. Sreenivasan, Jy-yong Sohn|arXiv (Cornell University)|Feb 24, 2022
Stochastic Gradient Optimization Techniques被引用数 10
ひとこと要約

本稿では、最初期段階でスパースでトレーニング可能なサブネットワーク(ロットリーチケット)を発見するGem-Minerというアルゴリズムを提案する。CIFAR-10およびImageNetにおいて、ウォームアップトレーニングを必要とせず、最先端の精度を達成している。Gem-Minerは「レア・ジェム」と呼ばれる、初期段階で高い精度を示すサブネットワークを特定し、反復的 pruning とファインチューニングによって最適化する。これにより、従来手法に比べ最大19倍速くトレーニングを実行可能であり、すべての既知のベースラインを上回る性能を発揮する。

ABSTRACT

Large neural networks can be pruned to a small fraction of their original size, with little loss in accuracy, by following a time-consuming "train, prune, re-train" approach. Frankle & Carbin conjecture that we can avoid this by training "lottery tickets", i.e., special sparse subnetworks found at initialization, that can be trained to high accuracy. However, a subsequent line of work by Frankle et al. and Su et al. presents concrete evidence that current algorithms for finding trainable networks at initialization, fail simple baseline comparisons, e.g., against training random sparse subnetworks. Finding lottery tickets that train to better accuracy compared to simple baselines remains an open problem. In this work, we resolve this open problem by proposing Gem-Miner which finds lottery tickets at initialization that beat current baselines. Gem-Miner finds lottery tickets trainable to accuracy competitive or better than Iterative Magnitude Pruning (IMP), and does so up to $19 imes$ faster.

研究の動機と目的

  • 初期段階で単純なベースラインやトレーニング後にpruningを行う手法を上回るロットリーチケットを発見するという未解決問題を解決すること。
  • ウォームアップトレーニングを必要とせず、SOTA精度に到達可能なスパースサブネットワークを特定する手法を開発すること。
  • 発見されたサブネットワークが、ランダムなスパースサブネットワークベースラインを含む、すべての既知のサニティーチェックに合格することを保証すること。
  • ウォームアップを伴うイテレーティブマグニチュードプルーニング(IMP)と同等またはそれ以上の精度を達成するが、はるかに少ないトレーニングエポック数で実現すること。
  • 初期段階での高精度が最終的な性能の強力な予測要因であることを示し、より高速で効率的なトレーニングを可能にすること。

提案手法

  • Gem-Minerは、あらかじめファインチューニングを行わずとも初期段階で非自明な精度を示すスパースサブネットワーク(「レア・ジェム」)を発見することで、初期段階ですでに高い精度を持つサブネットワークを特定する。
  • 局所的ではなくグローバルなスコア指標(マグニチュードと勾配情報に基づく)を用いて反復的プルーニングを誘導し、適応的スレッショルドを用いることでレイヤーの崩壊を回避する。
  • アルゴリズムは5エポックごとに反復的プルーニングを実行し、段階的にスパースネスを目標レベルまで低下させつつ、初期段階の高い精度を維持する。
  • スコアベクトルに正則化項を組み込むことで、プルーニング中のスパーシティの促進と安定性の向上を図る。
  • 学習可能なパラメータλを用いてプルーニングスレッショルドを動的に調整し、完全なレイヤーのプルーニングを防ぐ。
  • Gem-Minerは、グローバルプルーニング、段階的スパースネス削減、スコア正則化を組み合わせることで、EP や SR といった既存手法を上回る性能を発揮するように設計されている。

実験結果

リサーチクエスチョン

  • RQ1初期段階で、IMPにウォームアップを伴うトレーニング後にpruningを行う手法と同等の精度を達成するロットリーチケットを発見できるか?
  • RQ2初期段階で高い精度を示すサブネットワーク(すなわち「レア・ジェム」)は、ランダムなスパースサブネットワークよりも優れた最終的性能を発揮するか?
  • RQ3初期段階でのプルーニング手法が、ランダムなスパースサブネットワークやレイヤーワイズスパースネスヒューリスティクスを含む、すべての既知のベースラインを上回ることができるか?
  • RQ4EP などの既存の初期段階でのプルーニング手法にどのような変更を加えることで、初期段階での高精度およびファインチューニング後の高精度を達成できるか?
  • RQ5Gem-Minerのトレーニング期間を延長することで性能が向上するか?また、トレーニング後にpruningを行う手法との差を埋められるか?

主な発見

  • Gem-Minerは、CIFAR-10でResNet-20を用い、スパースネス0.59%の条件下で初期段階に66.15%のテスト精度を達成するロットリーチケットを発見し、最高のEPバージョン(63.72%)およびすべての先行ベースラインを上回った。
  • CIFAR-10でスパースネス1.4%の条件下、150エポックでファインチューニング後の精度が77.89%に達した。これは、ウォームアップを伴うIMP(74.52%)を上回り、Rendaらのトレーニング後にpruningを行う手法(80.21%)とほぼ同等の性能を示した。
  • 3000エポックでトレーニングしたLong Gem-Minerは79.50%の精度を達成し、標準的なGem-Minerに比べ1.5%の向上を示した。これは、延長されたトレーニングが性能向上に寄与することを示している。
  • Gem-Minerは、ウォームアップを伴うIMPに比べ最大19倍速く、はるかに少ないトレーニングエポック数で同等またはそれ以上の精度を達成した。
  • 本手法はすべての既知のサニティーチェックに合格している:ランダムなスパースサブネットワークやその他のヒューリスティクスベースの手法でさえ、レイヤー単位のスパースネスを丁寧にチューニングした場合でも、Gem-Minerに劣る性能であった。
  • アブレーションスタディの結果、グローバルプルーニング、段階的スパースネス削減、スコア正則化が不可欠な要素であることが確認された。特にグローバルプルーニングと段階的プルーニングが重要であり、正則化のみでは最小限の利益にとどまった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。