Skip to main content
QUICK REVIEW

[論文レビュー] Linear Mode Connectivity and the Lottery Ticket Hypothesis

Jonathan Frankle, Gintare Karolina Dziugaite|arXiv (Cornell University)|Dec 11, 2019
Advanced Neural Network Applications参考文献 34被引用数 100
ひとこと要約

この論文はSGDノイズ感度を検証する不安定性解析を導入し、ネットワークはトレーニングの初期段階でSGDノイズに対して安定になり、これが線形モード連結を生み出すことを示し、これを用いて反復的大きさ剪定(IMP)がマッチするサブネットワークを得る時期を説明する。

ABSTRACT

We study whether a neural network optimizes to the same, linearly connected minimum under different samples of SGD noise (e.g., random data order and augmentation). We find that standard vision models become stable to SGD noise in this way early in training. From then on, the outcome of optimization is determined to a linearly connected region. We use this technique to study iterative magnitude pruning (IMP), the procedure used by work on the lottery ticket hypothesis to identify subnetworks that could have trained in isolation to full accuracy. We find that these subnetworks only reach full accuracy when they are stable to SGD noise, which either occurs at initialization for small-scale settings (MNIST) or early in training for large-scale settings (ResNet-50 and Inception-v3 on ImageNet).

研究の動機と目的

  • SGDノイズが複数の実行にわたるニューラルネットワーク最適化結果にどう影響するかを評価する
  • 異なるSGDノイズサンプルが同じ(線形に連結された)極小値につながるのはいつかを特定する
  • 不安定性解析を用いて反復的大きさ剪定(IMP)と宝くじチケットの結果を評価する
  • 中間のトレーニング状態へリワインドして一致するスパースサブネットワークを見つけるためにIMPを一般化する
  • 大規模モデルにおける剪定タイミングと最適化ダイナミクスに関する実践的洞察を提供する

提案手法

  • SGDノイズの異なるコピーを2つトレーニングし、補間誤差を測定して不安定性解析を定義する
  • 2つの訓練済みネットワーク間の線形経路に沿った最大障壁として線形補間不安定性を定量化する
  • 0-2%の不安定性閾値で線形モード連結性を宣言して安定性を評価する
  • MNIST、CIFAR-10、ImageNet上のネットワークに対して初期化と様々なトレーニングステップを横断して不安定性解析を適用する
  • IMPを拡張してステップkへリワインドし、マッチングするサブネットワークを得る
  • 安定性を満たすかどうかを判定するために不安定性の閾値とサポートするスパース性の範囲を分析する

実験結果

リサーチクエスチョン

  • RQ1標準的なネットワークにおいてSGDノイズは実行ごとに異なる極小値を生み出すのか、それとも同じ(線形に連結された)極小値に収束するのか?
  • RQ2ネットワークがSGDノイズに安定になるのは訓練のどの段階で、これがIMPの結果に影響するのか?
  • RQ3IMPサブネットワークはSGDノイズに安定している場合にのみマッチするのか、リワインドによってより大きなスケールでもマッチするサブネットワークを見つけられるのか?

主な発見

  • 初期にはほとんどのネットワークがSGDノイズに対して不安定である;安定性は研究対象の全ネットワークで訓練の初期段階で現れる
  • 訓練のごく一部の段階の後で(例:ResNet-20で約3%、VGG-16で約1.5%、ResNet-50で20%、Inception-v3で16%)、ネットワークはSGDノイズに安定となり、線形に連結された極小値を持つ
  • IMPサブネットワークはSGDノイズに安定している場合にのみマッチする;小さなタスクでは初期化時にも安定が生まれ、大規模なスケールでは訓練初期化後に安定が生じ得る
  • 中間訓練ステップへリワインドしたIMPサブネットワークは、ネットワーク全体より先に安定してマッチすることがあり、より非自明なスパース性でのマッチングを可能にする
  • 安定性の発現時刻はアーキテクチャとタスクで異なり、大規模モデルは安定性に達するまでより多くの訓練を要するが、安定時にはマッチするサブネットワークを得られる
  • IMPサブネットワークはスパース性の異なる範囲で、三つのスパースレンジ(自明・IMPのみ・非マッチ)に対応した安定性とマッチングパターンを示す

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。