Skip to main content
QUICK REVIEW

[論文レビュー] The Effect of Network Width on Stochastic Gradient Descent and Generalization: an Empirical Study

Daniel Park, Jascha Sohl‐Dickstein|arXiv (Cornell University)|May 9, 2019
Stochastic Gradient Optimization Techniques参考文献 34被引用数 16
ひとこと要約

この論文は、ネットワーク幅が確率的勾配降下法(SGD)の最適化および一般化に与える影響を調査し、重み初期化とパrameterizationを考慮した正規化ノイズスケールを導入している。最適なテスト精度は、このノイズスケールが幅に比例する場合に達成され、これがより広いネットワークがなぜ一般化性能を向上させるのか、およびバッチ正規化がない場合に最適なバッチサイズが幅に応じて減少するのかを説明している。

ABSTRACT

We investigate how the final parameters found by stochastic gradient descent are influenced by over-parameterization. We generate families of models by increasing the number of channels in a base network, and then perform a large hyper-parameter search to study how the test error depends on learning rate, batch size, and network width. We find that the optimal SGD hyper-parameters are determined by a "normalized noise scale," which is a function of the batch size, learning rate, and initialization conditions. In the absence of batch normalization, the optimal normalized noise scale is directly proportional to width. Wider networks, with their higher optimal noise scale, also achieve higher test accuracy. These observations hold for MLPs, ConvNets, and ResNets, and for two different parameterization schemes ("Standard" and "NTK"). We observe a similar trend with batch normalization for ResNets. Surprisingly, since the largest stable learning rate is bounded, the largest batch size consistent with the optimal normalized noise scale decreases as the width increases.

研究の動機と目的

  • ネットワーク幅がSGDの最適ハイパーパramータおよび最終的なテスト精度に与える影響を理解すること。
  • バッチ正規化がない状況において、SGDにおける最適なノイズスケールがネットワーク幅に依存するかどうかを調査すること。
  • 重み初期化とパrameterizationを補正した正規化ノイズスケールが、異なるアーキテクチャ across で最適なトレーニングパフォーマンスを予測できるかどうかを評価すること。
  • 最適なノイズ条件における幅の影響が、安定した学習率と最大バッチサイズに与えるインパクトを検討すること。

提案手法

  • 著者らは、ベースネットワークのチャネル数を増やすことでモデルの系列を生成し、幅が異なる線形なモデルファミリーを作成した。
  • 学習率、バッチサイズ、幅のハイパーパramータを大規模に探索し、'標準'および'NTK'パrameterizationの両方のスキームを用いた。
  • 主な指標は正規化ノイズスケールであり、$ g = \frac{\epsilon N_{\text{train}}}{B \cdot \sigma^2} $ で定義される。ここで $ \sigma $ は初期化時の重みスケールである。
  • 異なる幅とハイパーパramータの組み合わせにおけるテスト精度を比較し、各幅における最適なハイパーパramータ設定を同定した。
  • バッチ正規化あり・なしの両方のモデルを検討し、MLP、ConvNets、ResNetsを対象とした。
  • 性能指標として最終段階の平均テスト精度を用い、正規化ノイズスケールのアーキテクチャおよびパrameterizationスキームにわたる頑健性を検証した。

実験結果

リサーチクエスチョン

  • RQ1ネットワーク幅が、一般化のためのSGDにおける最適ハイパーパramータ(学習率およびバッチサイズ)に与える影響は何か?
  • RQ2異なるネットワーク幅にわたって最適なテスト精度を予測できる一様な正規化ノイズスケールが存在するか?
  • RQ3最適なノイズスケールと幅の関係は、MLP、ConvNet、ResNet といった異なるアーキテクチャおよびパrameterizationスキームでも成り立つか?
  • RQ4バッチ正規化は、幅と最適なノイズスケールの関係にどのような影響を与えるか?
  • RQ5数値的安定性の制約が、ネットワーク幅の増加に伴い最大バッチサイズにどのような制限を課えるか?

主な発見

  • バッチ正規化がない状況では、MLP、ConvNets、ResNetsのすべてにおいて、最適な正規化ノイズスケールがネットワーク幅に比例することが判明した。
  • より広いネットワークは、トレーニング中に高いノイズスケールに耐えられ、それらの恩恵を受けることができるため、より高いテスト精度を達成する。
  • 最大の安定した学習率は上限に達するため、最適なノイズスケールを満たす最大バッチサイズは、幅が増加するにつれて減少する。
  • NTKおよび標準パrameterizationの両方において、学習率を安定性に合わせて調整した場合、最適なバッチサイズは幅に反比例してスケーリングする。
  • バッチ正規化ありの場合、ResNetsは幅に比例するノイズスケールのトレンドに従うが、ConvNetsは従わない。これは、アーキテクチャおよび正規化に依存する行動を示している。
  • この研究は、追加の正則化が施されない限り、テスト精度が頭打ちになる臨界な幅が存在する可能性を示唆している。これは、達成可能なノイズスケールに上限があるためである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。