Skip to main content
QUICK REVIEW

[論文レビュー] Direction Matters: On the Implicit Bias of Stochastic Gradient Descent with Moderate Learning Rate

Jingfeng Wu, Difan Zou|arXiv (Cornell University)|Nov 4, 2020
Stochastic Gradient Optimization Techniques参考文献 48被引用数 6
ひとこと要約

この論文は、中程度の学習率を用いた確率的勾配降下法(SGD)が、データ行列の大きな固有値に沿った方向に収束する明確な方向的バイアスを示している。これは、勾配降下法(GD)とは対照的であり、GDは小さな固有値方向を好み、収束する。このバイアスにより、早期停止の下で一般化性能が向上し、実践的なSGDの利点や、バッチサイズに線形にスケーリングするようなハイパーパrameterチューニングの実践的慣習が説明される。

ABSTRACT

Understanding the algorithmic bias of \\emph{stochastic gradient descent} (SGD) is one of the key challenges in modern machine learning and deep learning theory. Most of the existing works, however, focus on \\emph{very small or even infinitesimal} learning rate regime, and fail to cover practical scenarios where the learning rate is \\emph{moderate and annealing}. In this paper, we make an initial attempt to characterize the particular regularization effect of SGD in the moderate learning rate regime by studying its behavior for optimizing an overparameterized linear regression problem. In this case, SGD and GD are known to converge to the unique minimum-norm solution; however, with the moderate and annealing learning rate, we show that they exhibit different \\emph{directional bias}: SGD converges along the large eigenvalue directions of the data matrix, while GD goes after the small eigenvalue directions. Furthermore, we show that such directional bias does matter when early stopping is adopted, where the SGD output is nearly optimal but the GD output is suboptimal. Finally, our theory explains several folk arts in practice used for SGD hyperparameter tuning, such as (1) linearly scaling the initial learning rate with batch size; and (2) overrunning SGD with high learning rate even when the loss stops decreasing.

研究の動機と目的

  • 中程度の学習率領域におけるSGDのimplicit biasを同定すること。ここでは、小学習率の理論では実用的利点を説明できない。
  • 過パラメータ化線形回帰におけるSGDとGDの収束方向を比較し、異なる方向的好みを明らかにすること。
  • なぜSGDが実際にはGDよりも一般化性能に優れているのかを、特に早期停止および中程度の学習率の下で説明すること。
  • 学習率をバッチサイズに線形にスケーリングするような一般的なSGDハイパーパrameterチューニング慣習の理論的裏付けを提供すること。

提案手法

  • 中程度の学習率と徐々に小さくする学習率を用いた過パラメータ化線形回帰をSGDおよびGDで分析する。
  • データ行列の固有分解を用いて収束方向の挙動を導出し、SGDが大きな固有値を好み、GDが小さな固有値を好むことを示す。
  • 非凸なニューラルネットワークにおける収束方向の比較に相対リーマン比を用い、ヘッシアンの作用素ノルムで正規化する。
  • ニューラルネットワーク実験における相対リーマン比の計算のため、最大ヘッシアン固有値を推定するためにパワー法を用いる。
  • 合成データおよび実データ(例:FashionMNIST)を用いた実験的評価を行い、さまざまな学習率およびバッチサイズの下でSGDとGDを比較する。
  • 10回の繰り返し実験におけるペアt検定を実施し、性能差の統計的有意性を検証する。

実験結果

リサーチクエスチョン

  • RQ1過パラメータ化線形回帰において、中程度の学習率を用いたSGDは、GDと比較して収束方向でどのように異なるか?
  • RQ2早期停止が適用された際、SGDがGDよりも一般化性能に優れているのはなぜか?両者とも最小ノルム解に収束するが。
  • RQ3中程度の学習率を用いたSGDの方向的バイアスは、実用的な深層学習設定における一般化性能にどのように影響を与えるか?
  • RQ4学習率をバッチサイズに線形にスケーリングするという一般的なSGDハイパーパラメータチューニング慣習の背後にある理論的根拠は何か?

主な発見

  • 中程度の学習率を用いたSGDは、データ行列の大きな固有値方向に収束するが、GDは小さな固有値方向に収束する。
  • 早期停止の下で、SGDの方向的バイアスにより、GDよりも顕著に高いテスト精度が得られ、ペアt検定のp値は0.0043であった。
  • FashionMNISTでは、中程度の学習率を用いたSGDが平均82.65%のテスト精度を達成し、GD(81.83%)および小学習率を用いたSGD(81.77%)を上回った。
  • この方向的バイアスが、明示的な正則化がなくても、実際のSGDがGDよりも一般化性能に優れる理由を説明する。
  • 理論的裏付けとして、初期学習率をバッチサイズに線形にスケーリングするという慣習が正当化される。これは、同じ収束方向バイアスを維持するからである。
  • 損失の plateau を超えて、高い学習率でSGDを継続することで、一般化性能が向上する。これは、方向的バイアス効果と整合的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。