Skip to main content
QUICK REVIEW

[論文レビュー] Learning Rate Annealing Can Provably Help Generalization, Even for Convex Problems

Preetum Nakkiran|arXiv (Cornell University)|May 15, 2020
Stochastic Gradient Optimization Techniques参考文献 16被引用数 10
ひとこと要約

本稿は、学習率の段階的低下(初期に大きな学習率を、その後に小さな学習率を用いる)が、2次元線形回帰のような凸問題で一般化性能を確実に向上させられることを示している。訓練損失とテスト損失の曲率の不一致と早期停止を活用することで、一定小学習率の勾配流に比べ、段階的低下を用いた勾配降下法は、はるかに低いテスト損失に到達する。

ABSTRACT

Learning rate schedule can significantly affect generalization performance in modern neural networks, but the reasons for this are not yet understood. Li-Wei-Ma (2019) recently proved this behavior can exist in a simplified non-convex neural-network setting. In this note, we show that this phenomenon can exist even for convex learning problems -- in particular, linear regression in 2 dimensions. We give a toy convex problem where learning rate annealing (large initial learning rate, followed by small learning rate) can lead gradient descent to minima with provably better generalization than using a small learning rate throughout. In our case, this occurs due to a combination of the mismatch between the test and train loss landscapes, and early-stopping.

研究の動機と目的

  • 学習率の段階的低下が凸最適化問題において一般化性能を向上させられることを示し、このような効果が非凸性が必須であるという仮定に挑戦すること。
  • 学習率スケジューリング、早期停止、および経験的(訓練)損失と母集団(テスト)損失の曲率の不一致の間の相互作用を分析すること。
  • 訓練損失が同一であるにもかかわらず、段階的低下が定数小学習率よりも優れた一般化をもたらす理論的根拠に基づいた最小限の例を提示すること。
  • 一般化の向上が非凸性や暗黙のバイアスによるものではなく、最適化ダイナミクスと推定誤差に起因するものであることを明確にすること。

提案手法

  • 2つの直交する特徴を一様にサンプリングするデータ分布を持つ2次元線形回帰問題を定式化する。
  • 経験的共分散行列と真の共分散行列に基づいて訓練損失関数とテスト(母集団)損失関数を定義し、両者の間で曲率の不一致を生じさせる。
  • 2つの最適化戦略を比較する:(A) 小さな定数学習率を用いた勾配流、および (B) 大きなステップサイズで勾配降下を開始し、その後勾配流に移行する。
  • 大きな初期学習率を用いて、最大曲率方向(第1座標軸)での振動を誘発し、離散段階でその軸に沿った完全な最適化を防ぐ。
  • 固有値比と減衰率に基づく母集団損失の境界を用いて、得られたパラメータ軌道と最終的なテスト損失を分析する。
  • 特定のデータサンプリング条件(例:2つの同一のサンプルが3/4の確率で出現する)の下で、段階的低下法が定数小学習率法のテスト損失の半分にまで低下させることを証明する。

実験結果

リサーチクエスチョン

  • RQ1学習率の段階的低下は、唯一のグローバル最小値を持つ凸問題において一般化性能を向上させられるか?
  • RQ2凸設定における学習率スケジューリングによる一般化性能向上の背後にあるメカニズムは何か?
  • RQ3訓練損失とテスト損失の曲率の不一致が、早期停止とどのように作用して一般化に影響を与えるか?
  • RQ4段階的低下の利点は非凸性に起因するのか、それとも強い凸問題でも生じるのか?
  • RQ5同じ訓練損失に到達するとしても、勾配流と大きな初期ステップを伴う勾配降下法は、一般化結果を異なるものにできるか?

主な発見

  • 2次元線形回帰問題において、訓練損失が同一である限り、学習率の段階的低下はテスト損失を定数小学習率の勾配流の半分にまで低下させる。
  • 訓練データのサンプルに対して確率3/4の確率で、段階的低下法のテスト損失は定数小学習率法の2倍低い。
  • この向上は、大きな初期学習率が、訓練では高曲率だが母集団では低曲率である方向への最適化を防ぐことに起因する。
  • 主なメカニズムは、訓練損失とテスト損失の曲率の不一致と早期停止の組み合わせであり、これは同じ訓練損失における最小値の一意性を破る。
  • この結果は強い凸問題でも成り立つため、非凸性が一般化に影響を与えるために必要ではないことが示された。
  • 理論的分析により、大きなステップを伴う勾配降下法が、勾配流のみでは到達してしまう悪い一般化最小値を回避できることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。