Skip to main content
QUICK REVIEW

[論文レビュー] Adaptive SGD with Polyak stepsize and Line-search: Robust Convergence and Variance Reduction

Xiaowen Jiang, Sebastian U. Stich|arXiv (Cornell University)|Aug 11, 2023
Domain Adaptation and Few-Shot LearningComputer Science被引用数 3
ひとこと要約

本稿では、問題固有のパラメータを必要とせず、補間および非補間設定の両方でロバストな収束を達成する、AdaSPSおよびAdaSLSという2つの適応的勾配降下法の変種を提案する。新規の分散低減技術を統合することで、凸関数における$\mathcal{O}(\varepsilon)$-近似解の達成に$\widetilde{\mathcal{O}}(n + 1/\varepsilon)$の勾配複雑度を達成し、AdaSVRGの高速レートを再現しながら、内側・外側ループ構造を回避する。

ABSTRACT

The recently proposed stochastic Polyak stepsize (SPS) and stochastic line-search (SLS) for SGD have shown remarkable effectiveness when training over-parameterized models. However, in non-interpolation settings, both algorithms only guarantee convergence to a neighborhood of a solution which may result in a worse output than the initial guess. While artificially decreasing the adaptive stepsize has been proposed to address this issue (Orvieto et al. [2022]), this approach results in slower convergence rates for convex and over-parameterized models. In this work, we make two contributions: Firstly, we propose two new variants of SPS and SLS, called AdaSPS and AdaSLS, which guarantee convergence in non-interpolation settings and maintain sub-linear and linear convergence rates for convex and strongly convex functions when training over-parameterized models. AdaSLS requires no knowledge of problem-dependent parameters, and AdaSPS requires only a lower bound of the optimal function value as input. Secondly, we equip AdaSPS and AdaSLS with a novel variance reduction technique and obtain algorithms that require $\smash{\widetilde{\mathcal{O}}}(n+1/ε)$ gradient evaluations to achieve an $\mathcal{O}(ε)$-suboptimality for convex functions, which improves upon the slower $\mathcal{O}(1/ε^2)$ rates of AdaSPS and AdaSLS without variance reduction in the non-interpolation regimes. Moreover, our result matches the fast rates of AdaSVRG but removes the inner-outer-loop structure, which is easier to implement and analyze. Finally, numerical experiments on synthetic and real datasets validate our theory and demonstrate the effectiveness and robustness of our algorithms.

研究の動機と目的

  • 補間でない設定での学習において、SPS や SLS のような既存の適応的SGD手法に見られる収束の非ロバスト性を是正すること。
  • 問題依存パラメータの知識を必要とせず、凸および強凸の両領域で高速な収束レートを維持する適応的ステップサイズ法の開発。
  • ポリアックおよびラインサーチ型ステップサイズと分散低減を統合しながら、非補間的状態の理論的保証を維持すること。
  • AdaSVRGのような分散低減手法で一般的に見られる内側・外側ループ構造の必要性を排除し、実装性および解析性を向上させること。
  • 合成データおよび実世界のデータセットを用いた数値実験を通じて、理論的改善の妥当性を検証すること。

提案手法

  • 最適関数値の下界を用いることで、非補間設定でも収束を保証する、ステップサイズが適応的なStochastic Polyak Stepsize(SPS)の変種、AdaSPSを提案する。
  • 問題依存パラメータを一切必要としないラインサーチベースの適応的手法であるAdaSLSを導入し、あらゆる設定でロバストな収束を実現する。
  • 累積関数値差分と勾配ノルムを用いてステップサイズを動的に調整する、新規の分散低減メカニズムを採用する。
  • 適応的ステップサイズ選択と分散低減の相互作用を分析することで収束レートを導出し、凸関数ではサブ線形収束、強凸関数では線形収束を保証する。
  • 深層学習への拡張のためのリスタート機構を設計し、ステップサイズの増大を実装することで、実際の周期的挙動を模倣する。
  • 適応的ステップサイズとバックトラッキングを組み合わせたハイブリッド更新則を設計し、安定性と収束性を維持する。

実験結果

リサーチクエスチョン

  • RQ1ポリアックステップサイズおよびラインサーチ型ステップサイズを用いた適応的SGDは、補間および非補間設定の両方でロバストな収束を達成できるか?
  • RQ2ポリアックおよびラインサーチステップサイズと分散低減を統合しても、理論的収束保証を維持できるか?
  • RQ3提案手法は、非補間的状態において、既存の適応的手法よりも高速な収束レートを達成できるか?
  • RQ4内側・外側ループ構造を用いないにもかかわらず、AdaSVRGの高速レートに匹敵する収束性能を達成できるか?
  • RQ5提案手法は非凸な深層学習設定でも効果的かつロバストであるか?

主な発見

  • AdaSPSおよびAdaSLSは、非補間設定でも収束を保証し、SPS や SLS が解の近傍にしか収束しないという限界を克服する。
  • AdaSPSは最適関数値の下界のみを必要とし、AdaSLSは問題依存パラメータを一切必要としないため、実用性が向上する。
  • 分散低減版では、凸関数における$\mathcal{O}(\varepsilon)$-近似解の達成に$\widetilde{\mathcal{O}}(n + 1/\varepsilon)$の勾配複雑度を達成し、非分散低減版の$\mathcal{O}(1/\varepsilon^2)$レートを改善する。
  • 提案手法はAdaSVRGの高速収束レートを再現するが、複雑な内側・外側ループ構造を回避するため、実装および解析が簡素化される。
  • 合成データおよび実データセットを用いた数値実験により、理論的予測が妥当であることが確認され、SPS、DecSPS、Adam、およびモーメンタム付きSGDよりも優れたロバスト性と性能を示す。
  • 非凸拡張版であるAdaSPS (DL) は、ResNet-34を用いたCIFAR10およびCIFAR100でも競争力ある性能を示し、凸設定を超えた実用的ポテンシャルを示唆する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。