Skip to main content
QUICK REVIEW

[論文レビュー] Finite-Sum Smooth Optimization with SARAH

Lam M. Nguyen, Marten van Dijk|arXiv (Cornell University)|Jan 22, 2019
Stochastic Gradient Optimization Techniques被引用数 7
ひとこと要約

本稿では、有限和の滑らかで非凸な最適化のための修正されたSARAHアルゴリズムを提案し、n ≤ O(ε⁻²) の条件下で、理論的下界 Ω(√n/ε) に定数倍の誤差で一致する総勾配複雑度を達成する。凸問題の場合は、SARAH++ を導入し、非線形および線形収束レートを実現する。また、チューニングなしで性能を向上させる実用的な自己適応型バージョン(SARAH Adaptive)を提案し、covtype や ijcnn1 といった実際のデータセットで検証した。

ABSTRACT

The total complexity (measured as the total number of gradient computations) of a stochastic first-order optimization algorithm that finds a first-order stationary point of a finite-sum smooth nonconvex objective function $F(w)=\frac{1}{n} \sum_{i=1}^n f_i(w)$ has been proven to be at least $Ω(\sqrt{n}/ε)$ for $n \leq \mathcal{O}(ε^{-2})$ where $ε$ denotes the attained accuracy $\mathbb{E}[ \| abla F( ilde{w})\|^2] \leq ε$ for the outputted approximation $ ilde{w}$ (Fang et al., 2018). In this paper, we provide a convergence analysis for a slightly modified version of the SARAH algorithm (Nguyen et al., 2017a;b) and achieve total complexity that matches the lower-bound worst case complexity in (Fang et al., 2018) up to a constant factor when $n \leq \mathcal{O}(ε^{-2})$ for nonconvex problems. For convex optimization, we propose SARAH++ with sublinear convergence for general convex and linear convergence for strongly convex problems; and we provide a practical version for which numerical experiments on various datasets show an improved performance.

研究の動機と目的

  • 非凸な有限和最適化における確率的1次最適化手法の収束複雑度のギャップを埋める。
  • 平均滑らかさの下で、非凸問題に対する理論的下界 Ω(√n/ε) に一致する総勾配複雑度を達成する。
  • 収束性と性能が向上した、実用的で効率的な凸問題用の変種を開発する。
  • ステップサイズと内側ループの長さを動的に調整する、自己適応型の変種(SARAH Adaptive)を提案する。

提案手法

  • 元のSARAHアルゴリズムを修正し、各外側ループの出力をランダムな中間点ではなく、最終反復点 $ w_{m+1}^{(s)} $ に設定する。
  • 再帰的分散低減勾配推定器 $ v_t^{(s)} = \nabla f_{i_t}(w_t^{(s)}) - \nabla f_{i_t}(w_{t-1}^{(s)}) + v_{t-1}^{(s)} $ を用いて、低分散勾配推定を維持する。
  • SARAH++ では、$ \|v_t^{(s)}\|^2 < \gamma \|v_0^{(s)}\|^2 $ を根拠とする動的停止基準を導入し、効率的な内側ループの終了を保証する。
  • 自己適応型ステップサイズ $ \eta_t^{(s)} = \frac{1}{L} \cdot \frac{\|v_t^{(s)}\|^2}{\|v_0^{(s)}\|^2} $ を提案し、現在の勾配ノルムに応じてスケーリングされる。
  • 適応的ステップサイズと停止条件を適用し、小さな無駄な更新を回避することで、収束速度を向上させる。
  • 各外側ループの開始時に全勾配を用い、$ w_{t+1}^{(s)} = w_t^{(s)} - \eta v_t^{(s)} $ により反復点を更新する。

実験結果

リサーチクエスチョン

  • RQ1修正されたSARAHアルゴリズムは、非凸な有限和問題において、既知の下界に一致する総勾配複雑度を達成できるか?
  • RQ2SARAH++ は、標準的なSARAHと比較して、凸および強凸問題において改善された収束レートを提供するか?
  • RQ3SARAHの自己適応型変種は、ステップサイズと内側ループ長を動的に調整し、実用的性能を向上させられるか?
  • RQ4SARAH Adaptive の性能は、さまざまなデータセットおよび学習率設定において、SARAH や SARAH++ と比較してどうなるか?

主な発見

  • 修正されたSARAHアルゴリズムは、非凸問題において $ n \leq \mathcal{O}(\epsilon^{-2}) $ の条件下で、$ \mathcal{O}(\sqrt{n}/\epsilon) $ の総勾配複雑度を達成し、理論的下界 $ \Omega(\sqrt{n}/\epsilon) $ に定数倍の誤差で一致する。
  • SARAH++ は、一般凸問題では非線形収束、強凸問題では線形収束を達成し、理論的保証が与えられる。
  • covtype および ijcnn1 データセットにおける数値実験では、SARAH++ が収束速度と精度の両面で標準的なSARAHを上回ることが示された。
  • 理論的分析は行われていないが、SARAH Adaptive は、特に学習率のチューニングなしでも、SARAH や SARAH++ より優れた実用的性能を示した。
  • 停止基準 $ \|v_t^{(s)}\|^2 < \gamma \|v_0^{(s)}\|^2 $ は、不要な小さな更新を防ぐことで、大幅に効率性を向上させた。
  • 自己適応型ステップサイズ $ \eta_t^{(s)} = \frac{1}{L} \cdot \frac{\|v_t^{(s)}\|^2}{\|v_0^{(s)}\|^2} $ は、$ \eta_t^{(s)} \leq \frac{1}{L} $ を保証し、安定性と収束性を維持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。