Skip to main content
QUICK REVIEW

[論文レビュー] An Optimal Hybrid Variance-Reduced Algorithm for Stochastic Composite Nonconvex Optimization

Deyi Liu, Lam M. Nguyen|arXiv (Cornell University)|Aug 20, 2020
Stochastic Gradient Optimization Techniques参考文献 7被引用数 6
ひとこと要約

本稿では、1回の反復あたり2回の確率的勾配評価で、最適な確率的オракル複雑度を達成する、単一ループでハイブリッドな分散低減を施したプロキシマル勾配法を提案する。独立推定器の代わりにモーメンタムに基づくSARAH風の更新を用いることで、計算コストを低減し、定数倍の要因を除いて下界の複雑度に一致する。期待される勾配ノルムの二乗の収束速度は $ O(1/T^{2/3}) $ である。

ABSTRACT

In this note we propose a new variant of the hybrid variance-reduced proximal gradient method in [7] to solve a common stochastic composite nonconvex optimization problem under standard assumptions. We simply replace the independent unbiased estimator in our hybrid- SARAH estimator introduced in [7] by the stochastic gradient evaluated at the same sample, leading to the identical momentum-SARAH estimator introduced in [2]. This allows us to save one stochastic gradient per iteration compared to [7], and only requires two samples per iteration. Our algorithm is very simple and achieves optimal stochastic oracle complexity bound in terms of stochastic gradient evaluations (up to a constant factor). Our analysis is essentially inspired by [7], but we do not use two different step-sizes.

研究の動機と目的

  • 合成非凸問題に対するより単純で効率的な確率的最適化アルゴリズムの開発。最適なオラクル複雑度を達成すること。
  • 先行研究で3回の確率的勾配評価を必要としていた反復あたりの評価回数を2回に削減し、計算効率を向上させること。
  • 従来のハイブリッド手法とは異なり、別個の減衰係数付きステップサイズの必要性を排除することで、アルゴリズム構造を単純化すること。
  • 確率的勾配評価の観点から最適な収束速度を達成し、理論的下界に定数倍の要因を除いて一致させること。
  • 有界勾配の仮定なしに、適応的ステップサイズ、ミニバッチ、非滑らか正則化子など、より広範な設定への分散低減手法の適用可能性を拡張すること。

提案手法

  • 同じサンプル $ \xi_t $ を用いて現在と過去の勾配項の両方のモーメンタムと分散低減を組み合わせた新しい推定子 $ v_t $ を提案。これはモーメンタム-SARAH推定子にインspiredされている。
  • 別個の減衰係数付きステップサイズを不要とする単一ループアルゴリズムを導入し、従来のハイブリッド手法と比較して更新ルールを単純化する。
  • 固定ステップサイズ $ \eta $ を用いたプロキシマル勾配ステップ $ x_{t+1} = \mathrm{prox}_{\eta\psi}(x_t - \eta v_t) $ を採用し、定常点への収束を保証する。
  • 初期勾配推定子 $ v_0 $ を計算するため、サイズ $ \tilde{b} = \mathcal{O}(T^{1/3}) $ の初期ミニバッチを1つ使用し、初期段階での分散を低減する。
  • リャプノフ関数を用いた収束解析を行い、定常性を測る勾配マッピングの期待二乗ノルム $ \mathbb{E}[\|G_\eta(\overline{x}_T)\|^2] $ の上限を導出する。
  • 収束と分散低減のバランスを取るために、定数ステップサイズ $ \eta = \mathcal{O}(T^{-1/3}) $ と重み $ \beta = \mathcal{O}(T^{-2/3}) $ を採用する。

実験結果

リサーチクエスチョン

  • RQ1確率的合成非凸最適化のための、より単純で単一ループの分散低減アルゴリズムを設計可能か? その場合、最適なオラクル複雑度を達成できるか?
  • RQ2収束速度を損なわずに、反復あたりの確率的勾配評価回数を3回から2回に削減することは可能か?
  • RQ3推定子において現在と過去の勾配項の両方に同じサンプルを使用する影響は、収束性と分散低減にどのような影響を与えるか?
  • RQ4別個の減衰係数付きステップサイズを不要とするようにアルゴリズムを単純化できるか? その場合、最適な収束性を維持できるか?
  • RQ5確率的勾配評価の観点から最良の収束速度を達成するための、初期バッチサイズ、ステップサイズ、モーメンタム重みの最適なトレードオフは何か?

主な発見

  • 提案アルゴリズムは、期待される勾配マッピングの二乗ノルムにおいて最適な収束速度 $ \mathcal{O}(T^{-2/3}) $ を達成し、定数倍の要因を除いて理論的下界に一致する。
  • 確率的オラクル複雑度は $ \mathcal{T}_{\nabla f} = \left\lceil \frac{\Delta_0^{1/2}}{2\varepsilon} + \frac{2\Delta_0^{3/2}}{\varepsilon^3} \right\rceil $ であり、$ \Delta_0 = 4L[F(x_0) - F^\star] + 4\sigma^2 $ である。これは定数倍の要因を除いて最適である。
  • アルゴリズムは反復あたりわずか2回の確率的勾配評価しか使用せず、従来の手法が3回を要していたのを改善している。
  • 一部の先行研究とは異なり、有界勾配の仮定を必要としないため、より広範な問題クラスに適用可能である。
  • 適応的重み $ \beta_t $ を用いても収束速度は $ \mathcal{O}(T^{-2/3}) $ のままであるが、適応的スキームが使用される場合は収束速度が $ \mathcal{O}(\log T / T^{2/3}) $ に劣化する。
  • 解析により、初期分散 $ \mathbb{E}[\|v_0 - \nabla f(x_0)\|^2] $ はサイズ $ \tilde{b} = \mathcal{O}(T^{1/3}) $ のミニバッチにより制御可能であり、最適な複雑度を達成するには十分であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。