Skip to main content
QUICK REVIEW

[論文レビュー] Convergence Rate Analysis of a Stochastic Trust Region Method via Submartingales

José Blanchet, Coralia Cartis|arXiv (Cornell University)|Sep 23, 2016
Stochastic Gradient Optimization Techniques参考文献 22被引用数 15
ひとこと要約

本稿は、ノイズが伴う自己適合的推定のもとで信頼領域法の収束速度を分析するための、スーパーmartingaleを用いた新しい確率過程フレームワークを導入する。ノイズのある一般の条件下で、$O(\epsilon^{-2})$ の最初のグローバル複雑度バウンドを確立し、追加の仮定のもとで $O(\epsilon^{-3})$ の2次収束へ拡張する。

ABSTRACT

We propose a novel framework for analyzing convergence rates of stochastic optimization algorithms with adaptive step sizes. This framework is based on analyzing properties of an underlying generic stochastic process, in particular by deriving a bound on the expected stopping time of this process. We utilize this framework to analyze the bounds on expected global convergence rates of a stochastic variant of a traditional trust region method, introduced in \cite{ChenMenickellyScheinberg2014}. While traditional trust region methods rely on exact computations of the gradient, Hessian and values of the objective function, this method assumes that these values are available up to some dynamically adjusted accuracy. Moreover, this accuracy is assumed to hold only with some sufficiently large, but fixed, probability, without any additional restrictions on the variance of the errors. This setting applies, for example, to standard stochastic optimization and machine learning formulations. Improving upon the analysis in \cite{ChenMenickellyScheinberg2014}, we show that the stochastic process defined by the algorithm satisfies the assumptions of our proposed general framework, with the stopping time defined as reaching accuracy $\| abla f(x)\|\leq ε$. The resulting bound for this stopping time is $O(ε^{-2})$, under the assumption of sufficiently accurate stochastic gradient, and is the first global complexity bound for a stochastic trust-region method. Finally, we apply the same framework to derive second order complexity bound under some additional assumptions.

研究の動機と目的

  • 自己適合的ステップサイズを用いた確率的最適化アルゴリズムの収束速度を分析するための一般枠組みを構築すること。
  • 動的かつ正確な勾配およびヘッセ行列推定を用いる確率的信頼領域法の期待されるグローバル収束速度を分析すること。
  • 分散制限なしの一般のノイズ仮定のもとで、確率的信頼領域法の最初のグローバル複雑度バウンドを確立すること。
  • 追加の正則性仮定のもとで、2次収束のための複雑度バウンドを導出する枠組みを拡張すること。
  • アルゴリズムが、決定的ケースと同等の複雑度で2次停留点に収束することを示すこと。

提案手法

  • 勾配、ヘッセ行列、目的関数値が時間とともに適応的に精度が向上するように推定される確率的信頼領域法を定式化する。
  • アルゴリズムによって定義される確率過程の期待停止時刻をバウンドするため、スーパーmartingaleに基づくフレームワークを適用する。
  • 停止時刻を $\|\nabla f(x)\| \leq \epsilon$ として定義し、1次停留性に対応させる。
  • リプシッツ定数とモデル精度パラメータから導かれる定数を用いて、リャプノフ型関数 $\Phi_k$ の期待減少量を導出する。
  • 確率的推定の精度に関する仮定(例:$\epsilon_F$, $\eta_2$)を用いてモデル品質を制御し、収束を保証する。
  • 1次および2次の場合の両方に対してフレームワークを適用し、過程の期待停止時刻を用いて複雑度バウンドを導出する。

実験結果

リサーチクエスチョン

  • RQ1自己適合的確率的最適化アルゴリズムの収束速度を分析するための一般の確率過程フレームワークを開発できるか?
  • RQ2勾配およびヘッセ行列推定がノイズを伴っても徐々に正確になる場合、確率的信頼領域法のグローバル収束複雑度はいかほどか?
  • RQ3一般のノイズ条件下でも、確率的信頼領域法は決定的信頼領域法と同等の収束速度を達成するか?
  • RQ4このフレームワークを拡張して、2次停留点への収束に関する2次複雑度バウンドを確立できるか?
  • RQ5確率的推定の適応的精度が、アルゴリズムの収束速度と全体の複雑度にどのように影響するか?

主な発見

  • 提案されたフレームワークにより、一般のノイズ仮定のもとで、確率的信頼領域法の最初のグローバル複雑度バウンド $O(\epsilon^{-2})$ が確立された。
  • 勾配推定が十分に正確な場合、$\|\nabla f(x)\| \leq \epsilon$ を達成するための期待停止時刻 $\mathbb{E}[T_\epsilon]$ は $O(\epsilon^{-2})$ でバウンドされる。
  • 2次収束の場合は、追加の仮定のもとで期待停止時刻が $O(\epsilon^{-3})$ でバウンドされ、決定的ケースと一致する。
  • 複雑度バウンドは、リャプノフ関数 $\Phi_k$ のスーパーmartingale解析を経て得られ、リプシッツ定数とモデル精度パラメータに依存する明示的な定数を含む。
  • 完全な勾配計算を必要としないため、完全に確率的かつ大規模な機械学習設定に適している。
  • このフレームワークは汎用的であり、すでに確率的ラインサーチなど他のアルゴリズムへの応用がなされており、広範な適用可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。