Skip to main content
QUICK REVIEW

[論文レビュー] Stochastic Quasi-Newton Methods for Nonconvex Stochastic Optimization

Xiao Wang, Shiqian Ma|arXiv (Cornell University)|Jul 5, 2016
Stochastic Gradient Optimization Techniques参考文献 45被引用数 16
ひとこと要約

本稿では、非凸確率的最適化のための確率的減衰L-BFGS(SdLBFGS)手法を提案する。これは、確率的準ニュートン法の一般枠組みに基づき、確率的勾配推定値のみを用いる場合に、逐次的勾配オракル(SFO)を通じてほぼ確実に停留点に収束する。SdLBFGSは、ε-近似停留点を求めるためにO(ε⁻²)のSFO呼び出し回数を達成し、SVRGと組み合わせたバリアント(SdLBFGS-VR)を導入。SVMおよびニューラルネットワークタスクにおいて、SVRGおよび標準SdLBFGSを上回る性能を発揮する。

ABSTRACT

In this paper we study stochastic quasi-Newton methods for nonconvex stochastic optimization, where we assume that noisy information about the gradients of the objective function is available via a stochastic first-order oracle (SFO). We propose a general framework for such methods, for which we prove almost sure convergence to stationary points and analyze its worst-case iteration complexity. When a randomly chosen iterate is returned as the output of such an algorithm, we prove that in the worst-case, the SFO-calls complexity is $O(ε^{-2})$ to ensure that the expectation of the squared norm of the gradient is smaller than the given accuracy tolerance $ε$. We also propose a specific algorithm, namely a stochastic damped L-BFGS (SdLBFGS) method, that falls under the proposed framework. {Moreover, we incorporate the SVRG variance reduction technique into the proposed SdLBFGS method, and analyze its SFO-calls complexity. Numerical results on a nonconvex binary classification problem using SVM, and a multiclass classification problem using neural networks are reported.

研究の動機と目的

  • 確率的勾配オラクル(SFO)を介してのみノイズの多い勾配推定値が得られる非凸確率的最適化の課題に対処する。
  • 弱い条件下でも停留点へのグローバル収束を保証する確率的準ニュートン法の一般枠組みを開発する。
  • 凸性を仮定せず、ヘッセ行列の近似が正定値のままであるように保つための減衰L-BFGSの変種(SdLBFGS)を設計する。
  • SdLBFGSフレームワークに分散低減(SVRG)を統合し、収束速度と安定性を向上させる。
  • SVMおよび深層ニューラルネットワークを用いた非凸分類問題において、提案手法の有効性を実証する。

提案手法

  • ヘッセ行列の近似が正定値のままであるように保つために、減衰BFGS更新を用いる一般確率的準ニュートンフレームワークを提案する。
  • 全勾配計算を回避するため、ノイズのある勾配推定値を取得するために確率的一次オラクル(SFO)を用いる。
  • 曲率条件 $ s_{k-1}^T y_{k-1} < 0 $ が満たされない場合でも、ヘッセ行列の近似が正定値のままであることを保証するためのダミング技術を組み込む。
  • SdLBFGS法とSVRG分散低減技術を組み合わせてSdLBFGS-VRを導入し、定期的に全勾配を計算する。
  • SdLBFGS-VRでは一定ステップサイズを用い、SdLBFGSでは徐々に小さくするステップサイズを用い、収束を保証する。また、勾配分散を低減する目的でSVRGの外ループ構造を採用する。
  • 出力としてランダムに選択された反復点を用い、最悪ケースのSFO呼び出し回数の理論的解析を行う。

実験結果

リサーチクエスチョン

  • RQ1SFOへのアクセスのみを前提とした非凸確率的最適化において、停留点へのグローバル収束を保証する確率的準ニュートン法を設計可能か?
  • RQ2このような手法がε-近似停留点に到達するまでの最悪ケースのSFO呼び出し回数はどの程度か?
  • RQ3減衰L-BFGS更新は、凸性を仮定せず、ヘッセ行列の近似が正定値のままであるように保つ仕組みは何か?
  • RQ4SdLBFGSフレームワークに分散低減(SVRG)を統合することで、収束速度と安定性が向上するか?
  • RQ5SdLBFGS-VRの性能は、実世界の非凸分類問題においてSVRGおよび標準SdLBFGSと比較してどのように異なるか?

主な発見

  • 提案されたSdLBFGS法は、適切なステップサイズ条件のもとで、ほぼ確実に停留点に収束する。
  • SdLBFGSの最悪ケースSFO呼び出し回数は、$ \text{E}[ orm{\nabla f(x)}^2] \leq \epsilon $ を達成するために $ O(\epsilon^{-2}) $ であり、確率的勾配法の最良既知の複雑度と一致する。
  • 分散低減版SdLBFGS-VRは、RCV1およびMNISTデータセットにおいて、常にSVRGおよび標準SdLBFGSを上回る性能を示す。
  • 数値実験の結果、SdLBFGS-VRはバッチサイズやメモリサイズに対して相対的に感度が低く、より大きなメモリサイズを用いることでわずかに性能が向上する。
  • 同じステップサイズを用いた場合、SdLBFGS-VRはSVRGよりもより良い目的関数値の低減を達成し、一定ステップサイズを用いたSdLBFGSよりも安定性に優れる。
  • より大きなメモリサイズやバッチサイズを用いることで、$ s_{k-1}^T y_{k-1} < 0 $ となる反復回数が顕著に減少し、曲率推定の改善が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。