Skip to main content
QUICK REVIEW

[論文レビュー] Fast Stochastic Variance Reduced Gradient Method with Momentum Acceleration for Machine Learning

Fanhua Shang, Yuanyuan Liu|arXiv (Cornell University)|Mar 23, 2017
Stochastic Gradient Optimization Techniques参考文献 35被引用数 21
ひとこと要約

本稿では、Nesterovのモーメンタムと増大するエポックサイズを組み合わせた、1つの補助変数と1つのモーメンタム重みのみを用いる、新しい確率的バリアンス低減勾配法FSVRGを提案する。強凸問題に対して線形収束を達成し、非強凸問題に対しては最適なO(1/T²)の収束速度を達成し、Katyushaなどの最先端手法を実用的に上回る性能を示す。

ABSTRACT

Recently, research on accelerated stochastic gradient descent methods (e.g., SVRG) has made exciting progress (e.g., linear convergence for strongly convex problems). However, the best-known methods (e.g., Katyusha) requires at least two auxiliary variables and two momentum parameters. In this paper, we propose a fast stochastic variance reduction gradient (FSVRG) method, in which we design a novel update rule with the Nesterov's momentum and incorporate the technique of growing epoch size. FSVRG has only one auxiliary variable and one momentum weight, and thus it is much simpler and has much lower per-iteration complexity. We prove that FSVRG achieves linear convergence for strongly convex problems and the optimal $\mathcal{O}(1/T^2)$ convergence rate for non-strongly convex problems, where $T$ is the number of outer-iterations. We also extend FSVRG to directly solve the problems with non-smooth component functions, such as SVM. Finally, we empirically study the performance of FSVRG for solving various machine learning problems such as logistic regression, ridge regression, Lasso and SVM. Our results show that FSVRG outperforms the state-of-the-art stochastic methods, including Katyusha.

研究の動機と目的

  • Katyushaのような既存の加速確率的手法が複数の補助変数とモーメンタムパラメータを必要とし、計算コストが高くなる問題に対処すること。
  • 強凸および非強凸問題の両方において高速収束を維持する、より単純で効率的な確率的最適化手法の開発。
  • SVM や Lasso のような非滑らか関数を扱えるように、ダミー正則化子に依存せずに拡張すること。
  • 強凸問題では線形収束、非強凸問題では最適なO(1/T²)の収束速度を達成しながら、計算オーバーヘッドを最小限に抑えること。

提案手法

  • Nesterovのモーメンタムを1つの補助変数と1つのモーメンタム重みを用いたバリアンス低減フレームワークに統合した新しい更新則を提案する。
  • 収束を加速するために、外ループごとの内部反復回数を動的に増加させる「増大するエポックサイズ戦略」を採用する。
  • 完全勾配情報と確率的勾配を組み合わせたハイブリッド勾配推定器を用い、効率的なバリアンス低減を実現する。
  • proximal更新を適用してℓ₁ノルムやエラスティックネットのような非滑らか正則化子を直接処理し、SVM や Lasso への直接適用を可能にする。
  • 最適解との距離とモーメンタム項を追跡するリャプノフ関数を用いて収束境界を導出する。
  • 理論的保証を確立:強凸問題では線形収束、非強凸問題ではO(1/T²)の収束速度を達成する。

実験結果

リサーチクエスチョン

  • RQ11つの補助変数と1つのモーメンタムパラメータでのみ、確率的最適化手法が線形収束を達成できるか?
  • RQ2Nesterovのモーメンタムと増大するエポックサイズを組み合わせることで、反復ごとの計算コストを増加させずに収束速度が向上するか?
  • RQ3既存の手法よりも単純である一方で、非強凸問題においても最適なO(1/T²)収束を維持できるか?
  • RQ4SVM や Lasso のような非滑らか問題において、FSVRGは最先端手法と比較してどのように性能を発揮するか?
  • RQ5多様な機械学習タスクにおいて、実用的にスケーラブルで効率的か?

主な発見

  • FSVRGは強凸問題に対して線形収束を達成し、既知の最良の理論的境界と一致する。
  • 非強凸問題では、標準的な確率的手法のO(1/T)よりも優れた最適なO(1/T²)収束速度を達成する。
  • 1つの補助変数と1つのモーメンタム重みのみを必要とし、Katyushaなどの手法と比較して反復ごとの計算コストを顕著に低減する。
  • 実験結果から、ロジスティック回帰、リッジ回帰、Lasso、SVMのタスクにおいて、Katyushaを含む最先端手法を上回る性能を示す。
  • ダミー正則化子を導入せず、SVM や Lasso のような非滑らか問題に直接適用可能であり、性能の低下を回避できる。
  • 増大するエポックサイズ戦略は収束速度を向上させ、非強凸設定における最適な収束速度の達成に寄与する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。