[論文レビュー] Momentum-based variance-reduced proximal stochastic gradient method for composite nonconvex stochastic optimization
本稿では、合成非凸確率最適化のための、動き量に基づく分散低減型プロキシマル確率的勾配法PStormを提案する。本手法は、1回または$O(1)$回のサンプルで更新を行うだけで、$O(\varepsilon^{-3})$の最適な複雑度を達成する。動き量とBregman発散に基づくミラー・プロックス更新を活用することで、一般化性能が向上する小バッチ学習が効率的に行える。PStormは、既存の最適手法やvanilla SGDを上回る性能を示す。
Stochastic gradient methods (SGMs) have been extensively used for solving stochastic problems or large-scale machine learning problems. Recent works employ various techniques to improve the convergence rate of SGMs for both convex and nonconvex cases. Most of them require a large number of samples in some or all iterations of the improved SGMs. In this paper, we propose a new SGM, named PStorm, for solving nonconvex nonsmooth stochastic problems. With a momentum-based variance reduction technique, PStorm can achieve the optimal complexity result $O(\varepsilon^{-3})$ to produce a stochastic $\varepsilon$-stationary solution, if a mean-squared smoothness condition holds. Different from existing optimal methods, PStorm can achieve the ${O}(\varepsilon^{-3})$ result by using only one or $O(1)$ samples in every update. With this property, PStorm can be applied to online learning problems that favor real-time decisions based on one or $O(1)$ new observations. In addition, for large-scale machine learning problems, PStorm can generalize better by small-batch training than other optimal methods that require large-batch training and the vanilla SGM, as we demonstrate on training a sparse fully-connected neural network and a sparse convolutional neural network.
研究の動機と目的
- 非凸非滑らか問題に対して、最小限のサンプリング回数で最適な収束複雑度を達成する確率的勾配法の設計。
- 1回または$O(1)$回のサンプルで反復処理を行うことで、小バッチ学習およびオンライン学習を効果的に行い、機械学習における一般化性能を向上。
- 分散低減技術を、非滑らか正則化子を有する合成非凸問題へ拡張し、最適な収束レートを維持すること。
- スパースニューラルネットワークの学習において、vanilla SGD や他の最適手法と比較して優れた性能を示すこと。
提案手法
- PStormは、1強凸なポテンシャル関数$w$を用いてBregman発散$V(\mathbf{x}, \mathbf{z})$を定義するミラー・プロックスフレームワークを採用する。
- 勾配の分散低減と収束加速のため、系列$\{\beta_k\}$を用いた動き量ベースの確率的勾配更新を用いる。
- 各反復で、現在の反復点および直前の反復点における確率的勾配を計算するために、$\xi$の1つまたは少数のサンプルのみを用いる。
- 動き量を用いた分散低減とプロキシマル更新を組み合わせることで、平均二乗滑らか性条件のもとで$O(\varepsilon^{-3})$の複雑度を達成可能となる。
- アルゴリズムはSTORM法のプロキシマル版であり、PStormと名付けられ、オンライン学習および小バッチ学習を想定して設計されている。
- ステップサイズ則と適応的動き量を用いることで、非凸設定における収束性と安定性のバランスを図る。
実験結果
リサーチクエスチョン
- RQ11回または$O(1)$回のサンプルで更新を行う非凸非滑らか問題に対して、最適な$O(\varepsilon^{-3})$の複雑度を達成できる確率的勾配法は存在するか?
- RQ2動き量ベースの分散低減は、スパースニューラルネットワークの小バッチ学習における収束性と一般化性能をどのように向上させるか?
- RQ3平均二乗滑らか性条件下で、大きなバッチサイズを必要とせずに、プロキシマル確率的勾配法が最適な複雑度を維持できるか?
- RQ4PStormは、テスト精度、停留性違反、ニューラルネットワーク学習におけるスパarsityの観点から、vanilla SGD や他の最適手法と比較してどのように差をつけるか?
主な発見
- PStormは、平均二乗滑らか性条件下で、1回のサンプルでの更新のみで、$\varepsilon$-停留解を求めるための最適な$O(\varepsilon^{-3})$の複雑度を達成する。
- スパース全結合ニューラルネットワークにおいて、$\lambda = 5 \times 10^{-4}$の条件下で88.17%のテスト精度を達成し、vanilla SGD や Hybrid-SGD を上回った。
- AllCNNを用いたCifar10データセットにおいて、$\lambda = 5 \times 10^{-4}$の条件下で88.53%のテスト精度を達成し、Hybrid-SGDと同等またはそれを上回り、Spiderboostを著しく上回った。
- $\lambda = 0$の条件下で、PStormはすべての手法の中で最も低い停留性違反(0.19)を記録し、$\lambda = 2 \times 10^{-4}$の条件下で高いスパarsity(72.78%の非ゼロ)を維持した。
- すべてのテストされたハイパーパramーターやデータセットにおいて、PStormはテスト精度および停留性違反の観点で、常に最良または2番目に優れた性能を示した。
- 小バッチ学習の能力と分散低減メカニズムのおかげで、PStormはvanilla SGD や他の最適手法よりも一般化性能に優れている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。