Skip to main content
QUICK REVIEW

[論文レビュー] Asynchronous Stochastic Proximal Methods for Nonconvex Nonsmooth Optimization

Rui Zhu, Di Niu|arXiv (Cornell University)|Feb 24, 2018
Stochastic Gradient Optimization Techniques参考文献 31被引用数 4
ひとこと要約

本稿では、凸正則化子を伴う非凸・非滑らか最適化問題に対して、非同期プロキシスティラス勾配降下法(Asyn-ProxSGD)を提案し、分析している。定常ミニバッチサイズおよび分散低減なしの条件下で、$O(1/\sqrt{K})$ のエルゴディック収束レートを確立した。これは、非凸設定下での非同期ProxSGDにおいて、初めてのこのような結果であり、非同期SGDと同等のレートを達成している。

ABSTRACT

We study stochastic algorithms for solving nonconvex optimization problems with a convex yet possibly nonsmooth regularizer, which find wide applications in many practical machine learning applications. However, compared to asynchronous parallel stochastic gradient descent (AsynSGD), an algorithm targeting smooth optimization, the understanding of the behavior of stochastic algorithms for nonsmooth regularized optimization problems is limited, especially when the objective function is nonconvex. To fill this theoretical gap, in this paper, we propose and analyze asynchronous parallel stochastic proximal gradient (Asyn-ProxSGD) methods for nonconvex problems. We establish an ergodic convergence rate of $O(1/\sqrt{K})$ for the proposed Asyn-ProxSGD, where $K$ is the number of updates made on the model, matching the convergence rate currently known for AsynSGD (for smooth problems). To our knowledge, this is the first work that provides convergence rates of asynchronous parallel ProxSGD algorithms for nonconvex problems. Furthermore, our results are also the first to show the convergence of any stochastic proximal methods without assuming an increasing batch size or the use of additional variance reduction techniques. We implement the proposed algorithms on Parameter Server and demonstrate its convergence behavior and near-linear speedup, as the number of workers increases, on two real-world datasets.

研究の動機と目的

  • 非凸・非滑らか最適化問題における非同期確率的プロキシ方法の理論的理解の不足に対処する。
  • 目的関数が非凸で正則化子が非滑らかである場合の非同期プロキシ勾配法の収束解析のギャップを埋める。
  • 分散低減やバッチサイズの増加なしに、定常ミニバッチサイズの下で確率的プロキシ方法の収束保証を提供する。
  • パラメータサーバー・フレームワーク上での実装を通じて、実用的なスケーラビリティとスルーブプを示す。

提案手法

  • 非凸最適化に適した非滑らか正則化子を伴う非同期プロキシ確率的勾配降下法(Asyn-ProxSGD)を提案する。
  • 各ワーカーノードで訓練データのランダムにサンプリングされたミニバッチ上で計算された確率的勾配を使用する。
  • 目的関数 $\Psi(x) = f(x) + h(x)$ の非滑らか正則化項 $h(x)$ を処理するためにプロキシタル操作子を適用する。
  • 同期なしの更新を許容し、ワーカーが独立してグローバルモデルを更新することで通信オーバーヘッドを低減する。
  • 非凸問題におけるエルゴディック収束レートフレームワークを用いて収束を分析する。
  • 分散低減技術なしで定常ミニバッチサイズの下での理論的収束を確立する。

実験結果

リサーチクエスチョン

  • RQ1非同期確率的プロキシ勾配法は、非凸・非滑らか最適化問題において収束を達成できるか?
  • RQ2分散低減なしで定常ミニバッチサイズの下での非同期ProxSGDの収束レートは何か?
  • RQ3非同期ProxSGDは、ワーカー数が増加するに従い、実際のスケーリングでほぼ線形のスルーブプを達成するか?
  • RQ4収束レートとスケーラビリティの観点から、非同期SGDと比較してAsyn-ProxSGDの収束特性はどうなるか?

主な発見

  • 提案されたAsyn-ProxSGDは、非凸問題において $O(1/\sqrt{K})$ のエルゴディック収束レートを達成し、非同期SGDと同等のレートを示した。
  • これは、バッチサイズの増加や分散低減を仮定しない非凸設定下での非同期ProxSGDの収束速度に関する最初の結果である。
  • 2つの実世界データセットを用いた実験評価により、ワーカー数が増加するに従い、ほぼ線形のイテレーションおよび実行時間のスルーブプが得られた。
  • a9aデータセットでは、サブオプティマルティー $10^{-3}$ において、8ワーカーでイテレーション速度が5.973倍、実行時間速度が5.876倍に向上した。
  • MNISTデータセットでは、8ワーカーでイテレーション速度が7.352倍、実行時間速度が5.714倍に向上した。
  • 理論的分析により、ワーカー数が $O(K^{1/4})$ に制限される場合、線形スルーブプが達成可能であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。