[論文レビュー] Mini-Batch Stochastic ADMMs for Nonconvex Nonsmooth Optimization
本稿では、大規模な非凸で滑らかでない最適化問題に対するミニバッチ確率的 ADMM の変種を提案し、分散低減技術を必要とせずに、定常点への O(1/T) 収束レートを達成する。この手法は、非凸な SVRG-ADMM および SAGA-ADMM にまで拡張され、固定ステップサイズのもとで収束性が保証され、ステップサイズおよびペナルティパラメータの明示的なパラメータ選択ルールが提示される。
With the large rising of complex data, the nonconvex models such as nonconvex loss function and nonconvex regularizer are widely used in machine learning and pattern recognition. In this paper, we propose a class of mini-batch stochastic ADMMs (alternating direction method of multipliers) for solving large-scale nonconvex nonsmooth problems. We prove that, given an appropriate mini-batch size, the mini-batch stochastic ADMM without variance reduction (VR) technique is convergent and reaches a convergence rate of $O(1/T)$ to obtain a stationary point of the nonconvex optimization, where $T$ denotes the number of iterations. Moreover, we extend the mini-batch stochastic gradient method to both the nonconvex SVRG-ADMM and SAGA-ADMM proposed in our initial manuscript \cite{huang2016stochastic}, and prove these mini-batch stochastic ADMMs also reaches the convergence rate of $O(1/T)$ without condition on the mini-batch size. In particular, we provide a specific parameter selection for step size $η$ of stochastic gradients and penalty parameter $ρ$ of augmented Lagrangian function. Finally, extensive experimental results on both simulated and real-world data demonstrate the effectiveness of the proposed algorithms.
研究の動機と目的
- 機械学習およびパターン認識分野における大規模な非凸で滑らかでない最適化問題を解く課題に対処すること。
- 非凸損失関数および正則化子を伴う大規模データセットにスケーリング可能な効率的な確率的 ADMM 変種を開発すること。
- 固定ステップサイズのもとで、分散低減を必要としないミニバッチ確率的 ADMM の収束保証を確立すること。
- 非凸な SVRG-ADMM および SAGA-ADMM へのフレームワークの拡張を図り、ミニバッチサイズに依存しない O(1/T) 収束レートを保証すること。
- 非凸設定におけるステップサイズ η およびペナルティパラメータの適切な選択ルールを提供すること。
提案手法
- データのミニバッチ上で確率的勾配を使用する、非凸で滑らかでない問題に対するミニバッチ確率的 ADMM(STOC-ADMM)を提案する。
- 分散低減がなくても、ミニバッチサイズ M = O(1/ϵ) のもとで、固定ステップサイズのもとで ϵ-定常点への O(1/T) 収束レートを証明する。
- この手法を非凸な SVRG-ADMM および SAGA-ADMM に拡張し、ミニバッチサイズに依存しない O(1/T) 収束を維持する。
- 明示的なパラメータ選択ルールを導入:ステップサイズ η およびペナルティパラメータ ρ が特定の条件 (18)、(24)、(31) を満たすように設定する。
- プライム変数、双対変数、スラック変数に対する交替的更新を伴う拡張ラグランジュ法を適用する。
- 減少スケジュールではなく固定ステップサイズ η を使用することで、実用的に高速な収束を実現する。
実験結果
リサーチクエスチョン
- RQ1分散低減を必要としないミニバッチ確率的 ADMM は、非凸で滑らかでない最適化において、定常点への O(1/T) 収束を達成できるか?
- RQ2提案された STOC-ADMM は、凸設定における減少ステップサイズスケジュールとは対照的に、固定ステップサイズのもとでも収束性と高速な収束レートを維持できるか?
- RQ3同様の O(1/T) 収束レートを達成する非凸な SVRG-ADMM および SAGA-ADMM 変種に、このフレームワークを効果的に拡張できるか?
- RQ4非凸 ADMM の設定において収束を保証するための適切なステップサイズ η およびペナルティパラメータ ρ の選択は何か?
- RQ5実世界およびシミュレートされたデータセットにおいて、提案されたアルゴリズムは、決定的 ADMM や他の確率的変種と比較して実用的にどのように性能を発揮するか?
主な発見
- 分散低減を必要としないミニバッチ確率的 ADMM(STOC-ADMM)は、固定ステップサイズ η であっても、ϵ-定常点への O(1/T) 収束レートを達成する。
- 提案された非凸な SVRG-ADMM および SAGA-ADMM 変種も、ミニバッチサイズに制約がなく、O(1/T) 収束レートを達成する。
- シミュレートおよび実世界のデータセット(例:mnist8m, covtype)における広範な実験により、STOC-ADMM は CPU 時間経過に伴う目的関数値およびテスト損失の低減において、決定的 ADMM を上回ることが示された。
- 特に、導出された条件 (18)、(24)、(31) を満たす ρ の値では、ペナルティパラメータ ρ の広い範囲で安定かつ高い性能を示す。
- 分散低減を用いないにもかかわらず、STOC-ADMM は実用的に SVRG-ADMM や SAGA-ADMM と同等の性能を発揮する。
- η および ρ のパラメータ選択ルールは、複数のデータセットおよび問題タイプにおいて、安定的かつ高速な収束をもたらすことが実験的に検証された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。