[論文レビュー] A Stochastic Decoupling Method for Minimizing the Sum of Smooth and Non-Smooth Functions
本稿では、滑らかでない凸関数の有限平均(proximable関数の有限平均)を含む滑らかでない凸関数の和を最小化するための新しい確率的分離手法を提案する。個々の成分のproximal作用素を反復的にサンプリングして更新することで、分散低減を達成し、強い凸性のもとで線形収束率を保証する。従来のアルゴリズムを一般化し、機械学習や最適化における大規模問題の効率的解決を可能にする。
We consider the problem of minimizing the sum of three convex functions: i) a smooth function $f$ in the form of an expectation or a finite average, ii) a non-smooth function $g$ in the form of a finite average of proximable functions $g_j$, and iii) a proximable regularizer $R$. We design a variance-reduced method which is able to progressively learn the proximal operator of $g$ via the computation of the proximal operator of a single randomly selected function $g_j$ in each iteration only. Our method can provably and efficiently accommodate many strategies for the estimation of the gradient of $f$, including via standard and variance-reduced stochastic estimation, effectively decoupling the smooth part of the problem from the non-smooth part. We prove a number of iteration complexity results, including a general ${\cal O}(1/t)$ rate, ${\cal O}(1/t^2)$ rate in the case of strongly convex smooth $f$, and several linear rates in special cases, including accelerated linear rate. For example, our method achieves a linear rate for the problem of minimizing a strongly convex function $f$ subject to linear constraints under no assumption on the constraints beyond consistency. When combined with SGD or SAGA estimators for the gradient of $f$, this leads to a very efficient method for empirical risk minimization. Our method generalizes several existing algorithms, including forward-backward splitting, Douglas-Rachford splitting, proximal SGD, proximal SAGA, SDCA, randomized Kaczmarz and Point-SAGA. However, our method leads to many new specific methods in special cases; for instance, we obtain the first randomized variant of the Dykstra's method for projection onto the intersection of closed convex sets.
研究の動機と目的
- 滑らかでない成分が多数存在する合成凸最適化問題を、効率的に最小化する課題に対処すること。
- 全非滑らか項のproximal作用素を直接計算せずに、個々の成分をサンプリングすることで、分散低減を実現する手法を開発すること。
- 非滑らか問題において、滑らかでない関数がリプシッツ連続でないか、強く凸でない場合を含む最小限の仮定のもとで、線形収束率を達成すること。
- 確率的勾配法(proximal SGD)、SAGA、SDCA、ランダム化Kaczmarzなど、既存のアルゴリズムを一般化するとともに、ランダム化Dykstra法のような新しいバージョンを可能にすること。
- 滑らかでない部分と滑らかでない部分の処理を分離することで、さまざまな勾配推定器(例:SGD、SAGA、SVRG)と柔軟に統合できること。
提案手法
- 本手法は、各反復で一様にランダムにインデックス $ j $ を1つ選んで、$ g_j $ のproximal作用素を計算する確率的分離戦略を採用する。$ g $ の代わりに。
- 収束解析にはリャプノフ関数を用い、プライマル反復、双対変数、およびモーメンタムに類似した項を組み合わせて進行を追跡する。
- 滑らかな関数 $ f $ に対しては、SAGA や SVRG などの分散低減勾配推定器を統合するが、$ f $、$ R $、$ g_j $ のそれぞれに別々のステップサイズを維持する。
- 各非滑らか成分の影響をサンプリング確率に基づいてバランスさせるためのステップサイズルール $ \eta_j = \eta / (m p_j) $ を導入する。
- 非滑らか項の確率的選択と適応的ステップサイズ制御を許容することで、前向き・後退分割やDouglas-Rachford分割を一般化する。
- 凸集合の共通部分への射影のための、Dykstra法のランダム化バージョンを可能にし、非滑らか可行性問題における新規貢献を果たす。
実験結果
リサーチクエスチョン
- RQ1滑らかでない有限和問題に対して、個々の $ g_j $ がリプシッツ連続でないか強く凸でないという仮定なしに、確率的手法が線形収束を達成できるか。
- RQ2全非滑らか項 $ g = \frac{1}{m} \sum_{j=1}^m g_j $ のproximal作用素が計算不能な場合に、非滑らか成分への分散低減を効果的に適用できるか。
- RQ3滑らかでない部分と非滑らかでない部分の分離を活用することで、$ f $ の効率的勾配推定器と非滑らか構造の段階的学習を統合できるか。
- RQ4SAGA や SDCA などの既存の分割法を、線形収束を保証する大規模な非滑らか有限和問題に一般化できるか。
- RQ5本フレームワークは、凸可能性問題のためのDykstra法のランダム化版のような新しいアルゴリズムをサポートできるか。
主な発見
- 凸問題に対して一般に $ \mathcal{O}(1/t) $ の収束レートを達成し、滑らかな問題における最良の既知のレートと一致する。
- $ f $ が強く凸である場合、より速い $ \mathcal{O}(1/t^2) $ のレートを達成し、特別な状況では線形収束(加速線形レートを含む)を達成する。
- 線形制約付きで強く凸な $ f $ を最小化する問題に対して、制約行列に強い仮定を課さずに線形収束を達成する。
- SAGA や SGD 推定器を $ \nabla f $ に組み合わせることで、全射影法に比べて反復あたりのコストを低減し、効率的な経験的リスク最小化を実現する。
- 本手法は、proximal SGD、SAGA、SDCA、ランダム化Kaczmarz、Douglas-Rachford など10以上の既存アルゴリズムを一般化し、凸集合の共通部分への射影のための最初のランダム化Dykstra法を導入する。
- 数値実験では、$ m $ が大きい場合に特に顕著に、全射影SVRGに比べてデータ走査回数を削減することが示された。これは、確率的非滑らか更新の効率的利用によるものである。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。