[論文レビュー] Proximal Splitting Meets Variance Reduction
本稿では、重複グループlassoや全変動など複雑なペナルティを伴う大規模な最適化問題を、1反復あたり1回のプロキシマル作用素評価で効率的に処理できる分散低減型プロキシマルスプリッティング手法Vr-Tosを提案する。この手法は、定常的収束速度を全勾配法と同等に保ちつつ、定常ステップサイズを維持し、メモリコストを低く抑える。特に、複数の非滑らか項を含む問題に対して顕著な利点を示す。
Despite the rise to fame of incremental variance-reduced methods in recent years, their use in nonsmooth optimization is still limited to few simple cases. This is due to the fact that existing methods require to evaluate the proximity operator for the nonsmooth terms, which can be a costly operation for complex penalties. In this work we introduce two variance-reduced incremental methods based on SAGA and SVRG that can efficiently take into account complex penalties which can be expressed as a sum of proximal terms. This includes penalties such as total variation, group lasso with overlap and trend filtering, to name a few. Furthermore, we also develop sparse variants of the proposed algorithms which can take advantage of sparsity in the input data. Like other incremental methods, it only requires to evaluate the gradient of a single sample per iteration, and so is ideally suited for large scale applications. We provide a convergence rate analysis for the proposed methods and show that they converge with a fixed step-size, achieving in some cases the same asymptotic rate as their full gradient variants. Empirical benchmarks on 3 different datasets illustrate the practical advantages of the proposed methods.
研究の動機と目的
- 全勾配法に比べて非効率である既存の確率的分散低減手法が、全変動や重複グループlassoのような複雑な非滑らかペナルティを効率的に処理できない問題を解決すること。
- プロキシマルスプリッティング手法と分散低減技術を統合し、複数の非滑らか項を含む大規模最適化を効率的に行えるようにすること。
- 従来の手法が各ステップでプロキシマル作用素を評価するのに対し、1反復あたり1回の評価でみたてることで、計算コストを低減すること。
- 定常ステップサイズを維持しつつ、全勾配法と同等の漸近的収束速度を達成すること。
- 線形パrameter化された損失関数に対してスパースデータ構造と圧縮メモリストレージをサポートすること。
提案手法
- Vr-Tosは、三作用素スプリッティングフレームワークと確率的分散低減を組み合わせ、Sagaにインspiredされたメモリ効率の良い勾配推定器を用いる。
- 過去の勾配を保持するテーブルを維持し、逐次的に更新することで、線形パラメータ化された損失関数に対してO(n)スカラのメモリコストに抑える。
- 各非滑らか項のプロキシマル作用素を1反復あたり1回のみ評価するため、複雑なペナルティに対してもスケーラブルである。
- 定常ステップサイズを用い、全勾配バージョンと同等の漸近的収束速度を保証する。
- スパース版を導入し、入力データのスパarsityを活用して、勾配ベクトルの代わりにスカラ係数のみを格納する。
- メモリ項と双対変数の初期化は柔軟であり、初期段階でSGDに類似した挙動を示すためにゼロから開始することを推奨する。
実験結果
リサーチクエスチョン
- RQ1分散低減手法をプロキシマルスプリッティングに効果的に統合することで、大規模最適化における複数の非滑らか項を効率的に処理できるか?
- RQ21反復あたり1回のプロキシマル作用素評価で、全勾配法と同等の漸近的収束速度を達成できるか?
- RQ3線形パラメータ化された問題において、勾配表現のスパarsityを活用することで、メモリコストを顕著に低減できるか?
- RQ4KDD12のような大規模データセット(1億4900万サンプル、5400万特徴量)で、Vr-TosはProx-SVRG、Saga、STOSといった既存手法と比べて実際の性能で優れているか?
- RQ5収束保証や計算効率を損なわずに、非滑らか項の数を任意の数に一般化できるか?
主な発見
- Vr-Tosは、定常ステップサイズを用いても、全勾長法と同等の漸近的収束速度を達成する。
- 非滑らか項の数に関わらず、1反復あたり1回のプロキシマル作用素評価でみたてられ、複雑なペナルティの処理に効率的である。
- 4つの大規模データセットにおいて、Prox-SVRG、Saga、STOSといった既存手法よりも収束速度と計算効率で優れている。
- Vr-Tosのスパース版は、線形パラメータ化された損失関数に対してO(n)スカラのメモリ使用量に抑えられ、高次元問題へのスケーラビリティを実現する。
- KDD12データセット(1億4900万サンプル、5400万特徴量)を含むさまざまなデータセットで、安定した性能を維持する。
- 実験結果から、Vr-TosはSGD-TOSや他の分散低減型変種よりも収束が早く、初期段階で有利な初期化と勾配推定のおかげで顕著に優れている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。