Skip to main content
QUICK REVIEW

[論文レビュー] Variance Reduction via Accelerated Dual Averaging for Finite-Sum Optimization

Chaobing Song, Yong Jiang|arXiv (Cornell University)|Jun 18, 2020
Stochastic Gradient Optimization Techniques被引用数 6
ひとこと要約

本稿では、有限和凸最適化のための統一的アルゴリズムである分散低減による加速双対平均法(VRADA)を提案する。このアルゴリズムは、$O(1/n)$-精度の解を$O(n\log\log n)$回の確率的勾配評価で達成し、既存で最も良い$O(n\log n)$の複雑さを上回る。VRADAは一般および強い凸設定の両方で既知の下界に一致し、全範囲にわたる簡素化され統一された収束解析を実現する。

ABSTRACT

In this paper, we introduce a simplified and unified method for finite-sum convex optimization, named \emph{Variance Reduction via Accelerated Dual Averaging (VRADA)}. In both general convex and strongly convex settings, VRADA can attain an $O\big(\frac{1}{n}\big)$-accurate solution in $O(n\log\log n)$ number of stochastic gradient evaluations which improves the best-known result $O(n\log n)$, where $n$ is the number of samples. Meanwhile, VRADA matches the lower bound of the general convex setting up to a $\log\log n$ factor and matches the lower bounds in both regimes $n\le Θ(κ)$ and $n\gg κ$ of the strongly convex setting, where $κ$ denotes the condition number. Besides improving the best-known results and matching all the above lower bounds simultaneously, VRADA has more unified and simplified algorithmic implementation and convergence analysis for both the general convex and strongly convex settings. The underlying novel approaches such as the novel initialization strategy in VRADA may be of independent interest. Through experiments on real datasets, we show the good performance of VRADA over existing methods for large-scale machine learning problems.

研究の動機と目的

  • 大規模な有限和最適化における確率的勾配降下法(SGD)の高い反復複雑さを軽減するため、勾配分散を低減すること。
  • 一般凸と強い凸の両設定で効率的に動作する統一されたアルゴリズムを設計し、それぞれの状態に別個に最適化しないこと。
  • 一般凸と強い凸の両設定において、$O(1/n)$-精度の解を得るための反復複雑さを$O(n\log\log n)$に改善すること。これは、従来の最良の$O(n\log n)$を上回る。
  • 一般凸および強い凸の両設定において、既知の理論的下界に一致すること。特に、$n \leq \Theta(\kappa)$および$n \gg \kappa$の両状況を含む。
  • 従来の手法の複雑さを避け、アルゴリズムの明快さと実装可能性を高める、簡素化され統一された収束解析を提供すること。

提案手法

  • 一般凸および強い凸設定の両方を統一的に取り扱える、VRADAにおける新規な初期化戦略を導入する。
  • 加速双対平均法を活用し、モーメンタムと分散低減を統合することで収束速度を向上させる。
  • 形式$\tilde{\nabla}g_i(\mathbf{x}) = \nabla g_i(\mathbf{x}) - \nabla g_i(\tilde{\mathbf{x}}) + \nabla g(\tilde{\mathbf{x}})$の分散低減勾配推定器を用いる。ここで$\tilde{\mathbf{x}}$はアンカー点である。
  • 時間経過とともに勾配を蓄積する双対平均更新を維持することで、分散制御と類似した加速効果を実現する。
  • 同じコア構造を用いて、$\sigma = 0$(一般凸)および$\sigma > 0$(強い凸)の両ケースを統一的に取り扱う収束解析フレームワークを適用する。
  • 新規なリャプノフ関数を導入し、期待される最適性ギャップの境界を導出することで、$O(n\log\log n)$の複雑さを達成する。

実験結果

リサーチクエスチョン

  • RQ1一般凸および強い凸の両有限和最適化問題において、同一のアルゴリズムが最適な収束複雑さを達成可能か?
  • RQ2有限和設定において、分散低減と加速の解析および実装を統一することは可能か?
  • RQ3有限和問題において、$O(1/n)$-精度を得るために必要な最小の確率的勾配評価回数は何か?
  • RQ4一般凸および強い凸の両設定において、$n \leq \Theta(\kappa)$および$n \gg \kappa$の両状況を含め、既知の下界に一致できるか?
  • RQ5簡素化された初期化および更新スキームは、先行の加速分散低減手法と比較して、より優れた実験的性能と理論的明快さをもたらすか?

主な発見

  • VRADAは、$O(1/n)$-精度の解を$O(n\log\log n)$回の確率的勾配評価で達成し、従来の最良の$O(n\log n)$の複雑さを上回る。
  • 一般凸有限和最適化における既知の下界に、$\log\log n$要因を除き一致する。
  • 強い凸設定では、$n \leq \Theta(\kappa)$および$n \gg \kappa$の両状況で下界に一致する。
  • 実データセット(a9aおよびcovtype)において、SVRG、Katyusha、MiGと比較して優れた実験的性能を示し、特に条件数が大きい状況で顕著である。
  • 一般凸($\lambda = 0$)、大きな条件数($\lambda = 10^{-8}$)、小さな条件数($\lambda = 10^{-4}$)の3つの状況すべてで、強力な性能を維持しており、統一的設計の有効性を裏付けている。
  • VRADAにおける新規な初期化戦略は、より良い誤差キャンセリングを実現し、特に強い凸設定において、より攻撃的なパrameterチューニングを可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。