Skip to main content
QUICK REVIEW

[論文レビュー] Non-strongly-convex smooth stochastic approximation with convergence rate O(1/n)

Francis Bach, Éric Moulines|arXiv (Cornell University)|Jun 10, 2013
Stochastic Gradient Optimization Techniques参考文献 34被引用数 228
ひとこと要約

本稿では、非強凸で滑らかな問題に対して、標準的な確率的勾配降下法(SGD)が達成できるO(1/√n)とは異なり、O(1/n)の収束レートを達成する2つの新しい確率的最適化アルゴリズムを提案する。最小二乗回帰では、定数ステップサイズを用いた平均化された確率的勾配降下法がO(1/n)の収束を達成することを示す。ロジスティック回帰では、SGDと同等の計算効率を維持しながら、局所的な2次近似を構築する新しいアルゴリズムを導入する。

ABSTRACT

We consider the stochastic approximation problem where a convex function has to be minimized, given only the knowledge of unbiased estimates of its gradients at certain points, a framework which includes machine learning methods based on the minimization of the empirical risk. We focus on problems without strong convexity, for which all previously known algorithms achieve a convergence rate for function values of O(1/n^{1/2}). We consider and analyze two algorithms that achieve a rate of O(1/n) for classical supervised learning problems. For least-squares regression, we show that averaged stochastic gradient descent with constant step-size achieves the desired rate. For logistic regression, this is achieved by a simple novel stochastic gradient algorithm that (a) constructs successive local quadratic approximations of the loss functions, while (b) preserving the same running time complexity as stochastic gradient descent. For these algorithms, we provide a non-asymptotic analysis of the generalization error (in expectation, and also in high probability for least-squares), and run extensive experiments on standard machine learning benchmarks showing that they often outperform existing approaches.

研究の動機と目的

  • 標準的手法がO(1/√n)に留まることを踏まえ、非強凸確率的最適化における収束レートのギャップを埋める。
  • 強凸性を必要とせず、O(1/n)の収束を達成するアルゴリズムを開発する。これは、高次元機械学習問題においてしばしば成立しない性質である。
  • 収束速度を向上させつつ、標準的な確率的勾配降下法と同等の計算効率を維持する。
  • 提案されたアルゴリズムの期待値および高確率における非漸近的一般化誤差バウンドを提供する。
  • 標準的な機械学習ベンチマーク上で、提案手法が既存手法を上回ることを実験的に示す。

提案手法

  • 最小二乗回帰において、定数ステップサイズを用いた平均化された確率的勾配降下法を分析し、滑らかさおよびモーメント条件の下でO(1/n)の収束を証明する。
  • ロジスティック回帰において、損失関数の逐次的な局所的2次近似を構築する新しい確率的アルゴリズムを提案する。
  • 新しいアルゴリズムが標準SGDと同等の1反復あたりの計算複雑度を維持することを保証し、大規模データセットへのスケーラビリティを実現する。
  • 非漸近的解析を用いて、両アルゴリズムの期待値および高確率における一般化誤差バウンドを導出する。
  • 損失関数の滑らかさ(二乗およびロジスティック)を活用し、強凸性が欠如しているにもかかわらず、よりタイトな収束レートを導出する。
  • 反復の進化および最適解からの逸脱を制御するため、作用素不等式とモーメントバウンドを組み合わせた新しい解析フレームワークを導入する。

実験結果

リサーチクエスチョン

  • RQ1標準的手法がO(1/√n)に留まることを踏まえ、非強凸問題において確率的最適化がO(1/n)の収束を達成できるか。
  • RQ2強凸性がなくても、定数ステップサイズの平均化されたSGDは最小二乗回帰でO(1/n)の収束を達成できるか。
  • RQ3ロジスティック回帰のための確率的アルゴリズムが、局所的2次近似と低い計算オーバーヘッドを組み合わせることでO(1/n)の収束を達成できるか。
  • RQ4提案されたアルゴリズムの期待値および高確率における非漸近的一般化誤差バウンドは何か。
  • RQ5提案手法は、標準的な機械学習ベンチマーク上で既存手法と比較してどのように評価されるか。

主な発見

  • 定数ステップサイズを用いた平均化された確率的勾配降下法は、強凸性を必要とせず、最小二乗回帰においてO(1/n)の収束レートを達成する。
  • ロジスティック回帰において、局所的2次近似を用いた提案アルゴリズムは、標準SGDと同等の実行時間複雑度を維持しながらO(1/n)の収束を達成する。
  • 最小二乗回帰アルゴリズムの一般化誤差は、期待値および高確率の両方でバウンドされ、問題パラメータへの明示的依存性を有する。
  • 量子、rcv1、newsを含むデータセットにおける実験結果から、提案手法はテスト性能および学習目的関数の収束において、既存手法を上回ることが多い。
  • 非スパースデータセットではSAGが最小の学習誤差を達成するが、高次元スパースデータセットでは定数ステップサイズのSGDが最も優れた性能を示し、提案手法の実用的利点を裏付ける。
  • 理論的解析により、収束レートの向上は、強凸性が欠如している中でも損失関数の滑らかさを活用することで達成されていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。