Skip to main content
QUICK REVIEW

[論文レビュー] On Projected Stochastic Gradient Descent Algorithm with Weighted Averaging for Least Squares Regression

Kobi Cohen, Angelia Nedić|arXiv (Cornell University)|Jun 9, 2016
Stochastic Gradient Optimization Techniques参考文献 26被引用数 5
ひとこと要約

本稿では、減少するステップサイズと反復値の重み付き平均を用いて収束を改善する、最小二乗回帰のための重み付き平均付き投影確率的勾配降下法(PSGD-WA)を提案する。有限標本における誤差バウンドを提供し、収束速度が O(1/k) であることを示し、分散項が 1/k の速度で減少し、制約集合項が log k / k² の速度で減少することを示し、漸近的収束比 ρ ≤ 4(d ≥ 1)および ρ ≤ 4/3(d = 1)であることを証明する。

ABSTRACT

The problem of least squares regression of a $d$-dimensional unknown parameter is considered. A stochastic gradient descent based algorithm with weighted iterate-averaging that uses a single pass over the data is studied and its convergence rate is analyzed. We first consider a bounded constraint set of the unknown parameter. Under some standard regularity assumptions, we provide an explicit $O(1/k)$ upper bound on the convergence rate, depending on the variance (due to the additive noise in the measurements) and the size of the constraint set. We show that the variance term dominates the error and decreases with rate $1/k$, while the term which is related to the size of the constraint set decreases with rate $\log k/k^2$. We then compare the asymptotic ratio $ρ$ between the convergence rate of the proposed scheme and the empirical risk minimizer (ERM) as the number of iterations approaches infinity. We show that $ρ\leq 4$ under some mild conditions for all $d\geq 1$. We further improve the upper bound by showing that $ρ\leq 4/3$ for the case of $d=1$ and unbounded parameter set. Simulation results demonstrate strong performance of the algorithm as compared to existing methods, and coincide with $ρ\leq 4/3$ even for large $d$ in practice.

研究の動機と目的

  • 大規模またはストリーミングデータに対して計算制約下での効率的最小二乗回帰の課題に対処すること。
  • 定数ステップサイズの調整を必要としたり収束が遅い可能性のある標準的 SGD の限界を克服すること。
  • 反復値の重み付き平均を組み合わせた投影 SGD を用いることで、有限標本性能を向上させ、収束を加速すること。
  • 提案手法と経験的リスク最小化(ERM)との間の収束速度および漸近的比 ρ の分析、特に高次元設定における性能を明らかにすること。
  • ノイズ分散と制約集合サイズの間のトレードオフを明示的に定量化する有限標本誤差バウンドを提供すること。

提案手法

  • データを1回のパスで処理する、反復値の重み付き平均を組み込んだ投影確率的勾配降下法(PSGD-WA)を提案する。
  • c > 0 および γ ≥ 1 である調整可能なパラメータを用いて、c/(k + γ) の形の減少するステップサイズを用いる。
  • ステップサイズに比例する重みを用いて、過去の反復値の重み付き平均を計算し、最近の推定値に高い影響を与える。
  • 有界かつ凸な制約集合 Ω ⊆ ℝ^d への射影を適用することで、安定性と収束性を保証する。
  • 誤差を分散項とバイアス項に分解し、分散項は測定ノイズに依存し、バイアス項は Ω の直径に依存する。
  • 確率的近似理論と集中不等式を活用し、期待誤差における有限標本バウンドを導出する。

実験結果

リサーチクエスチョン

  • RQ1提案手法 PSGD-WA の最小二乗回帰における有限標本収束速度は何か?
  • RQ2誤差分解における分散項と制約集合関連項の時間的挙動はどのように変化するか?
  • RQ3反復回数が無限大に近づく際の、PSGD-WA と経験的リスク最小化(ERM)との間の漸近的収束比 ρ は何か?
  • RQ4既存の SGD 変種と比較して、PSGD-WA の有限標本精度はどのように異なるか?
  • RQ5収束比 ρ は次元 d に依存せずに有界に保てると考えられるか?また、d = 1 の場合の挙動はいかなるものか?

主な発見

  • 提案手法 PSGD-WA は、O(1/k) の収束速度を達成する有限標本誤差バウンドを実現する。
  • 誤差における分散項は 1/k の速度で減少し、制約集合の直径に関連する項は log k / k² の速度で減少する。
  • PSGD-WA と ERM 間の漸近的収束比 ρ は、やや厳しい条件下でもすべての d ≥ 1 に対して ρ ≤ 4 を満たす。
  • d = 1 かつパラメータ集合が非有界である特別な場合、上界は ρ ≤ 4/3 に改善される。
  • シミュレーション結果は、強力な経験的性能を示しており、d が大きくても ρ ≤ 4/3 が観測され、実用的で頑健であることが示された。
  • 幾何級数的に増加するバッチサイズや小さな初期ステップサイズを必要としないため、非漸近的領域でも適用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。