Skip to main content
QUICK REVIEW

[論文レビュー] Last iterate convergence of SGD for Least-Squares in the Interpolation regime

Aditya Varre, Loucas Pillaud‐Vivien|arXiv (Cornell University)|Feb 5, 2021
Stochastic Gradient Optimization Techniques参考文献 25被引用数 6
ひとこと要約

本稿は、最小二乗問題における定数ステップサイズの確率的勾配降下法(SGD)の最後の反復について、補間領域で初めて明示的な収束速度を確立した。弱い仮定の下で $O(\ln T / T)$ および改善された $O(1/T)$ の収束速度を証明し、非パラメトリックなソースおよび容量条件の下では $O(1/T^{1+\alpha})$ の高速収束速度を示した。これは、平均化やステップサイズの減少を回避する、新しい直接的リャプノフ解析を用いて達成された。

ABSTRACT

Motivated by the recent successes of neural networks that have the ability to fit the data perfectly and generalize well, we study the noiseless model in the fundamental least-squares setup. We assume that an optimum predictor fits perfectly inputs and outputs $\langle θ_* , ϕ(X) angle = Y$, where $ϕ(X)$ stands for a possibly infinite dimensional non-linear feature map. To solve this problem, we consider the estimator given by the last iterate of stochastic gradient descent (SGD) with constant step-size. In this context, our contribution is two fold: (i) from a (stochastic) optimization perspective, we exhibit an archetypal problem where we can show explicitly the convergence of SGD final iterate for a non-strongly convex problem with constant step-size whereas usual results use some form of average and (ii) from a statistical perspective, we give explicit non-asymptotic convergence rates in the over-parameterized setting and leverage a fine-grained parameterization of the problem to exhibit polynomial rates that can be faster than $O(1/T)$. The link with reproducing kernel Hilbert spaces is established.

研究の動機と目的

  • 定数ステップサイズのSGDの最後の反復の収束を、強い凸でないが補間的である設定で証明するという長年の課題を解決すること。
  • 過パラメータ化され、ノイズのない最小二乗設定において、非漸近的かつ明示的な収束速度を確立すること。
  • 平均化やステップサイズの減少を用いず、確率的勾配の揺らぎを扱える直接的リャプノフ技術を開発すること。
  • 再生核ヒルベルト空間と結びつけ、ソースおよび容量条件の下で詳細な収束速度を導出すること。

提案手法

  • 標準的な平均化手法を避けるために、定数ステップサイズのSGDの最後の反復を解析するための直接的リャプノフ関数のアプローチを提案する。
  • 共分散演算子の固有空間における再帰的関係を導出し、収束解析の中心的役割を果たす。
  • 過去の反復の影響を制御するため、$\mathsf{S}_T(\alpha,\beta) = \sum_{t=1}^{T-1} \frac{1}{t^{1+\alpha}(T-t)^{1+\beta}}$ を含む新しい和の不等式を考案する。
  • ホルダーの不等式を用い、適切なパrameterのバランスをとることで、期待関数値誤差を抑え込む。
  • 再帰的不等式が誤差列を安定化させるようにステップサイズおよび正則化パラメータを選択することで収束を確立する。
  • 共分散演算子の固有値スペクトルおよび真のパラメータ $\theta_*$ に対する非パラメトリックなソースおよび容量条件を活用し、高速収束速度を導出する。

実験結果

リサーチクエスチョン

  • RQ1定数ステップサイズのSGDの最後の反復は、平均化やステップサイズの減少なしに、強い凸でないが補間的設定で収束するか?
  • RQ2ノイズのない最小二乗問題におけるSGDの最後の反復の明示的非漸近的収束速度は何か?
  • RQ3カーネルおよび真のパラメータのソースおよび容量条件は、過パラメータ化領域における収束速度にどのように影響するか?
  • RQ4直接的リャプノフ法は、分散低減なしに、最後の反復の確率的揺らぎを扱えるか?
  • RQ5固有空間における再帰的関係と、補間領域におけるSGDの収束行動にはどのような関係があるか?

主な発見

  • 定数ステップサイズのSGDの最後の反復は、最小限の仮定の下で $O(\ln T / T)$ の収束速度を達成する。
  • やや強い仮定の下では、収束速度が $O(1/T)$ に改善される。
  • 非パラメトリックなソースおよび容量条件の下では、$\alpha > 0$ に対して $O(1/T^{1+\alpha})$ の高速収束速度が確立される。
  • 本稿の解析は、平均化やステップサイズの減少を用いず、最後の反復の確率的揺らぎを制御できる、新しい直接的リャプノフ技術を導入した。
  • 共分散演算子の固有空間における再帰的関係が導出され、これは収束証明の中心的役割を果たし、今後のSGD解析においても有用である可能性がある。
  • 結果は非パラメトリックかつ無限次元の設定で確立されており、明示的な再生核ヒルベルト空間への接続がなされている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。