Skip to main content
QUICK REVIEW

[논문 리뷰] Last iterate convergence of SGD for Least-Squares in the Interpolation regime

Aditya Varre, Loucas Pillaud‐Vivien|arXiv (Cornell University)|2021. 02. 05.
Stochastic Gradient Optimization Techniques참고 문헌 25인용 수 6
한 줄 요약

이 논문은 최소제곱 문제에서 상수 단계 크기의 확률적 경사하강법(SGD)의 마지막 반복값에 대해, 보간 영역에서 처음으로 명시적인 수렴 속도를 확립한다. 미약한 가정 하에 $O(\ln T / T)$ 및 향상된 $O(1/T)$ 수렴 속도를 증명하고, 비모수적 소스 조건과 용량 조건 하에 $O(1/T^{1+\alpha})$ 빠른 수렴 속도를 도출한다. 이는 평균화나 단계 크기 감소를 피하는 새로운 직접적 리아푸노프 분석 기법을 사용한다.

ABSTRACT

Motivated by the recent successes of neural networks that have the ability to fit the data perfectly and generalize well, we study the noiseless model in the fundamental least-squares setup. We assume that an optimum predictor fits perfectly inputs and outputs $\langle θ_* , ϕ(X) angle = Y$, where $ϕ(X)$ stands for a possibly infinite dimensional non-linear feature map. To solve this problem, we consider the estimator given by the last iterate of stochastic gradient descent (SGD) with constant step-size. In this context, our contribution is two fold: (i) from a (stochastic) optimization perspective, we exhibit an archetypal problem where we can show explicitly the convergence of SGD final iterate for a non-strongly convex problem with constant step-size whereas usual results use some form of average and (ii) from a statistical perspective, we give explicit non-asymptotic convergence rates in the over-parameterized setting and leverage a fine-grained parameterization of the problem to exhibit polynomial rates that can be faster than $O(1/T)$. The link with reproducing kernel Hilbert spaces is established.

연구 동기 및 목표

  • 상수 단계 크기의 SGD의 마지막 반복값이 비강력 볼록, 보간 설정에서 평균화나 단계 크기 감소 없이 수렴하는 것을 증명하는 오랜 도전 과제를 해결하기 위해.
  • 과매개변수화되고 노이즈가 없는 최소제곱 설정에서 비점근적이고 명시적인 수렴 속도를 확립하기 위해.
  • 평균화나 단계 크기 감소 없이 확률적 경사의 변동성을 다룰 수 있는 직접적 리아푸노프 기법을 개발하기 위해.
  • 재생 커널 힐버트 공간과의 연결을 통해 소스 조건과 용량 조건 하에서 정밀한 수렴 속도를 유도하기 위해.

제안 방법

  • 표준 평균화 기법을 피하는 상수 단계 크기 SGD의 마지막 반복값을 분석하기 위해 직접적 리아푸노프 함수 접근법을 제안한다.
  • 공분산 연산자의 고유공간에 대한 재귀 관계를 유도하며, 이는 수렴 분석의 핵심이다.
  • 과거 반복값의 영향을 제어하기 위해 $\mathsf{S}_T(\alpha,\beta) = \sum_{t=1}^{T-1} \frac{1}{t^{1+\alpha}(T-t)^{1+\beta}}$ 를 포함하는 새로운 합계 부등식을 사용한다.
  • 헤이더의 부등식과 철저한 파rameter 균형 조절을 통해 기대 기능 값 오차를 경계한다.
  • 재귀 부등식이 오차 수열을 안정화하도록 단계 크기와 정규화 파rameter를 선택하여 수렴을 확립한다.
  • 공분산 연산자의 스펙트럼과 진짜 파라미터 $\theta_*$ 에 대한 비모수적 소스 및 용량 조건을 활용하여 빠른 수렴 속도를 도출한다.

실험 결과

연구 질문

  • RQ1상수 단계 크기의 SGD의 마지막 반복값이 평균화나 단계 크기 감소 없이 비강력 볼록, 보간 설정에서 수렴할 수 있는가?
  • RQ2노이즈가 없는 최소제곱 문제에서 SGD의 마지막 반복값에 대한 명시적인 비점근적 수렴 속도는 무엇인가?
  • RQ3커널과 진짜 파라미터에 대한 소스 및 용량 조건은 과매개변수화 영역에서 수렴 속도에 어떻게 영향을 미치는가?
  • RQ4직접적 리아푸노프 방법은 분산 감소 없이 마지막 반복값의 확률적 변동성을 다룰 수 있는가?
  • RQ5고유공간 재귀 관계는 보간 영역에서 SGD의 수렴 행동과 어떻게 연결되는가?

주요 결과

  • 상수 단계 크기의 SGD의 마지막 반복값은 최소한의 가정 하에 $O(\ln T / T)$ 수렴 속도를 달성한다.
  • 약간 더 강한 가정 하에 수렴 속도는 $O(1/T)$ 로 향상된다.
  • 비모수적 소스 및 용량 조건 하에, 논문은 $\alpha > 0$ 에 대해 $O(1/T^{1+\alpha})$ 의 빠른 수렴 속도를 확립한다.
  • 분석은 평균화나 단계 크기 감소 없이 마지막 반복값의 확률적 변동성을 성공적으로 제어하는 새로운 직접적 리아푸노프 기법을 도입한다.
  • 공분산 연산자의 고유공간에 대한 재귀 관계가 도출되었으며, 이는 수렴 증명의 핵심이며 향후 SGD 분석에 유용할 수 있다.
  • 결과는 비모수적, 무한차원 설정에서 확립되었으며, 명시적인 재생 커널 힐버트 공간과의 연결이 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.