[논문 리뷰] Almost sure convergence rates for Stochastic Gradient Descent and Stochastic Heavy Ball
이 논문은 일반적인 확률적 근사 설정에서 확률적 경사 하강법(SGD)과 확률적 무거운 공(method, SHB)에 대해 처음으로 거의 확실히 수렴하는 속도를 확립한다. 이는 볼록이고 미세한 설정에서 SGD의 반복값 가중 평균이 거의 확실히 $o(1/ar{\sqrt{k}})$에 가까운 속도로 수렴함을 증명하며, 과다 매개변수화된 경우 $o(1/k)$로 향상됨을 보이며, SHB의 마지막 반복값에 대해서도 유사한 속도를 확보한다. 결과는 선형 검색과 폴리악 단계 크기와 같은 적응형 단계 크기 전략으로 확장되며, 기울기 노름에 대한 비볼록 수렴 속도도 포함된다.
We study stochastic gradient descent (SGD) and the stochastic heavy ball method (SHB, otherwise known as the momentum method) for the general stochastic approximation problem. For SGD, in the convex and smooth setting, we provide the first \emph{almost sure} asymptotic convergence \emph{rates} for a weighted average of the iterates . More precisely, we show that the convergence rate of the function values is arbitrarily close to $o(1/\sqrt{k})$, and is exactly $o(1/k)$ in the so-called overparametrized case. We show that these results still hold when using stochastic line search and stochastic Polyak stepsizes, thereby giving the first proof of convergence of these methods in the non-overparametrized regime. Using a substantially different analysis, we show that these rates hold for SHB as well, but at the last iterate. This distinction is important because it is the last iterate of SGD and SHB which is used in practice. We also show that the last iterate of SHB converges to a minimizer \emph{almost surely}. Additionally, we prove that the function values of the deterministic HB converge at a $o(1/k)$ rate, which is faster than the previously known $O(1/k)$. Finally, in the nonconvex setting, we prove similar rates on the lowest gradient norm along the trajectory of SGD.
연구 동기 및 목표
- 기계 학습과 최적화의 핵심 문제인 확률적 근사 문제에서 SGD와 SHB의 거의 확실히 수렴하는 속도를 확립하는 것.
- SGD와 SHB에 대해 기대값에 대한 수렴만을 다루는 기존 문헌의 격차를 메우기 위해, 거의 확실히 수렴하는 속도를 제공하는 것.
- 비과다 매개변수화된 영역에서 스토하스틱 선형 검색과 스토하스틱 폴리악 단계 크기와 같은 적응형 단계 크기 전략에 대한 수렴 보장을 확장하는 것.
- 실제 적용에 핵심적인 요소인 SHB의 마지막 반복값이 거의 확실히 최소화자로 수렴함을 보이는 것.
- 결정론적 무거운 공 방법에 대해 더 빠른 수렴 속도를 도출하여, 이전에 알려진 $O(1/k)$보다 $o(1/k)$로 향상됨을 증명하는 것.
제안 방법
- 거의 확실히 수렴하는 분석을 위해, 로빈스-시그먼드 초마르팅게일 정리를 활용한 SGD 반복값의 새로운 가중 평균을 도입한다.
- 기존의 로빈스-몬로 조건을 초월하여 거의 확실히 수렴하는 속도를 보장하는 새로운 단계 크기 조건(조건 1)을 개발한다.
- SHB 분석을 위해 라플라스 함수 접근법을 적용하며, 상태 벡터 $z_k = x_k + \lambda_k(x_k - x_{k-1})$를 사용해 수렴을 추적한다.
- 조건부 기대값과 볼록성/부드러움 가정을 활용해 최소화자와의 거리 감소량과 목적 함수 갭의 기대 감소를 제한한다.
- 적분 구간과 渐近 분석을 적용하여, 특히 $\eta_k \propto 1/\sqrt{k}$와 같은 조화 수열 유사 단계 크기 수열에 대해 수렴 속도를 유도한다.
- 비볼록 설정 하에서 ABC 조건 하에 거의 확실히 수렴하는 최소 기울기 노름의 속도가 $o(1/\sqrt{k})$임을 증명한다.
실험 결과
연구 질문
- RQ1볼록이고 부드러운 확률적 근사 설정에서 SGD의 거의 확실히 수렴하는 속도는 무엇인가?
- RQ2SGD의 수렴 속도는 과다 매개변수화된 경우, 즉 $\nabla f_v(x_*) = 0$일 때 $o(1/k)$로 향상될 수 있는가?
- RQ3스토하스틱 선형 검색과 스토하스틱 폴리악 단계 크기와 같은 적응형 단계 크기 방법은 거의 확실히 수렴하는가, 그리고 어떤 속도로 수렴하는가?
- RQ4실제로 사용되는 SHB의 마지막 반복값에 대해 유사한 거의 확실히 수렴하는 속도를 확립할 수 있는가?
- RQ5결정론적 무거운 공 방법의 거의 확실히 수렴하는 속도는 무엇이며, 이는 이전에 알려진 $O(1/k)$를 초월하여 향상되는가?
주요 결과
- SGD의 경우, 반복값의 가중 평균에서의 함수 값이 볼록이고 부드러운 설정에서 거의 확실히 $o(1/\sqrt{k})$에 가까운 속도로 수렴한다.
- 스토하스틱 기울기가 최소화자에서 0이 되는 과다 매개변수화된 경우, 수렴 속도가 $o(1/k)$로 향상된다.
- 스토하스틱 선형 검색과 스토하스틱 폴리악 단계 크기 전략에 대해서도 결과가 성립하며, 비과다 매개변수화된 영역에서 처음으로 거의 확실히 수렴함을 증명한다.
- SHB의 경우, 마지막 반복값이 거의 확실히 최소화자로 수렴하며, 함수 값은 거의 확실히 $o(1/\sqrt{k})$에 가까운 속도로 수렴한다.
- 과다 매개변수화된 경우, SHB의 마지막 반복값은 $o(1/k)$ 수렴 속도를 달성하며, 이는 SGD의 최고 수준의 알려진 속도와 일치한다.
- 결정론적 무거운 공 방법은 $o(1/k)$ 속도로 수렴하며, 이는 이전에 알려진 $O(1/k)$ 속도를 향상시킨다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.