Skip to main content
QUICK REVIEW

[논문 리뷰] On the Convergence of Step Decay Step-Size for Stochastic Optimization

Xiaoyu Wang, Sindri Magnússon|arXiv (Cornell University)|2021. 02. 18.
Stochastic Gradient Optimization Techniques참고 문헌 38인용 수 4
한 줄 요약

이 논문은 비볼록, 볼록, 강볼록 설정에서 단계 감소 스텝 사이즈를 사용하는 확률적 경사 하강법(SGD)에 대해 최초로 비점근적 수렴 보장을 확립한다. 비볼록 미분 가능 문제에 대해 $Ó(\ln T/\sqrt{T})$ 속도를 증명하였고, 일반 볼록 문제에 대해서도 $Ó(\ln T/\sqrt{T})$를, 미분 가능 강볼록 문제에 대해서는 $Ó(\ln T/T)$를 확보하였으며, 후자의 경우 이론적 날카러움이 입증되었다.

ABSTRACT

The convergence of stochastic gradient descent is highly dependent on the step-size, especially on non-convex problems such as neural network training. Step decay step-size schedules (constant and then cut) are widely used in practice because of their excellent convergence and generalization qualities, but their theoretical properties are not yet well understood. We provide the convergence results for step decay in the non-convex regime, ensuring that the gradient norm vanishes at an $\mathcal{O}(\ln T/\sqrt{T})$ rate. We also provide the convergence guarantees for general (possibly non-smooth) convex problems, ensuring an $\mathcal{O}(\ln T/\sqrt{T})$ convergence rate. Finally, in the strongly convex case, we establish an $\mathcal{O}(\ln T/T)$ rate for smooth problems, which we also prove to be tight, and an $\mathcal{O}(\ln^2 T /T)$ rate without the smoothness assumption. We illustrate the practical efficiency of the step decay step-size in several large scale deep neural network training tasks.

연구 동기 및 목표

  • 딥 러닝에서 널리 사용되지만 엄밀한 수렴 분석이 부족한 단계 감소 스텝 사이즈의 이론적 격차를 메우기 위해.
  • 비볼록, 일반 볼록, 강볼록 설정에서 단계 감소를 사용하는 SGD에 대한 비점근적 수렴 속도를 확립하기 위해.
  • 다항식 감소나 지수 감소 스텝 사이즈보다 더 날카로운 경계를 보여줌으로써 기존 수렴 속도를 향상시키기 위해.
  • 실제 적용을 위한 스텝 사이즈 감소 파라미터 선택의 체계적인 방법을 제공하고, 대규모 딥 러닝 실험을 통해 검증하기 위해.

제안 방법

  • 비볼록 및 미분 가능 설정에서 최종 반복값 선택을 위한 비균일 샘플링 규칙 $P_t \propto 1/\eta_t$를 제안하여 수렴 보장을 향상시킨다.
  • 이전 연구에서 $\alpha = 2$로 제한된 바에 비해, 일반적인 감쇠 인자 $\alpha > 1$를 사용하여 단계 감소 스텝 사이즈의 SGD를 분석한다.
  • 마링갈 차분 수열과 농도 불등식을 사용하여 기대값의 기울기 노름과 부적합도 갭을 경계함으로써 수렴 속도를 유도한다.
  • 비볼록(미분 가능), 일반 볼록(비미분 가능일 수 있음), 강볼록(미분 가능 및 비미분 가능)의 세 가지 문제 유형에 적용한다.
  • 스텝 사이즈가 정의된 마일스톤에서 정해진 간격 동안 일정하고, 이후 인자 $\alpha$로 감소하는 다단계 분석 기법을 사용한다.
  • CIFAR-10, CIFAR-100 및 로지스틱 회귀에서 광범위한 실험을 통해 이론적 결과를 검증하며, $\eta_0$, $\alpha$, 감소 마일스톤 등의 하이퍼파라미터를 튜닝한다.

실험 결과

연구 질문

  • RQ1비볼록 영역에서 단계 감소 스텝 사이즈를 사용하는 SGD의 비점근적 수렴 속도는 무엇인가?
  • RQ2일반 볼록 문제에서 $1/t$ 또는 $1/\sqrt{t}$와 같은 다항식 감소 스케줄보다 단계 감소가 더 나은 수렴 속도를 달성할 수 있는가?
  • RQ3강볼록 케이스에서 단계 감소의 최적 수렴 속도는 무엇이며, 이는 날카로운가?
  • RQ4감쇠 인자 $\alpha$의 선택이 실질적인 수렴과 일반화에 어떤 영향을 미치는가?
  • RQ5비균일 샘플링 규칙은 비볼록 설정에서 단계 감소 SGD의 수렴을 향상시킬 수 있는가?

주요 결과

  • 비볼록 미분 가능 문제에 대해, 논문은 기울기 노름에 대해 $\mathcal{O}(\ln T/\sqrt{T})$ 수렴 속도를 확립하였으며, 이는 거의 최적이다.
  • 일반 볼록 문제에 대해, 단계 감소 방법은 마지막 반복에서 $\mathcal{O}(\ln T/\sqrt{T})$ 수렴 속도를 달성한다.
  • 미분 가능 강볼록 케이스에서 수렴 속도는 $\mathcal{O}(\ln T/T)$이며, 논문은 이 속도가 날카로움을 증명한다.
  • 비미분 가능 강볼록 문제에 대해 수렴 속도는 $\mathcal{O}(\ln^2 T/T)$이며, 이는 이 설정에서 단계 감소에 대해 최초의 경계이다.
  • CIFAR-10 및 CIFAR-100에서의 실험 결과, $\alpha = 6$인 단계 감소는 상수, $1/t$, $1/\sqrt{t}$, 지수 감소와 비교해 더 낮은 테스트 손실과 더 높은 정확도를 달성한다.
  • 최적의 감쇠 인자 $\alpha = 6$는 단계 길이와 성능 간의 균형을 이룬다. $\alpha \in [4,6]$은 $\alpha \in [7,12]$보다 더 우수한 일반화와 안정성을 보이며 성능이 뛰어나다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.