Skip to main content
QUICK REVIEW

[논문 리뷰] The Role of Momentum Parameters in the Optimal Convergence of Adaptive Polyak's Heavy-ball Methods

Wei Tao, Sheng Long|arXiv (Cornell University)|2021. 02. 15.
Stochastic Gradient Optimization Techniques참고 문헌 32인용 수 6
한 줄 요약

이 논문은 시간에 따라 변하는 동적 모멘텀 파rameter $\beta_{1t} = \frac{t}{t+2}$를 갖는 적응형 Polyak의 Heavy-ball 방법이 제약 조건이 있는 볼록 최적화에서 최적의 개별 수렴 속도 $O(\frac{1}{\sqrt{t}})$를 달성함을 입증한다. 이는 깊이 신경망에서 마지막 반복값이 일반적으로 사용되지만 이론적 보장은 평균화된 반복값에 국한되어 있는 이론-실천 격차를 해소한다. 분석을 통해 적응형 모멘텀 스케줄이 가속화를 가능하게 하는 방식과 실무에서의 모멘텀에 대한 체계적인 스케줄링을 제공한다.

ABSTRACT

The adaptive stochastic gradient descent (SGD) with momentum has been widely adopted in deep learning as well as convex optimization. In practice, the last iterate is commonly used as the final solution to make decisions. However, the available regret analysis and the setting of constant momentum parameters only guarantee the optimal convergence of the averaged solution. In this paper, we fill this theory-practice gap by investigating the convergence of the last iterate (referred to as individual convergence), which is a more difficult task than convergence analysis of the averaged solution. Specifically, in the constrained convex cases, we prove that the adaptive Polyak's Heavy-ball (HB) method, in which only the step size is updated using the exponential moving average strategy, attains an optimal individual convergence rate of $O(\frac{1}{\sqrt{t}})$, as opposed to the optimality of $O(\frac{\log t}{\sqrt {t}})$ of SGD, where $t$ is the number of iterations. Our new analysis not only shows how the HB momentum and its time-varying weight help us to achieve the acceleration in convex optimization but also gives valuable hints how the momentum parameters should be scheduled in deep learning. Empirical results on optimizing convex functions and training deep networks validate the correctness of our convergence analysis and demonstrate the improved performance of the adaptive HB methods.

연구 동기 및 목표

  • 이론적 수렴 보장(일般적으로 평균화된 반복값에 대해)과 모멘텀 기반 최적화에서 실무적으로 사용되는 마지막 반복값 사이의 이론-실천 격차를 해소하기 위해.
  • 제약 조건이 있는 볼록 설정에서 적응형 Polyak의 Heavy-ball 방법에 대해 마지막 반복값(개별 수렴)의 수렴을 분석하기 위해.
  • 개별 수렴 속도가 최적의 $O(\frac{1}{\sqrt{t}})$로 이루어지도록 보장하는 최적의 모멘텀 파ram터 스케줄을 규명하기 위해.
  • 수렴 역학에 기반하여 딥러닝에서의 모멘텀 파ram터 스케줄링에 대한 이론적 근거를 제공하기 위해.

제안 방법

  • 단지 단계 크기만 지수이동평균(EMA) 전략을 사용하여 업데이트하는 적응형 Polyak의 Heavy-ball 방법을 제안한다.
  • 최적의 개별 수렴을 달성하기 위해 시간에 따라 변하는 모멘텀 파aram터 $\beta_{1t} = \frac{t}{t+2}$를 도입한다.
  • 적응형 모멘텀 체계에 특화된 새로운 증명 기법을 사용하여 마지막 반복값의 수렴을 분석한다.
  • 적응형 HB 방법이 제약 조건이 있는 볼록 문제에서 $O(\frac{1}{\sqrt{t}})$의 개별 수렴 속도를 달성함을 입증한다.
  • 수렴 속도와 실무 성능 측면에서 표준 SGD 및 Adam 유형의 방법과 적응형 HB 방법을 비교한다.
  • MNIST, CIFAR10, CIFAR100에서 4층 CNN 및 ResNet-18을 대상으로 볼록 함수와 딥 네트워크에서의 경험적 검증을 수행한다.

실험 결과

연구 질문

  • RQ1적응형 Polyak의 Heavy-ball 방법이 제약 조건이 있는 볼록 최적화에서 마지막 반복값에 대해 최적의 개별 수렴을 달성할 수 있는가?
  • RQ2어떤 모멘텀 파aram터 스케줄이 적응형 HB 방법에서 최적의 개별 수렴을 가능하게 하는가?
  • RQ3시간에 따라 변하는 모멘텀 파aram터 $\beta_{1t} = \frac{t}{t+2}$는 일정한 $\beta_{1t}$와 비교해 수렴성과 실무 성능 측면에서 어떻게 다른가?
  • RQ4제안된 적응형 HB 방법이 딥 네트워크 훈련에서 표준 Adam과 SGD를 초월하는가?

주요 결과

  • 제약 조건이 있는 볼록 최적화에서 $\beta_{1t} = \frac{t}{t+2}$를 갖는 적응형 Polyak의 Heavy-ball 방법이 최적의 개별 수렴 속도 $O(\frac{1}{\sqrt{t}})$를 달성한다.
  • 이 속도는 최적이며, 마지막 반복값에 대해 표준 SGD의 $O(\frac{\log t}{\sqrt{t}})$ 속도를 향상시킨다.
  • 시간에 따라 변하는 모멘텀 파aram터 $\beta_{1t} = \frac{t}{t+2}$는 최적의 개별 수렴을 달성하기 위해 필수적이며, 일정한 $\beta_{1t}$와는 달리 그러한 기여를 하지 못한다.
  • 경험적 결과는 4층 CNN 및 ResNet-18 아키텍처에서 MNIST, CIFAR10, CIFAR100에서 훈련 손실과 테스트 정확도가 향상되었음을 보여준다.
  • 동일한 하이퍼파ram터 튜닝 프rotocol 하에서, Adam, SGD, SGD-momentum, AdaGrad, RMSProp에 비해 훈련 손실과 테스트 정확도 측면에서 성능이 뛰어나다.
  • 이론적 분석은 딥러닝에서 모멘텀 파aram터 스케줄링에 대한 체계적인 스케줄링을 제공하며, 실무에서 $\beta_{1t} \to 1$이 자주 효과적인 이유를 설명한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.