Skip to main content
QUICK REVIEW

[논문 리뷰] Scheduled Restart Momentum for Accelerated Stochastic Gradient Descent

Bao Wang, Tan M. Nguyen|arXiv (Cornell University)|2020. 02. 24.
Stochastic Gradient Optimization Techniques인용 수 5
한 줄 요약

이 논문은 깊은 신경망에서 훈련의 안정성과 수렴 속도 향상을 위해 Nesterov 가속 운동량과 주기적인 운동량 재설정을 통합한 새로운 최적화 알고리즘인 스케줄링 리스타트 확률적 경사하강법(SRSGD)을 제안한다. 일정한 운동량을 증가하는 Nesterov 운동량으로 대체하고 매 고정된 반복 수마다 재설정함으로써 SRSGD는 더 빠른 수렴과 향상된 일반화를 달성하며, ResNet200에서 ImageNet 오차를 기준선 SGD의 22.13%에서 20.93%로 감소시킨다.

ABSTRACT

Stochastic gradient descent (SGD) with constant momentum and its variants such as Adam are the optimization algorithms of choice for training deep neural networks (DNNs). Since DNN training is incredibly computationally expensive, there is great interest in speeding up the convergence. Nesterov accelerated gradient (NAG) improves the convergence rate of gradient descent (GD) for convex optimization using a specially designed momentum; however, it accumulates error when an inexact gradient is used (such as in SGD), slowing convergence at best and diverging at worst. In this paper, we propose Scheduled Restart SGD (SRSGD), a new NAG-style scheme for training DNNs. SRSGD replaces the constant momentum in SGD by the increasing momentum in NAG but stabilizes the iterations by resetting the momentum to zero according to a schedule. Using a variety of models and benchmarks for image classification, we demonstrate that, in training DNNs, SRSGD significantly improves convergence and generalization; for instance in training ResNet200 for ImageNet classification, SRSGD achieves an error rate of 20.93% vs. the benchmark of 22.13%. These improvements become more significant as the network grows deeper. Furthermore, on both CIFAR and ImageNet, SRSGD reaches similar or even better error rates with significantly fewer training epochs compared to the SGD baseline.

연구 동기 및 목표

  • 딥 러닝에서 비정확한 기울기를 사용할 경우 Nesterov 가속 운동량 경사하강법(NASGD)의 불안정성과 오차 누적 문제를 해결한다.
  • 실제로 Nesterov 방법의 최적의 O(1/k²) 수렴 속도를 달성하지 못하는 일정한 운동량을 갖는 SGD의 한계를 극복한다.
  • Nesterov 운동량의 빠른 수렴성과 주기적 재설정의 안정성을 결합한 실용적인 최적화 알고리즘을 개발한다.
  • 특히 더 깊은 아키텍처에서, 깊은 신경망 전반에 걸쳐 훈련 속도 향상과 모델 정확도 향상을 입증한다.
  • NASGD에서의 오차 누적에 대한 이론적 분석과 SRSGD의 수렴 보장을 제공한다.

제안 방법

  • 고정된 반복 수마다 운동량을 0으로 재설정하는 스케줄링 리스타트 메커니즘을 도입하여, 스 tochastic 환경에서 Nesterov 운동량의 안정성을 확보한다.
  • 일정한 운동량을 시간에 따라 변하는 Nesterov 운동량 계수 μ_k = (k-1)/(k+2)로 대체하여 수렴 속도를 가속화한다.
  • 주기적인 운동량 버퍼 재설정을 포함한 순환 운동량 업데이트: v^{k+1} = w^k - s_k ∇f(w^k), w^{k+1} = v^{k+1} + μ_k (v^{k+1} - v^k).
  • 사용자가 정의한 반복 수 이후에 운동량을 재설정하는 학습률 및 운동량 스케줄링을 설계하여 훈련 진행 상황에 적응한다.
  • 모듈러 구현을 통해 PyTorch 및 Keras 프레임워크에 통합하여 딥 러닝 파ip라인에 쉽게 배포할 수 있도록 한다.
  • 이전 속도를 추적하기 위해 운동량 버퍼를 사용하여 Nesterov 스타일의 앞서가는 업데이트를 효율적으로 계산한다.

실험 결과

연구 질문

  • RQ1비정확한 기울기를 사용하는 딥 러닝 환경에서 Nesterov 가속 운동량이 오차 누적 경향을 보일 때, 이를 스 tochastic 경사하강법에서 안정화시킬 수 있는가?
  • RQ2일정한 운동량 또는 Adam과 비교해 볼 때, 주기적 운동량 재설정이 딥 뉴럴 네트워크 훈련의 수렴 속도와 일반화 성능을 향상시키는가?
  • RQ3CIFAR-10 및 ImageNet과 같은 표준 이미지 분류 벤치마크에서, 특히 더 깊은 네트워크에서 SRSGD의 성능은 어떠한가?
  • RQ4재시작 간격이 훈련 안정성과 최종 모델 정확도에 어떤 영향을 미치는가?
  • RQ5SGD 및 Adam과 비교해 볼 때, SRSGD는 더 적은 훈련 에포크 수로 더 빠른 수렴을 달성하면서도 테스트 정확도를 유지하거나 향상시킬 수 있는가?

주요 결과

  • ResNet200를 사용한 ImageNet 분류에서 SRSGD는 기준선 SGD의 22.13%에서 20.93%로 상위-1 오차율을 감소시켜 뚜렷한 일반화 향상을 입증한다.
  • CIFAR-10 및 CIFAR-100에서 SRSGD는 훨씬 적은 훈련 에포크 수로 SGD 및 Adam과 비교해 유사하거나 더 높은 테스트 정확도를 달성한다.
  • 네트워크 깊이가 증가할수록 SRSGD의 성능 향상이 더욱 두드러지며, 더 깊은 아키텍처에서 더 강력한 이점을 제공함을 시사한다.
  • SRSGD는 스 tochastic 환경에서 Nesterov 운동량 메커니즘을 안정화시켜, 표준 NASGD에서 관찰된 발산과 오차 누적 현상을 방지한다.
  • 알고리즘은 적응형 운동량 스케줄링 덕분에 더 빠른 수렴을 달성하며, 낮은 손실 값에 더 적은 반복 수로 도달한다.
  • 스케줄링 리스타트 메커니즘은 가속화와 안정성 사이의 효과적인 균형을 이루어, Nesterov 운동량을 실세계 딥 러닝 훈련에 실용적으로 적용할 수 있도록 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.