Skip to main content
QUICK REVIEW

[논문 리뷰] Stochastic Normalized Gradient Descent with Momentum for Large-Batch Training

Shen-Yi Zhao, Shi Chen|arXiv (Cornell University)|2020. 07. 28.
Stochastic Gradient Optimization Techniques참고 문헌 17인용 수 4
한 줄 요약

이 논문은 깊이 있는 신경망에서 효과적인 대용량 배치 학습을 가능하게 하는 새로운 최적화 방법인 모멘텀를 갖춘 확률적 정규화 경사하강법(SNGM)을 제안한다. SNGM는 정규화된 경사하강법과 폴랴크의 모멘텀을 결합하여, 보다 낮은 계산 복잡도로 ϵ-정류점에 수렴함으로써, 보조적 워밍업 또는 학습률 스케일링 히우리즘을 요구하지 않더라도 대용량 배치에서도 빠른 학습과 최첨단 테스트 정확도를 달성한다.

ABSTRACT

Stochastic gradient descent~(SGD) and its variants have been the dominating optimization methods in machine learning. Compared to SGD with small-batch training, SGD with large-batch training can better utilize the computational power of current multi-core systems such as graphics processing units~(GPUs) and can reduce the number of communication rounds in distributed training settings. Thus, SGD with large-batch training has attracted considerable attention. However, existing empirical results showed that large-batch training typically leads to a drop in generalization accuracy. Hence, how to guarantee the generalization ability in large-batch training becomes a challenging task. In this paper, we propose a simple yet effective method, called stochastic normalized gradient descent with momentum~(SNGM), for large-batch training. We prove that with the same number of gradient computations, SNGM can adopt a larger batch size than momentum SGD~(MSGD), which is one of the most widely used variants of SGD, to converge to an $ε$-stationary point. Empirical results on deep learning verify that when adopting the same large batch size, SNGM can achieve better test accuracy than MSGD and other state-of-the-art large-batch training methods.

연구 동기 및 목표

  • 특히 깊이 있는 신경망에서 흔히 관찰되는 대용량 배치 SGD 학습 시 일반화 정확도 저하 문제를 해결하기 위해.
  • 큰 배치 크기를 사용할 때도 높은 테스트 정확도를 유지하면서 이론적으로 탄탄한 최적화 방법을 개발하기 위해.
  • 수렴에 도달하기 위해 필요한 파라미터 업데이트 횟수를 줄여 학습 효율성을 향상시키기 위해.
  • 기존 연구에서 빈번히 간과되던, 완화된 스무스성 조건을 만족하는 비볼록 목적함수에 대한 수렴 복잡도 분석의 격차를 메우기 위해.

제안 방법

  • SNGM는 정규화된 경사하강법과 폴랴크의 모멘텀을 통합하여, 최적화의 안정성을 높이기 위해 업데이트 방향을 경사의 노름의 역수로 스케일링한다.
  • 이 방법은 정규화된 경사 방향을 누적하는 모멘텀 항을 사용하여, 고용량 배치 환경에서도 수렴 안정성을 향상시킨다.
  • 경사 정규화를 통해 본질적으로 학습을 안정화하므로, 히우리즘 기반의 학습률 스케일링이나 워밍업 전략을 피할 수 있다.
  • 알고리즘은 대용량 배치 학습을 위해 설계되었으며, 완화된 스무스성 가정 하에 수렴 복잡도에 대한 이론적 보장을 제공한다.
  • 매우 큰 배치 크기를 사용할 때도 학습 안정성을 유지하기 위해 폴리 파워 학습률 스케줄링과 경사 누적 기법을 활용한다.
  • 이론적 분석 결과, SNGM는 완화된 스무스 목적함수에 대해 O(1/ε⁴)의 계산 복잡도를 달성하며, 이는 스트로스틱 최적화 분야에서의 새로운 결과이다.

실험 결과

연구 질문

  • RQ1큰 배치 크기를 사용할 때, 모멘텀를 갖춘 정규화된 경사 방법이 표준 모멘텀 SGD보다 더 우수한 일반화 성능을 보일 수 있는가?
  • RQ2동일한 배치 크기에서 SNGM가 모멘텀 SGD보다 더 낮은 계산 복잡도로 ϵ-정류점에 수렴하는가?
  • RQ3SNGM는 워밍업이나 학습률 스케일링과 같은 히우리즘 기반 기법 없이도 대용량 배치 학습에서 최첨단 테스트 정확도를 달성할 수 있는가?
  • RQ4완화된 스무스성 조건 하에서 스트로스틱 최적화 방법의 이론적 수렴 복잡도는 무엇인가?

주요 결과

  • CIFAR10에서 배치 크기가 4096인 SNGM는 ResNet20에서 91.42%의 테스트 정확도를 기록했으며, 배치 크기가 128인 MSGD의 91.63%와 유사한 성능을 보였다.
  • ResNet56에서 SNGM는 배치 크기 4096일 때 93.12%의 테스트 정확도를 달성하여, MSGD(88.55%)와 LARS(92.98%, 워밍업 사용)를 모두 초월했다.
  • ImageNet에서 배치 크기가 8192인 SNGM는 ResNet18에서 69.65%의 Top-1 정확도, ResNet50에서는 75.42%를 기록했으며, 더 작은 배치 크기에서의 MSGD(69.71%, 75.70%)와 매우 유사한 성능을 보였다.
  • SNGM는 워밍업이나 학습률 스케일링을 사용하지 않았음에도 불구하고, LARS 등 히우리즘 기반 방법과 비교해도 뛰어난 안정성을 입증했다.
  • 이론적 분석을 통해 SNGM가 완화된 스무스 목적함수에 대해 O(1/ε⁴)의 계산 복잡도를 달성함을 확인했으며, 이는 스트로스틱 최적화 분야에서의 새로운 결과이다.
  • SNGM는 동일한 계산 복잡도로 동일한 ϵ-정류점에 도달하기 위해 MSGD보다 더 큰 배치 크기를 사용할 수 있으며, 이는 더 빠른 수렴을 의미한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.