Skip to main content
QUICK REVIEW

[논문 리뷰] Automated Learning Rate Scheduler for Large-batch Training

Chiheon Kim, Saehoon Kim|arXiv (Cornell University)|2021. 07. 13.
Advanced Neural Network Applications참고 문헌 29인용 수 7
한 줄 요약

이 논문은 대용량 배치 학습을 위한 자동화된 최적화 학습률 스케줄러인 AutoWU를 제안한다. 이는 가우시안 프로세스 기반의 온라인 손실 스무딩을 사용하여 동적으로 웜업 기간과 최대 학습률을 결정한다. 지능형으로 지수적 웜업에서 코시안 감쇠로 전환함으로써 최소한의 하이퍼파rameter 튜닝으로도 최신 기술 수준의 성능을 달성하며, 다양한 아키텍처와 배치 크기에서 튜닝된 기준 모델을 능가한다.

ABSTRACT

Large-batch training has been essential in leveraging large-scale datasets and models in deep learning. While it is computationally beneficial to use large batch sizes, it often requires a specially designed learning rate (LR) schedule to achieve a comparable level of performance as in smaller batch training. Especially, when the number of training epochs is constrained, the use of a large LR and a warmup strategy is critical in the final performance of large-batch training due to the reduced number of updating steps. In this work, we propose an automated LR scheduling algorithm which is effective for neural network training with a large batch size under the given epoch budget. In specific, the whole schedule consists of two phases: adaptive warmup and predefined decay, where the LR is increased until the training loss no longer decreases and decreased to zero until the end of training. Here, whether the training loss has reached the minimum value is robustly checked with Gaussian process smoothing in an online manner with a low computational burden. Coupled with adaptive stochastic optimizers such as AdamP and LAMB, the proposed scheduler successfully adjusts the LRs without cumbersome hyperparameter tuning and achieves comparable or better performances than tuned baselines on various image classification benchmarks and architectures with a wide range of batch sizes.

연구 동기 및 목표

  • 대용량 배치 학습에서 최적화 단계가 부족하고 학습률 스케줄링이 불안정해지는 문제로 인한 성능 열악함을 해결하기 위해.
  • 대용량 배치 환경에서 학습률 스케줄링에 대한 수동 하이퍼파arameter 튜닝이 필요 없도록 하기 위해.
  • 데이터 기반 방식으로 최적의 웜업 기간과 최대 학습률을 탐지하는 온라인, 적응형 학습률 스케줄러를 개발하기 위해.
  • 학습 중 손실 변동성에 대응하는 강건성을 확보하면서도 계산 오버헤드를 최소화하기 위해.
  • 다양한 모델과 대용량 배치 크기에서 수동 튜닝된 기준 모델과 비교해도 성능이 유사하거나 뛰어나도록 하기 위해.

제안 방법

  • 스케줄러는 두 단계로 구성된다: 초기에 $10^{-5}$ 에서 1.0로 지수적으로 증가하는 적응형 웜업 단계와, 이후 정해진 감쇠 단계.
  • 실시간으로 훈련 손실을 스무딩하기 위해 가우시안 프로세스(GP)를 사용하여 최소 손실 지점 탐지를 강건하게 수행한다. 이는 웜업에서 감쇠로의 전환을 유도한다.
  • 전환 조건은 통계적 검정에 기반한다: 손실이 최소에 도달했을 확률이 신뢰 수준 $c$ 이상이며, 노이즈로 인한 잘못된 신호를 방지하기 위해 내성 시간 $p$를 설정한다.
  • 최대 학습률은 감지된 최소 손실 지점에서의 값으로 설정되며, 이후 이 값에서 시작하여 코시안 감쇠 스케줄을 적용한다.
  • 웜업 단계는 성장 요소 $\gamma = (\eta_{\max}/\eta_{\min})^{1/\lfloor\rho_w T\rfloor}$ 를 가진 지수 스케줄을 사용하며, $\rho_w$ 는 웜업에 할애되는 훈련 스텝의 비율을 제어한다.
  • 이 방법은 AdamP 및 LAMB와 같은 적응형 옵티마이저와 호환되어 대용량 배치 환경에서의 안정성과 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1대용량 배치 학습에서 수동 튜닝 없이 자동화된 학습률 스케줄러가 최적의 웜업 기간과 최대 학습률을 탐지할 수 있는가?
  • RQ2GP 기반의 온라인 손실 스무딩은 웜업 단계 탐지 시 훈련 노이즈에 대해 얼마나 강건한가?
  • RQ3다양한 배치 크기에서 다양한 웜업 비율 하이퍼파arameter($\rho_w$)가 최종 모델 정확도에 미치는 영향은 어떠한가?
  • RQ4제안된 스케줄러는 수동 튜닝된 기준 모델과 이전의 자동화된 방법(SALSA 등)과 비교해 대용량 배치 환경에서 어떻게 성능을 내는가?
  • RQ5학습률 최대값 $\eta_{\max}$ 와 같은 하이퍼파arameter 선택에 대해 지수적 웜업 스케줄이 선형 웜업보다 더 강건한가?

주요 결과

  • AutoWU의 지수적 웜업을 사용할 경우, 배치 크기가 16,384인 ResNet-50에서 ImageNet에서 75.22%의 Top-1 정확도를 달성하였으며, 튜닝된 기준 모델(75.02%)을 능가하였다.
  • AutoWU의 선형 웜업은 $\eta_{\max}$ 에 매우 민감하여 $\eta_{\max}=1.0$ 일 경우 뿐만 아니라 정확도가 29.65%에 그쳐 지수 스케줄링의 우수성을 입증하였다.
  • $\rho_w = 0.25$ 일 때 AutoWU는 모든 배치 크기에서 최고 성능을 보였으며, 4,000 배치 크기에서 76.60%의 정확도를 기록하였고, $\rho_w = 0.125$ 일 때는 75.89%였다.
  • 더 큰 배치 크기와 더 빠른 웜업(작은 $\rho_w$)일수록 감쇠 단계의 시작 학습률이 증가하는 경향을 보였지만, 매우 큰 배치 크기에서는 이 경향이 끊어지며 임계 배치 크기 효과가 나타났다.
  • 이 방법은 ResNet-50 외의 여러 아키텍처와 데이터셋에서도 일관된 성능 향상을 보이며, ImageNet에서 ResNet-50를 넘어서 일반화 능력을 입증하였다.
  • 내성 시간 $p=3$ 이 설정되었을 때 강건성과 훈련 안정성의 균형이 가장 우수했으며, 국소적 손실 변동성에 대한 민감도가 감소하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.