Skip to main content
QUICK REVIEW

[논문 리뷰] AutoLRS: Automatic Learning-Rate Schedule by Bayesian Optimization on the Fly

Yuchen Jin, Tianyi Zhou|arXiv (Cornell University)|2021. 05. 22.
Machine Learning and Data Classification참고 문헌 51인용 수 5
한 줄 요약

AutoLRS는 베이지안 최적화(BO)와 경량의 지수 손실 예측 모델을 조합하여 검증 손실을 최소화하고 인간 간섭 없이 실시간으로 학습률 스케줄링을 자동화하는 방법을 제안한다. 각 단계의 일부만 훈련하여 전체 단계 성능을 예측함으로써, 수동으로 조정된 스케줄보다 1.22배에서 1.5배 빠른 수렴을 달성하고, 최신 기술보다도 1.31배 빠른 수렴 속도를 확보한다. 이는 ResNet-50, Transformer, BERT 모델 전반에 걸쳐 성능을 발휘한다.

ABSTRACT

The learning rate (LR) schedule is one of the most important hyper-parameters needing careful tuning in training DNNs. However, it is also one of the least automated parts of machine learning systems and usually costs significant manual effort and computing. Though there are pre-defined LR schedules and optimizers with adaptive LR, they introduce new hyperparameters that need to be tuned separately for different tasks/datasets. In this paper, we consider the question: Can we automatically tune the LR over the course of training without human involvement? We propose an efficient method, AutoLRS, which automatically optimizes the LR for each training stage by modeling training dynamics. AutoLRS aims to find an LR applied to every $τ$ steps that minimizes the resulted validation loss. We solve this black-box optimization on the fly by Bayesian optimization (BO). However, collecting training instances for BO requires a system to evaluate each LR queried by BO's acquisition function for $τ$ steps, which is prohibitively expensive in practice. Instead, we apply each candidate LR for only $τ'\llτ$ steps and train an exponential model to predict the validation loss after $τ$ steps. This mutual-training process between BO and the loss-prediction model allows us to limit the training steps invested in the BO search. We demonstrate the advantages and the generality of AutoLRS through extensive experiments of training DNNs for tasks from diverse domains using different optimizers. The LR schedules auto-generated by AutoLRS lead to a speedup of $1.22 imes$, $1.43 imes$, and $1.5 imes$ when training ResNet-50, Transformer, and BERT, respectively, compared to the LR schedules in their original papers, and an average speedup of $1.31 imes$ over state-of-the-art heavily-tuned LR schedules.

연구 동기 및 목표

  • 딥 뉴럴 네트워크(DNN) 훈련에서 핵심이지만 수동으로 조정이 필요한 학습률(LR) 스케줄링 조정의 자동화 부족 문제를 해결한다.
  • 사전 정의된 LR 스케줄링과 적응형 옵티마이저의 한계를 극복하며, 새로운 초모수를 도입하고 작업에 특화된 튜닝이 필요하지 않은 방법을 개발한다.
  • 인간 감시 없이도 훈련 도중 최적의 LR 값을 자동으로 식별하고 검증 손실을 직접 최소화하는 방법을 개발한다.
  • 단기 훈련 실행과 예측 모델을 활용해 장기 검증 손실을 추정함으로써 베이지안 최적화(BO)의 계산 비용을 줄인다.
  • 고정된 스케줄 형식이나 작업 특화 가정에 의존하지 않음으로써 다양한 옵티마이저, 데이터셋, 작업에 광범위하게 호환 가능하도록 보장한다.

제안 방법

  • 검증 손실을 학습률의 흑박 상자 함수로 간주하고, 베이지안 최적화(BO)를 적용하여 기대 개선도를 최소화하는 방식으로 LR 값을 반복적으로 선택한다.
  • 각 후보 LR을 전체 훈련 단계 길이 τ 동안 훈련하는 대신, τ′ ≪ τ 단계만 훈련하여 비용을 줄인다.
  • 각 후보 LR에 대해 단기 검증 손실을 기반으로 지수 시간 시리즈 예측 모델을 훈련하여 전체 τ단계 검증 손실을 예측한다.
  • 예측된 검증 손실을 활용해 BO의 취득 함수를 안내함으로써, 전체 훈련 실행 수를 최소화하면서도 LR 공간을 효율적으로 탐색한다.
  • 경량 BO 사후분포와 소형 예측 모델을 유지함으로써 메모리 및 계산 오버헤드를 최소화한다.
  • BO와 예측 모델 간 상호 학습을 가능하게 한다: BO는 새로운 LR을 질의하고, 그에 따른 단기 데이터는 예측 모델을 훈련시어 향후 BO 결정을 향상시킨다.

실험 결과

연구 질문

  • RQ1수동 간섭 없이 사전 정의된 스케줄 형식 없이 DNN 훈련 중에 학습률을 자동으로 튜닝할 수 있는가?
  • RQ2전체 단계 평가 대신 단기 훈련과 손실 예측을 활용함으로써 베이지안 최적화의 계산 비용을 줄일 수 있는가?
  • RQ3제안된 AutoLRS 방법이 수동 튜닝 또는 최신 기술 수준의 학습률 스케줄보다 더 빠른 수렴과 더 나은 일반화 성능을 달성하는가?
  • RQ4다양한 모델(예: ResNet-50, Transformer, BERT)과 데이터셋(예: ImageNet, CIFAR-10, CIFAR-100)에 걸쳐 AutoLRS는 얼마나 견고한가?
  • RQ5AutoLRS 프레임워크에서 BO를 무작위 또는 격자 탐색으로 대체할 경우 성능 및 효율성에 어떤 영향을 미치는가?

주요 결과

  • ImageNet에서 ResNet-50 훈련 시 AutoLRS는 원래 수동 튜닝된 학습률 스케줄보다 1.22배 빠른 수렴 속도를 확보한다.
  • Transformer 모델에서는 AutoLRS가 원래 스케줄 대비 훈련 시간을 1.43배 줄여 시퀀스 모델에 대한 강력한 성능을 입증한다.
  • BERT에서는 AutoLRS가 원본 논문의 학습률 스케줄보다 1.5배 빠른 수렴을 달성하여 대규모 NLP 모델에 효과적임을 보여준다.
  • 모든 평가된 모델에서 AutoLRS는 최신 기술 수준의 깊이 있는 튜닝이 적용된 학습률 스케줄보다 평균 1.31배 더 빠른 수렴 속도를 제공한다.
  • AutoLRS에서 BO를 무작위 또는 격자 탐색으로 대체할 경우 성능이 크게 열 劣화되며, 수렴 속도가 느려지고 정확도가 낮아지므로 지능적인 탐색의 중요성을 확인한다.
  • τ′ = τ/10 단계에서 훈련된 지수 손실 예측 모델은 전체 τ단계 검증 손실을 높은 정확도로 예측할 수 있어, 최소한의 훈련 오버헤드로 효과적인 BO를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.