Skip to main content
QUICK REVIEW

[논문 리뷰] A Second look at Exponential and Cosine Step Sizes: Simplicity, Adaptivity, and Performance

Xiaoyu Li, Zhenxun Zhuang|OpenBU (Boston University)|2020. 02. 12.
Stochastic Gradient Optimization Techniques참고 문헌 81인용 수 12
한 줄 요약

이 논문은 부드러운 비볼록 함수에 대해 확률적 경사 하강법(SGD)에서 지수 및余弦 단계 크기 스케줄링에 대한 이론적 수렴 보장을 처음으로 제공하며, 폴리악-로자예프스키(Polyak-Łojasiewicz, PL) 조건 하에서 near-optimal 속도를 달성하고 놀랍게도 기울기 노이즈 수준에 적응함을 증명한다. 경험적으로, 이러한 단순한 스케줄링 방식은 Adam 및 단계별 감소와 같은 최첨단 방법과 맞먹거나 이를 초월하며, 조정이 필요한 하이퍼파rameter가 하나 또는 두 개인 것으로서 뛰어난 성능을 발휘한다.

ABSTRACT

Stochastic Gradient Descent (SGD) is a popular tool in training large-scale machine learning models. Its performance, however, is highly variable, depending crucially on the choice of the step sizes. Accordingly, a variety of strategies for tuning the step sizes have been proposed, ranging from coordinate-wise approaches (a.k.a. ``adaptive'' step sizes) to sophisticated heuristics to change the step size in each iteration. In this paper, we study two step size schedules whose power has been repeatedly confirmed in practice: the exponential and the cosine step sizes. For the first time, we provide theoretical support for them proving convergence rates for smooth non-convex functions, with and without the Polyak-Łojasiewicz (PL) condition. Moreover, we show the surprising property that these two strategies are \emph{adaptive} to the noise level in the stochastic gradients of PL functions. That is, contrary to polynomial step sizes, they achieve almost optimal performance without needing to know the noise level nor tuning their hyperparameters based on it. Finally, we conduct a fair and comprehensive empirical evaluation of real-world datasets with deep learning architectures. Results show that, even if only requiring at most two hyperparameters to tune, these two strategies best or match the performance of various finely-tuned state-of-the-art strategies.

연구 동기 및 목표

  • SGD에서 지수 및 여측 단계 크기 스케줄링의 경험적 성공에 대한 이론적 근거를 제공하기 위해.
  • 이러한 단순한 스케줄링 방식이 기울기 노이즈 수준과 같은 문제의 본질적 특성에 적응하는지 조사하기 위해.
  • 실제 딥러닝 과제에서 최첨단 적응형 및 히우리스틱 단계 크기 전략과의 성능를 평가하기 위해.
  • 최소한의 하이퍼파rameter 조정으로도 복잡하고 정교하게 캘리브레이션된 기준보다 성능이 유사하거나 뛰어나게 만들 수 있음을 보여주기 위해.

제안 방법

  • 부드러움과 PL 조건을 가정한 하에 지수 및 여측 단계 크기 스케줄링을 사용한 SGD의 이론적 분석.
  • 비볼록 함수에 대한 수렴 속도 유도로, 로그 인자들을 제외한 O(1/√t) 수렴 속도를 입증.
  • PL 조건 하에서, 노이즈 수준을 사전에 알지 못하거나 이를 기반으로 조정하지 않더라도, 둘 다 스 tochastic 기울기의 노이즈 수준에 적응함을 증명.
  • ResNet-20 및 ResNet-34를 사용한 CIFAR-10 및 ImageNet에서 Adam, 다항식 감소, 단계별 스케줄링과의 비교를 위한 경험적 평가.
  • 모든 방법 간의 비교 가능성을 보장하기 위해 고정된 하이퍼파ram터 탐색 예산을 사용한 공정한 벤치마크 구축.
  • 조기 학습률 감소의 영향을 분석하기 위해 학습 및 테스트 손실 곡선 분석 및 과적합 위험 시각화.

실험 결과

연구 질문

  • RQ1지수 및 여측 단계 크기 스케줄링이 부드러운 비볼록 함수에 대해 증명 가능한 최적 수렴 속도를 달성하는가?
  • RQ2이러한 스케줄링 방식이 노이즈 수준을 사전에 알지 못하거나 이를 기반으로 조정하지 않더라도 스 tochastic 기울기의 노이즈 수준에 적응할 수 있는가?
  • RQ3이러한 단순한 스케줄링 방식은 딥러닝에서 최첨단 적응형 및 히우리스틱 학습률 전략과 경험적으로 어떻게 비교되는가?
  • RQ4조기 학습률 감소는 일반화에 어떤 영향을 미치며, 이러한 스케줄링은 이러한 위험을 어떻게 완화하는가?

주요 결과

  • 지수 및 여측 단계 크기 스케줄링은 부드러운 비볼록 함수에 대해 O(1/√t) 수렴 속도를 달성하며, 로그 인자들을 제외한 최고의 이론적 수렴 속도를 달성한다.
  • 폴리악-로자예프스키(PL) 조건 하에서, 둘 다 스 tochastic 기울기의 노이즈 수준에 적응하여 노이즈 수준을 알지 못하거나 이를 기반으로 조정하지 않더라도 near-optimal 성능을 달성한다.
  • CIFAR-10 및 ImageNet에서 여측 및 지수 단계 크기 스케줄링은 Adam, 다항식 감소, 단계별 스케줄링을 초월하거나 이를 능가하며, ImageNet에서 여측 스케줄링은 최고의 테스트 정확도 0.7497±0.0044를 기록했다.
  • 지수 단계 크기 스케줄링은 CIFAR-10에서 가장 낮은 학습 손실(0.0006±0.0001)과 테스트 손실(0.0098±0.0010)을 기록하여 모든 기준보다 뛰어난 성능를 보였다.
  • 경험적 결과에 따르면 여측 및 지수 스케줄링은 각각 1개 또는 2개의 하이퍼파rameter만 필요로 하며, 다중 마일스톤을 포함한 단계별 감소와 같이 3~4개의 하이퍼파ram터가 필요한 방법들을 능가한다.
  • 시각화 결과에 따르면 조기 학습률 감소는 과적합과 함께 상승하는 테스트 손실을 유도하며, 이는 여측 및 지수 스케줄링이 이러한 함정을 피하는 데 있어 뛰어난 강건성을 보임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.