Skip to main content
QUICK REVIEW

[논문 리뷰] Stochastic Gradient Descent with Hyperbolic-Tangent Decay on Classification

Bo Yang Hsueh, Wei Li|arXiv (Cornell University)|2018. 06. 05.
Advanced Neural Network Applications참고 문헌 23인용 수 4
한 줄 요약

이 논문은 확률적 경사 하강법(SGD)을 위한 새로운 학습률 스케줄러인 하이퍼볼릭 tangent 감쇠(Hyperbolic-Tangent Decay, HTD)를 제안한다. HTD는 학습 중에 동적으로 학습률을 조정하기 위해 하이퍼볼릭 탄젠트 함수를 사용한다. 다양한 벤치마크—ResNet, 와이드 ResNet, DenseNet, LSTM—에서 단계 감쇠 및 코사인 스케줄러보다 우수한 성능을 보이며, 단계 감쇠보다는 적은 수의 초파rameter를 필요로 하면서도 코사인 스케줄링보다 더 높은 유연성을 제공한다. HTD(-6,3)는 강력한 기본 설정으로 부각된다.

ABSTRACT

Learning rate scheduler has been a critical issue in the deep neural network training. Several schedulers and methods have been proposed, including step decay scheduler, adaptive method, cosine scheduler and cyclical scheduler. This paper proposes a new scheduling method, named hyperbolic-tangent decay (HTD). We run experiments on several benchmarks such as: ResNet, Wide ResNet and DenseNet for CIFAR-10 and CIFAR-100 datasets, LSTM for PAMAP2 dataset, ResNet on ImageNet and Fashion-MNIST datasets. In our experiments, HTD outperforms step decay and cosine scheduler in nearly all cases, while requiring less hyperparameters than step decay, and more flexible than cosine scheduler. Code is available at https://github.com/BIGBALLON/HTD.

연구 동기 및 목표

  • 딥러닝에서 SGD를 위한 기존 학습률 스케줄러의 초파rameter 민감성과 최적 성능 이하 문제를 해결하기 위해.
  • 단계 감쇠의 성능 이점을 유지하면서도 적응형 방법의 유연성을 확보하면서도 조정 가능한 파rameter의 수를 줄이는 학습률 스케줄러를 개발하기 위해.
  • 다양한 아키텍처와 데이터셋에서 하이퍼볼릭 탄젠트 함수 기반 신규 스케줄러의 효과성을 평가하기 위해.
  • 다양한 학습 시나리오에 걸쳐 잘 일반화되는 강력한 기본 설정을 식별하기 위해.

제안 방법

  • 제안된 HTD 스케줄러는 학습 에포크 동안 학습률 감쇠를 하이퍼볼릭 탄젠트 함수로 모델링하며, 공식은 $\alpha_t = \frac{L - U}{2} \cdot \tanh\left(\frac{t}{R}\right) + \frac{L + U}{2}$ 이다. 여기서 $L$과 $U$는 학습률의 하한 및 상한이며, $R$은 감쇠 비율을 제어한다.
  • 학습 초반에 학습률은 $U$ 근처에서 시작하여 학습이 진행됨에 따라 점차 $L$에 수렴하게 되어 부드럽고 점진적인 감쇠를 가능하게 한다.
  • 이 스케줄러는 코사인 감쇠보다 더 높은 유연성을 제공한다(최소 및 최대 학습률만 조정 가능). 또한 단계 감쇠보다 더 적은 수의 파rameter를 필요로 한다(여러 단계 경계가 필요함).
  • 표준 딥러닝 벤치마크를 사용하여 평가하였다: CIFAR-10, CIFAR-100, ImageNet, PAMAP2, Fashion-MNIST. 사용된 모델은 ResNet, 와이드 ResNet, DenseNet, BLSTM이다.
  • 초파rameter 민감도 분석을 위해 $L$, $U$, $R$을 다양한 데이터셋과 학습 에포크 수에 따라 변화시켜 유연성과 일반화 능력을 평가하였다.

실험 결과

연구 질문

  • RQ1하이퍼볼릭 탄젠트 함수 기반 학습률 스케줄러가 단계 감쇠 및 코사인 감쇠와 같은 기존 스케줄러보다 최종 모델 정확도에서 뛰어난 성능을 보일 수 있는가?
  • RQ2HTD는 성능을 유지하거나 향상시키면서도 단계 감쇠보다 더 적은 수의 초파라미터를 필요로 하는가?
  • RQ3HTD의 유연성은 코사인 스케줄링과 비교해 볼 때 조정 가능한 파라미터 수와 최종 정확도 측면에서 어떻게 다른가?
  • RQ4다양한 데이터셋과 모델 아키텍처에서 HTD 초파라미터(예: $L$, $U$, $R$)의 최적 설정은 무엇인가?
  • RQ5HTD의 성능는 학습 기간에 따라 크게 달라지나? 하나의 설정이 다양한 학습 스케줄에 일반화 가능한가?

주요 결과

  • HTD(-6,3)는 모든 평가 실험에서 단계 감쇠를 능가하며, ResNet-18을 사용한 ImageNet에서 0.58% 낮은 top-1 오차율을 기록했고, ResNet-34에서는 0.48% 낮았다.
  • CIFAR-100에서 HTD(-6,3)는 DenseNet-BC-100-12 및 DenseNet-BC-250-24에 대해 코사인 스케줄러보다 정확도를 0.42% 향상시켰다.
  • CIFAR-100의 WRN-28-10에서 HTD(-6,3)는 코사인 스케줄러 대비 0.81% 향상된 성능을 보였다.
  • PAMAP2에서 HTD(-6,3)는 단계 감쇠 대비 0.16% 낮은 오차율, 코사인 스케줄러 대비 0.22% 낮은 오차율을 기록했다.
  • Fashion-MNIST에서 HTD(-6,3)는 단계 감쇠 대비 0.15% 향상된 성능, 코사인 스케줄러 대비 0.06% 향상된 성능을 기록했다.
  • 최적의 비율 $R$은 데이터셋에 따라 달라진다: 200 에포크일 경우 CIFAR-10에선 $R=5$, 400 에포크일 경우 $R=2$이며, CIFAR-100에선 두 설정 모두 $R=10$이 최적임을 보여주어 데이터셋에 따라 민감도가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.