Skip to main content
QUICK REVIEW

[논문 리뷰] Demon: Momentum Decay for Improved Neural Network Training

John Chen, C. Wolfe|arXiv (Cornell University)|2021. 05. 04.
Stochastic Gradient Optimization Techniques참고 문헌 27인용 수 6
한 줄 요약

이 논문은 깊이 있는 신경망에서 과거 기울기의 누적 영향을 시간이 지남에 따라 감소시키는 Demon을 소개한다. 이는 학습 안정성과 성능을 향상시킨다. Adam과 모멘텀 SGD에 적용했을 때, Demon은 학습률 감쇠와 경쟁 가능한 성능을 달성하면서도 하이퍼파라미터 튜닝에 훨씬 덜 민감하다.

ABSTRACT

Momentum is a popular technique in deep learning for gradient-based optimizers. We propose a decaying momentum (Demon) rule, motivated by decaying the total contribution of a gradient to all future updates. Applying Demon to Adam leads to significantly improved training, notably competitive to momentum SGD with learning rate decay, even in settings in which adaptive methods are typically non-competitive. Similarly, applying Demon to momentum SGD improves over momentum SGD with learning rate decay in most cases. Notably, Demon momentum SGD is observed to be significantly less sensitive to parameter tuning than momentum SGD with learning rate decay schedule, critical to training neural networks in practice. Results are demonstrated across a variety of settings and architectures, including image classification, generative models, and language models. Demon is easy to implement and tune, and incurs limited extra computational overhead, compared to the vanilla counterparts. Code is readily available.

연구 동기 및 목표

  • 기본적인 적응형 최적화기(예: Adam)에서 모멘텀 감쇠가 부족하여 학습 안정성과 성능이 저하되는 문제를 해결하기 위해.
  • 실제로 튜닝하기 어려운 학습률 감쇠 스케줄에 대한 의존도를 줄이기 위해.
  • 다양한 아키텍처에서 일반화 및 수렴을 향상시키는 모멘텀 감쇠 메커니즘을 개발하기 위해.
  • 기존 최적화기 대비 구현이 쉽고 계산적으로 경량인 방법을 만들기 위해.

제안 방법

  • Demon은 시간에 따라 변화하는 모멘텀 계수를 도입하여 오래된 기울기의 기여도를 점차 감소시킨다. 이는 향후 매개변수 갱신에 대한 과거 기울기의 영향을 줄인다.
  • 감쇠는 Adam과 모멘텀 SGD의 모멘텀 항목에 적용되며, 기울기의 지수이동평균을 수정한다.
  • 감쇠 스케줄은 역사적 기울기의 영향을 점차 줄이도록 설계되어 있으며, 학습률을 변경하지 않고도 학습률 감쇠의 효과를 모방한다.
  • 기존 최적화기의 수정이 거의 필요하며, 계산 오버헤드도 최소한이다.
  • 학습률과 독립적으로 감쇠가 적용되어 더 유연하고 안정적인 학습이 가능하다.
  • Demon은 적응형 및 비적응형 최적화기 모두와 호환되며, 복잡성 증가 없이 성능 향상을 이룬다.

실험 결과

연구 질문

  • RQ1학습률 감쇠에 의존하지 않고도 감쇠 모멘텀 규칙이 깊이 있는 신경망의 학습 성능을 향상시킬 수 있는가?
  • RQ2Demon은 학습률 감쇠가 적용된 모멘텀 SGD와 비교해 정확도 및 하이퍼파라미터 민감도 측면에서 어떻게 성능을 내는가?
  • RQ3Demon은 비전, 언어, 생성 모델 등 다양한 아키텍처에서 일반화를 향상시키는가?
  • RQ4Demon은 일반적으로 경쟁력이 떨어지는 경우가 많은 Adam과 같은 적응형 최적화기에도 효과적으로 적용될 수 있는가?
  • RQ5Demon은 다양한 작업에서 학습 안정성과 수렴 속도에 어떻게 영향을 미치는가?

주요 결과

  • Demon을 Adam에 적용했을 때, 학습률 감쇠를 사용한 모멘텀 SGD와 경쟁 가능한 성능을 달성했으며, 특히 기존에 적응형 방법이 열등한 것으로 알려진 환경에서도 성능이 유사하다.
  • Demon을 적용한 모멘텀 SGD는 대부분의 평가된 아키텍처와 작업에서 학습률 감쇠가 적용된 모멘텀 SGD를 뛰어넘는 성능을 보였다.
  • Demon은 하이퍼파라미터 튜닝에 대한 민감도를 크게 감소시켰으며, 특히 학습률 감쇠 스케줄에 비해 뛰어난 성능을 보였다.
  • 메서드는 계산 오버헤드가 거의 없어 실세계 학습에 실용적이다.
  • Demon은 이미지 분류, 언어 모델링, 생성 모델링 작업 전반에서 학습 안정성과 수렴을 향상시켰다.
  • Demon의 코드는 공개되어 있어 쉽게 통합하고 재현할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.