Skip to main content
QUICK REVIEW

[논문 리뷰] Calibrating the Adaptive Learning Rate to Improve Convergence of ADAM

Qianqian Tong, Guannan Liang|arXiv (Cornell University)|2019. 08. 02.
Stochastic Gradient Optimization Techniques인용 수 11
한 줄 요약

이 논문은 Adam의 적응형 학습률(A-LR)을 소프트플러스 활성화 함수를 사용해 校정함으로써 파rameter 차원 간 이방성(anisotropy)를 감소시키는 Sadam과 SAMSGrad를 제안한다. 이론적으로 수렴성과 초항수 ε의 관계를 연결하고, 실험적으로 일반화 성능 향상을 입증함으로써, 딥러닝 작업에서 Adam 및 기타 AGM보다 더 빠른 수렴 속도와 더 나은 테스트 성능을 달성한다.

ABSTRACT

Adaptive gradient methods (AGMs) have become popular in optimizing the nonconvex problems in deep learning area. We revisit AGMs and identify that the adaptive learning rate (A-LR) used by AGMs varies significantly across the dimensions of the problem over epochs (i.e., anisotropic scale), which may lead to issues in convergence and generalization. All existing modified AGMs actually represent efforts in revising the A-LR. Theoretically, we provide a new way to analyze the convergence of AGMs and prove that the convergence rate of extsc{Adam} also depends on its hyper-parameter $ε$, which has been overlooked previously. Based on these two facts, we propose a new AGM by calibrating the A-LR with an activation ({\em softplus}) function, resulting in the extsc{Sadam} and extsc{SAMSGrad} methods \footnote{Code is available at https://github.com/neilliang90/Sadam.git.}. We further prove that these algorithms enjoy better convergence speed under nonconvex, non-strongly convex, and Polyak-Łojasiewicz conditions compared with extsc{Adam}. Empirical studies support our observation of the anisotropic A-LR and show that the proposed methods outperform existing AGMs and generalize even better than S-Momentum in multiple deep learning tasks.

연구 동기 및 목표

  • Adam에서 발생하는 적응형 학습률의 이방성 문제를 해결함으로써 일반화 성능 저하를 방지하기 위함.
  • 초항수 ε가 적응형 경사하강법(AGM)의 수렴성에 미치는 영향을 이론적으로 분석하기 위함.
  • 소프트플러스 함수를 사용한 A-LR의 새로운 校정 메커니즘을 제안하여 수렴 속도와 일반화 성능 향상시키기 위함.
  • 비볼록성 및 폴랴크-뢰자시에프 조건 하에서 수렴성이 보장되는 Adam의 개선된 변종인 Sadam과 SAMSGrad를 개발하기 위함.
  • 적응형 학습률의 校정이 일반화 갭을 줄이고 기존 AGM 및 S-Momentum보다 뛰어난 성능을 내는지 경험적으로 검증하기 위함.

제안 방법

  • Adam의 적응형 학습률(A-LR)에 소프트플러스 기반 校정을 도입하여, $ \frac{1}{\sqrt{v_t} + \epsilon} $ 를 $ \frac{1}{\text{softplus}(v_t) + \epsilon} $ 로 대체함으로써 업데이트를 매끄럽고 안정적으로 만듦.
  • Sadam을 소프트플러스로 校정된 Adam의 변형으로, 두 번째 순서 모멘텀의 최대 풀링을 적용한 SAMSGrad를 AMSGrad 유사한 버전으로 제안.
  • 이론적 분석을 통해 수렴성은 ε에 의존하며, 이는 이전에 간과되었던 요소임을 밝혀내고, Sadam이 비볼록, 비강한볼록, 폴랴크-뢰자시에프 조건 하에서 Adam과 동일한 수렴 속도를 달성함을 증명.
  • A-LR의 차원 간 유한성 보장을 통해 고기울기 좌표에 대한 과적합 위험을 감소시킴.
  • 소프트플러스 함수는 딱딱한 클리핑을 피하는 매끄럽고 미분 가능한 校정을 제공하여, AdaBound 같은 임계값 기반 방법보다 더 나은 최적화 역학을 가능하게 함.
  • ε의 영향과 校정된 A-LR를 포함한 이론적 수렴 증명을 확장하여 안정성과 수렴 속도 향상을 입증함.

실험 결과

연구 질문

  • RQ1Adam의 적응형 학습률(A-LR)은 파arameter 차원 간 어떻게 이방적으로 변할 수 있으며, 이는 수렴성과 일반화에 어떤 영향을 미치는가?
  • RQ2왜 Adam의 A-LR 공식에서 초항수 ε가 수렴 분석에서 간과되었으며, 이는 최적화 성능에 어떤 영향을 미치는가?
  • RQ3소프트플러스 함수를 사용한 A-LR의 校정이 딥러닝 모델의 수렴 속도와 일반화 성능 향상에 기여할 수 있는가?
  • RQ4제안된 방법인 Sadam과 SAMSGrad는 일반화 성능 향상과 함께 Adam과 동일한 수렴 속도를 유지하는가?
  • RQ5Sadam과 SAMSGrad는 다양한 딥러닝 작업에서 Adam, S-Momentum 및 기타 AGM들과 비교해 경험적으로 어떻게 성능을 내는가?

주요 결과

  • 경험적 결과는 Adam의 A-LR가 파arameter 차원 간에 심한 이방성을 보이며, 이는 최적화의 비최적성과 일반화 저하를 초래할 수 있음을 확인함.
  • 이론적 분석을 통해 Adam의 수렴 속도는 이전에 분석에서 간과되었던 초항수 ε에 의존한다는 것이 드러남.
  • 비볼록, 비강한볼록, 폴랴크-뢰자시에프 조건 하에서 Sadam과 SAMSGrad는 Adam보다 더 빠른 수렴 속도를 보이며, 수렴성은 증명 가능하게 안정함.
  • 다양한 딥러닝 벤치마크에서 Sadam과 SAMSGrad는 Adam보다 더 우수한 일반화 성능을 보이며, 테스트 정확도에서 S-Momentum를 뛰어넘기도 함.
  • 소프트플러스 기반 A-LR 校정은 딱딱한 클리핑(예: AdaBound)보다 더 매끄럽고 안정적인 업데이트 메커니즘을 제공하여 최적화 역학을 향상시킴.
  • 적절한 학습률 스케줄링(예: $ \eta = O(1/T^2) $)을 적용할 경우, Sadam는 이론적 경계와 동일한 $ O(1/T) $ 수렴 속도를 달성하며 일반화 성능 향상을 동시에 확보함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.