Skip to main content
QUICK REVIEW

[논문 리뷰] Adam$^+$: A Stochastic Method with Adaptive Variance Reduction

Mingrui Liu, Wei Zhang|arXiv (Cornell University)|2020. 11. 24.
Stochastic Gradient Optimization Techniques참고 문헌 38인용 수 12
한 줄 요약

Adam+는 Adam의 적응형 제2모멘트 추정을 범수 기반 적응형 스텝 사이즈로 대체하고, 현재 반복점이 아닌 외삽된 점에서 일阶 모멘트의 이동 평균을 계산하는 새로운 확률적 최적화 방법이다. 이러한 설계 덕분에 적응형 분산 감소를 갖는 증명 가능한 수렴성을 확보할 수 있으며, 딥러닝 벤치마크에서 Adam을 능가하고 최적화된 SGD와 동등한 성능을 내지만, 최소한의 하이퍼파rameter 튜닝을 요구한다.

ABSTRACT

Adam is a widely used stochastic optimization method for deep learning applications. While practitioners prefer Adam because it requires less parameter tuning, its use is problematic from a theoretical point of view since it may not converge. Variants of Adam have been proposed with provable convergence guarantee, but they tend not be competitive with Adam on the practical performance. In this paper, we propose a new method named Adam$^+$ (pronounced as Adam-plus). Adam$^+$ retains some of the key components of Adam but it also has several noticeable differences: (i) it does not maintain the moving average of second moment estimate but instead computes the moving average of first moment estimate at extrapolated points; (ii) its adaptive step size is formed not by dividing the square root of second moment estimate but instead by dividing the root of the norm of first moment estimate. As a result, Adam$^+$ requires few parameter tuning, as Adam, but it enjoys a provable convergence guarantee. Our analysis further shows that Adam$^+$ enjoys adaptive variance reduction, i.e., the variance of the stochastic gradient estimator reduces as the algorithm converges, hence enjoying an adaptive convergence. We also propose a more general variant of Adam$^+$ with different adaptive step sizes and establish their fast convergence rate. Our empirical studies on various deep learning tasks, including image classification, language modeling, and automatic speech recognition, demonstrate that Adam$^+$ significantly outperforms Adam and achieves comparable performance with best-tuned SGD and momentum SGD.

연구 동기 및 목표

  • 딥러닝에서의 경험적 성공에도 불구하고 Adam에 이론적 수렴 보장이 부족한 문제를 해결하기 위해.
  • Adam의 낮은 튜닝 요구 사항을 유지하면서도 증명 가능한 수렴성과 향상된 일반화 성능을 달성하기 위해.
  • 큰 미니배치나 재귀적 기울기 계산에 의존하지 않고도 적응형 분산 감소를 실현하기 위해.
  • 기본적인 비볼록 스무쓰함 가정 하에 최신 기법과 맞는 빠른 수렴 속도를 확립하기 위해.

제안 방법

  • Adam+는 제2모멘트 추정의 제곱근에 기반한 표준 적응형 스텝 사이즈를 첫째 모멘트 추정의 노름의 제곱근으로 나누는 스텝 사이즈로 대체한다.
  • 현재 반복점이 아닌 외삽된 점에서 첫째 모멘트 추정의 이동 평균을 계산함으로써 안정성과 수렴성을 향상시킨다.
  • 알고리즘은 제2모멘트의 이동 평균을 유지하지 않아 업데이트를 단순화하고 분산을 감소시킨다.
  • 다양한 적응형 스텝 사이즈를 가진 Adam+의 일반화된 변형을 제안하여 동일한 가정 하에 더 빠른 수렴 속도를 달성할 수 있도록 한다.
  • 이론적 분석을 통해 알고리즘이 수렴함에 따라 확률적 기울기 추정기의 분산이 감소함을 보여주며, 이는 적응형 수렴을 가능하게 한다.
  • 기본적인 비볼록 스무쓰함과 유한 기울기 가정 하에서 분석을 수행하였으며, ϵ-정류점으로의 수렴이 확립되었다.

실험 결과

연구 질문

  • RQ1적응형 최적화 방법이 Adam의 낮은 튜닝 이점과 증명 가능한 수렴 보장을 동시에 갖출 수 있는가?
  • RQ2큰 미니배치나 재귀적 기울기 계산 없이도 적응형 기울기 방법에서 자연스럽게 적응형 분산 감소가 발생하는가?
  • RQ3기울기 희소성에 의존하지 않고도 비볼록 환경에서 SGD보다 더 빠른 수렴을 달성할 수 있는가?
  • RQ4첫째 모멘트 추정에서 외삽된 점을 사용할 경우 딥러닝에서 수렴성과 일반화에 어떤 영향을 미치는가?
  • RQ5Adam+의 변형이 기본 가정 하에 최신 기법과 동등한 수렴 속도를 달성할 수 있는가?

주요 결과

  • Adam+는 표준 가정 하에 최고의 알려진 속도와 동일한 반복 복잡도로 ϵ-정류점으로의 증명 가능한 수렴을 달성한다.
  • 알고리즘이 최적화 과정에서 확률적 기울기 추정기의 분산이 감소함을 보여주며, 이는 후반 단계에서 더 빠른 수렴을 이끌어낸다.
  • 실험적 평가 결과, 이미지 분류, 언어 모델링, 자동 음성 인식 작업 전반에서 Adam+는 Adam을 크게 능가한다.
  • 최소한의 하이퍼파rameter 튜닝으로도 최적화된 SGD 및 모멘텀 SGD와 비교해 유사한 성능을 내며, 요구되는 튜닝이 극히 적다.
  • Adam+의 일반화된 변형은 동일한 조건 하에 최신 기법과 맞는 빠른 수렴 속도를 달성한다.
  • 이론적 분석을 통해 첫째 모멘트 추정의 노름에 기반한 적응형 스텝 사이즈가 제2모멘트 추정에 의존하지 않고도 개선된 수렴 행동을 이끌어낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.