Skip to main content
QUICK REVIEW

[논문 리뷰] EAdam Optimizer: How $\epsilon$ Impact Adam

Wei Yuan, Kaixin Gao|arXiv (Cornell University)|2020. 11. 04.
Advanced Neural Network Applications참고 문헌 34인용 수 5
한 줄 요약

이 논문은 적절한 학습률의 분모가 아닌 분산 갱신으로 에프실론($\epsilon$)을 이동시켜 수치적 불안정성을 방지하면서 추가 하이퍼파rameter 없이 성능을 향상시키는 단순하면서도 효과적인 Adam 변종인 EAdam을 제안한다. 실험 결과, 이미지 분류, NLP, 객체 검출 작업 전반에서 EAdam은 Adam을 능가하고 RAdam 및 Adabelief와 동등하거나 이를 초월한다.

ABSTRACT

Many adaptive optimization methods have been proposed and used in deep learning, in which Adam is regarded as the default algorithm and widely used in many deep learning frameworks. Recently, many variants of Adam, such as Adabound, RAdam and Adabelief, have been proposed and show better performance than Adam. However, these variants mainly focus on changing the stepsize by making differences on the gradient or the square of it. Motivated by the fact that suitable damping is important for the success of powerful second-order optimizers, we discuss the impact of the constant $\\epsilon$ for Adam in this paper. Surprisingly, we can obtain better performance than Adam simply changing the position of $\\epsilon$. Based on this finding, we propose a new variant of Adam called EAdam, which doesn't need extra hyper-parameters or computational costs. We also discuss the relationships and differences between our method and Adam. Finally, we conduct extensive experiments on various popular tasks and models. Experimental results show that our method can bring significant improvement compared with Adam. Our code is available at https://github.com/yuanwei2019/EAdam-optimizer.

연구 동기 및 목표

  • 학습률의 분모에 위치하는 일반적으로 고정된 수치적 안정화 요소로 간주되는 하이퍼파rameter $\\epsilon$의 영향을 조사하는 것.
  • 특히 SGD와 같은 비적응형 방법과의 비교에서 알려진 일반화 및 수렴 문제를 해결하는 것.
  • 최적화 업데이트에서 $\\epsilon$의 위치를 재배치하면 표준 Adam보다 더 나은 성능을 낼 수 있는지 탐색하는 것.
  • 추가적인 수정 없이 최소한의 변경으로 학습 안정성과 일반화 성능을 향상시키는 Adam의 변종을 개발하는 것.
  • 제안된 방법의 효과성을 이미지 분류, NLP, 객체 검출과 같은 다양한 딥러닝 작업에서 검증하는 것.

제안 방법

  • EAdam은 적응형 학습률의 분모가 아니라 러닝 분산 $v_t$에 $\epsilon$을 더하는 방식으로 Adam 알고리즘을 수정한다.
  • 분산 갱신 규칙은 $v_t \leftarrow \beta_2 v_{t-1} + (1 - \beta_2)(g_t^2 + \epsilon)$로, $\epsilon$이 최적화 과정 동안 누적된다.
  • 이 변화는 분모 $\sqrt{\\hat{v}_t} + \epsilon$가 수치적으로 안정되면서도 기울기의 적응형 스케일링을 유지함을 보장한다.
  • 이 방법은 Adam과 동일한 계산 복잡도를 유지하며, 추가 하이퍼파rameter나 연산이 필요하지 않다.
  • 저자들은 일반화 및 수렴 성능 평가를 위해 여러 모델과 데이터셋에서 EAdam을 Adam, RAdam, Adabelief와 비교한다.
  • 알고리즘은 재현 가능성과 커뮤니티 활용을 위해 GitHub에 구현 및 공개되었다.

실험 결과

연구 질문

  • RQ1Adam 최적화기에서 $\epsilon$의 위치가 학습 동역학과 일반화 성능에 미치는 영향은 어떠한가?
  • RQ2분모에서 분산 갱신으로 $\epsilon$을 이동시키면 계산 비용 증가 없이 일반화 성능을 향상시킬 수 있는가?
  • RQ3EAdam은 다양한 딥러닝 작업에서 Adam 및 RAdam, Adabelief와 같은 다른 Adam 변종보다 뛰어난 성능을 보일 수 있는가?
  • RQ4표준 Adam에서 $\epsilon$을 직접 조정하는 것으로도 $\epsilon$의 위치를 재배치한 성능 향상 효과를 재현할 수 있는가?
  • RQ5EAdam의 성능 향상 효과는 ImageNet, Penn Treebank, PASCAL VOC와 같은 다양한 아키텍처와 데이터셋에서 견고한가?

주요 결과

  • CIFAR-100에서 EAdam은 깊이 있는 모델에서 특히 두드러지게, Adam 대비 4% 향상된 테스트 정확도를 달성한다.
  • CIFAR-10 데이터셋에서는 EAdam이 일반화 성능이 뛰어나다고 알려진 Adabelief와 동등한 성능을 기록한다.
  • Penn Treebank에서 2- 및 3층 LSTM을 사용한 언어 모델링에서, EAdam은 2층 모델에서 모든 방법 중 가장 낮은 퍼플렉서티를 기록했고, 3층 모델에서는 Adabelief와 유사한 성능을 보였다.
  • PASCAL VOC에서 FPN을 사용한 Faster R-CNN을 사용한 객체 검출에서, EAdam은 평균 정밀도(mAP) 80.62를 기록하여 Adam(71.47)과 RAdam(76.58)을 모두 능가했고, Adabelief(81.02)와 매우 유사한 성능을 보였다.
  • EAdam의 성능 향상 효과는 표준 Adam에서 $\epsilon$을 직접 조정하는 것으로 재현될 수 없었으며, 이는 $\epsilon$의 위치가 그 값 자체보다 중요하다는 것을 시사한다.
  • EAdam는 이미지 분류, NLP, 객체 검출 작업 전반에서 빠른 수렴과 뛰어난 일반화 성능을 보이며, 적응형 최적화에서 $\epsilon$의 위치가 중요한 이유를 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.