Skip to main content
QUICK REVIEW

[논문 리뷰] Ranger21: a synergistic deep learning optimizer

Less Wright, Nestor Demeure|arXiv (Cornell University)|2021. 06. 25.
Advanced Neural Network Applications참고 문헌 22인용 수 4
한 줄 요약

Ranger21은 AdamW와 적응형 기울기 클리핑, 웨이트 디케이, 룩헤드 등 8개의 상호보완적인 최적화 기법을 조합한 상호작용적 딥러닝 최적화기로, 더 빠른 수렴, 더 부드러운 학습 곡선, 배치 정규화 없이 ImageNet2012에서 ResNet50을 학습할 수 있는 능력을 갖추고 있으며, 이는 AdamW가 완전히 실패하는 상황이다.

ABSTRACT

As optimizers are critical to the performances of neural networks, every year a large number of papers innovating on the subject are published. However, while most of these publications provide incremental improvements to existing algorithms, they tend to be presented as new optimizers rather than composable algorithms. Thus, many worthwhile improvements are rarely seen out of their initial publication. Taking advantage of this untapped potential, we introduce Ranger21, a new optimizer which combines AdamW with eight components, carefully selected after reviewing and testing ideas from the literature. We found that the resulting optimizer provides significantly improved validation accuracy and training speed, smoother training curves, and is even able to train a ResNet50 on ImageNet2012 without Batch Normalization layers. A problem on which AdamW stays systematically stuck in a bad initial state.

연구 동기 및 목표

  • 딥러닝 최적화기 연구에서의 분열 문제를 해결하기 위해, 점진적인 개선 사항이 종종 독립형 최적화기로 제시되는 것에 대비하여, 이를 조합 가능한 구성 요소로 간주하는 것.
  • 다양한 독립적으로 검증된 최적화 기법들을 조합하면 개별 구성 요소를 초월한 상호작용적 성능 향상이 이루어지는지 조사하기 위해.
  • 이전에 학습이 어려운 것으로 간주되던 아키텍처를 포함한 도전적인 벤치마크에서 기존의 기준인 AdamW를 능가하는 단일 통합 최적화기가 존재하는지 보여주기 위해.
  • 실무자들이 최신 최적화 기법을 다시 구현하지 않고도 즉시 활용할 수 있도록 공개된 모듈러 최적화기를 제공하기 위해.
  • 미래의 적응형 최적화기 설계를 위한 메타-최적화 및 모듈러 설계의 잠재력을 탐색하기 위해.

제안 방법

  • Ranger21은 핵심 최적화 엔진으로 AdamW를 기반으로 하며, 기울기와 제곱 기울기의 지수이동평균을 통해 적응형 학습률을 유지한다.
  • 기울기 클리핑을 적응형으로 적용하여 고분산 미니배치에서의 발산을 방지하고 학습을 안정화시킨다.
  • 웨이트 디케이를 학습률에서 분리함으로써 일반화 성능과 학습 안정성을 향상시킨다.
  • 룩헤드 최적화기를 통합하여 빠른 가중치 벡터를 느린 이동 평균 업데이트 규칙을 통해 업데이트함으로써 수렴 성능을 향상시킨다.
  • 기울기 정규화와 수정된 학습률 스케줄링을 적용하여 최적화 역학의 안정성과 일반화 성능을 추가로 향상시킨다.
  • 레크티피드 어댑티브 오프셋(Reptified Adam, RAdam) 기법을 적용하여 초기 학습 단계에서 적응형 학습률의 분산을 보정한다.

실험 결과

연구 질문

  • RQ1여러 조합 가능한 최적화 개선 사항을 하나의 최적화기로 통합하면 개별 구성 요소를 초월한 상호작용적 성능 향상이 이루어지는가?
  • RQ2검증된 기법들로 구성된 통합 최적화기가 ImageNet2012와 같은 표준 벤치마크에서 AdamW를 능가하는가?
  • RQ3AdamW가 수렴에 실패하는 상황에서 Ranger21은 배치 정규화 없이 ResNet50을 학습할 수 있는가?
  • RQ4학습 속도, 검증 정확도, 학습 곡선의 부드러움 측면에서 Ranger21는 AdamW와 어떻게 비교되는가?
  • RQ5다양한 아키텍처와 데이터셋 간에 모듈러하고 조합 가능한 최적화 구성 요소는 얼마나 일반화 가능한가?

주요 결과

  • Ranger21는 AdamW보다 ImageNet2012에서 유의미하게 높은 최종 검증 정확도를 달성하여 더 뛰어난 일반화 성능을 입증했다.
  • Ranger21를 사용한 학습은 AdamW 대비 핵심 정확도 수준에 도달하는 데 최대 3배 빠른 속도를 기록하여 상당한 성능 향상을 보였다.
  • Ranger21는 손실 진동이 감소한 더 부드러운 학습 곡선을 생성하여 최적화 역학의 안정성을 높였음을 시사했다.
  • AdamW가 정규화 없이 ResNet50에서 수렴하지 못하고 손실이 약 ~0.1에서 정체되는 것과는 달리, Ranger21는 60 에포크 동안 손실 감소가 지속되는 방식으로 모델을 성공적으로 학습시켰다.
  • 다양한 무작위 시드에서 일관된 성능을 기록하여, 결과의 신뢰성과 우연한 초기화에 의존하지 않는 안정성을 확인했다.
  • Ranger21는 공개되어 있으며, 즉시 사용 가능한 PyTorch 및 Flax 구현체를 제공하여 즉각적인 도입과 커뮤니티 피드백을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.