Skip to main content
QUICK REVIEW

[논문 리뷰] Stochastic Gradient Descent with Nonlinear Conjugate Gradient-Style Adaptive Momentum

Bao Wang, Qiang Ye|arXiv (Cornell University)|2020. 12. 03.
Adversarial Robustness in Machine Learning참고 문헌 30인용 수 9
한 줄 요약

이 논문은 깊이 신경망(DNN) 훈련에서 수동으로 모멘텀 초깃값을 조정할 필요 없이 비선형 공액 기울기(NCG) 스타일의 적응형 모멘텀을 갖는 확률적 경사하강법(FRSGD)을 제안한다. 기울기 이력에 기반해 모멘텀을 동적으로 조정함으로써 더 큰 학습률을 허용하고, 훈련 속도를 가속화하며, 정상 및 적대적 정확도를 향상시킨다. ResNet 모델에서 CIFAR-10의 테스트 오차를 5.25%에서 4.64%로 감소시키고, CIFAR-100은 23.75%에서 20.03%로 감소시킨다.

ABSTRACT

Momentum plays a crucial role in stochastic gradient-based optimization algorithms for accelerating or improving training deep neural networks (DNNs). In deep learning practice, the momentum is usually weighted by a well-calibrated constant. However, tuning hyperparameters for momentum can be a significant computational burden. In this paper, we propose a novel \emph{adaptive momentum} for improving DNNs training; this adaptive momentum, with no momentum related hyperparameter required, is motivated by the nonlinear conjugate gradient (NCG) method. Stochastic gradient descent (SGD) with this new adaptive momentum eliminates the need for the momentum hyperparameter calibration, allows a significantly larger learning rate, accelerates DNN training, and improves final accuracy and robustness of the trained DNNs. For instance, SGD with this adaptive momentum reduces classification errors for training ResNet110 for CIFAR10 and CIFAR100 from $5.25\%$ to $4.64\%$ and $23.75\%$ to $20.03\%$, respectively. Furthermore, SGD with the new adaptive momentum also benefits adversarial training and improves adversarial robustness of the trained DNNs.

연구 동기 및 목표

  • 딥 네트워크(DNN) 훈련에서 SGD의 모멘텀 초깃값 조정에 따른 계산 부담을 해소하기 위해.
  • 계산 비용을 증가시키지 않고도 DNN의 수렴 속도 향상과 최종 모델 정확도 향상을 위해.
  • 새로운 적응형 모멘텀 기반 메커니즘을 통해 DNN의 적대적 내성 강도를 향상시키기 위해.
  • 기존의 Adam이나 Nesterov 모멘텀과 같은 적응형 최적화 방법의 단순하고 효과적인 대안을 개발하기 위해.

제안 방법

  • 비선형 공액 기울기(NCG) 방법에서 영감을 얻은 새로운 적응형 모멘텀 항을 도입하여, 고정된 모멘텀 계수 β를 동적으로 계산된 값으로 대체한다.
  • 현재 및 이전 기울기에 따라 의존하는 NCG에서 유도된 공식을 사용하여 모멘텀 업데이트를 수행함으로써 내림방향 적응성 보장.
  • 고정된 학습률을 유지하면서도 수렴 성질 향상로 인해 훨씬 큰 스텝 크기를 허용한다.
  • 표준 SGD와의 후행 호환성을 유지하며, 코드 수정 최소화 가능.
  • 미니배치 훈련에 적합한 단순화되고 효율적인 NCG 모멘텀 업데이트 근사치를 사용하여 선형 탐색을 피한다.
  • 추가 초깃값 조정이 필요 없는 단일 상수 β의 대체로 SGD에 통합되어 구현된다.

실험 결과

연구 질문

  • RQ1NCG 기반 적응형 모멘텀 메커니즘이 DNN의 확률적 경사하강법에서 훈련 속도와 수렴 성능을 향상시킬 수 있는가?
  • RQ2모멘텀 초깃값 β를 제거함으로써 계산 비용 증가 없이 일반화 및 내성 강도 향상가능한가?
  • RQ3이 적응형 모멘텀이 더 큰 학습률을 허용하면서도 모델 정확도를 유지하거나 향상시킬 수 있는가?
  • RQ4정상 및 적대적 정확도 측면에서 제안된 방법이 Nesterov 모멘텀이 적용된 SGD 및 Adam과 비교해 어떻게 성능을 내는가?
  • RQ5이 적응형 모멘텀이 다양한 적대적 공격에 대해 DNN의 내성 강도를 향상시킬 수 있는가?

주요 결과

  • FRSGD는 ResNet110에서 CIFAR-10의 테스트 오차를 5.25%에서 4.64%로 감소시켜 상대적 향상률 11.6% 달성.
  • CIFAR-100의 경우 테스트 오차는 23.75%에서 20.03%로 감소하여 상대적 향상률 15.6% 달성.
  • 400 에포크로 연장 훈련한 결과, FRSGD는 CIFAR-10에서 테스트 오차 4.26%를 기록했으며, 이는 SGD 및 SGD+Nesterov 모멘텀를 모두 초월한다.
  • CIFAR-10에서 PreResNet290에 대한 FRSGD의 훈련 손실은 0.00138로, SGD의 0.0048 및 SGD+NM의 0.0052보다 현저히 낮다.
  • 적대적 훈련에서, IFGSM-100 공격 하에서 FRSGD는 CIFAR-10에서 52.15%의 내성 정확도를 달성했으며, SGD+NM의 51.08%보다 높은 성능을 보였다. 이는 내성 강도 향상의 증거이다.
  • 모든 테스트 공격(FGSM, IFGSM, C&W)에서 FRSGD는 기준 SGD 및 SGD+NM보다 일관된 성능 향상을 보이며 내성 강도를 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.