Skip to main content
QUICK REVIEW

[논문 리뷰] Block-Normalized Gradient Method: An Empirical Study for Training Deep Neural Network

Adams Wei Yu, Lei Huang|arXiv (Cornell University)|2017. 07. 16.
Stochastic Gradient Optimization Techniques참고 문헌 2인용 수 17
한 줄 요약

이 논문은 깊이 있는 신경망 학습을 위한 간단하면서도 효과적인 최적화 프레임워크인 블록 정규화 기울기(BNG) 방법을 제안한다. 이 방법은 기울기를 계층별로 정규화하여 기울기 소실 및 기울기 폭발 문제를 완화한다. 실험 결과 BNG는 학습 수렴 속도와 일반화 성능을 크게 향상시키며, ImageNet에서 SGDMNG가 Adam을 능가하고, AdamNG가 RNN 언어 모델링에서 뛰어난 성능을 보였다.

ABSTRACT

In this paper, we propose a generic and simple strategy for utilizing stochastic gradient information in optimization. The technique essentially contains two consecutive steps in each iteration: 1) computing and normalizing each block (layer) of the mini-batch stochastic gradient; 2) selecting appropriate step size to update the decision variable (parameter) towards the negative of the block-normalized gradient. We conduct extensive empirical studies on various non-convex neural network optimization problems, including multi-layer perceptron, convolution neural networks and recurrent neural networks. The results indicate the block-normalized gradient can help accelerate the training of neural networks. In particular, we observe that the normalized gradient methods having constant step size with occasionally decay, such as SGD with momentum, have better performance in the deep convolution neural networks, while those with adaptive step sizes, such as Adam, perform better in recurrent neural networks. Besides, we also observe this line of methods can lead to solutions with better generalization properties, which is confirmed by the performance improvement over strong baselines.

연구 동기 및 목표

  • 새로운 정규화 전략을 사용하여 깊이 있는 신경망 학습에서 기울기 소실 및 기울기 폭발 문제를 해결한다.
  • 다양한 딥러닝 아키텍처에 적용 가능한 일반적인 계층별 기울기 정규화 기법을 개발한다.
  • 다양한 신경망 유형과 데이터셋에서 정규화된 기울기가 최적화 성능에 미치는 영향을 조사한다.
  • 상수 단계 크기와 적응형 단계 크기의 조합이 블록 정규화 기울기와 함께 얼마나 효과적인지 비교한다.
  • 전방향 및 순차적 모델 모두에서 더 나은 일반화 성능과 더 빠른 수렴 속도를 입증한다.

제안 방법

  • 신경망의 각 계층(블록)에 대해 미니배치 스토하스틱 기울기를 계산한다.
  • 각 계층의 기울기를 L2 노름으로 나누어 단위 노름 방향 벡터로 정규화한다.
  • 최적화에서 검색 방향으로 정규화된 기울기를 사용하여 방향과 크기를 분리한다.
  • 상수 단계 크기와 간헐적인 감쇠(예: 모멘텀이 있는 SGD) 또는 적응형 단계 크기(예: Adam, AdaGrad)를 적용한다.
  • 기존의 일阶 최적화 알고리즘의 핵심 업데이트 규칙을 수정하지 않고 정규화된 기울기를 통합한다.
  • 스토하스틱 최적화의 확장성과 일치하는 계층별로 정규화를 적용하여 계산 효율성을 유지한다.

실험 결과

연구 질문

  • RQ1계층별 기울기 정규화는 깊이 있는 신경망에서 학습 안정성과 수렴 속도를 향상시키는가?
  • RQ2다양한 아키텍처에서 표준 SGD와 Adam과 비교해 블록 정규화 기울기 방법의 테스트 정확도는 어떻게 되는가?
  • RQ3정규화된 기울기와 함께 사용할 때 상수 단계 크기와 적응형 단계 크기 중 어떤 조합이 가장 우수한 성능을 보이는가?
  • RQ4정규화된 기울기 방법은 정규화되지 않은 대안보다 더 나은 일반화 성능을 제공하는가?
  • RQ5이 방법은 이미지 분류, 언어 모델링, 감성 분석 등 다양한 작업에서 어떻게 성능을 발휘하는가?

주요 결과

  • 블록 정규화 기울기 방법은 CNN, RNN, 전방향 네트워크 등 여러 딥러닝 작업에서 일관되게 학습 성능을 향상시킨다.
  • ResNet을 사용한 ImageNet에서 SGDMNG는 상위-1 오차율 28.43%를 기록하여 SGDM(29.05%)와 Adam(35.6%)을 모두 능가하며 뛰어난 일반화 성능을 입증했다.
  • Penn Tree Bank 언어 모델링에서 AdamNG는 77.11%의 검증 정확도를 기록하여 Adam(74.02%)과 SGDM(64.35%)를 모두 초월했으며, 모든 BPTT 길이에서 우수한 성능을 보였다.
  • Rotten Tomatoes 감성 분석에서 AdamNG는 모든 기준 모델, 특히 Adam과 SGDM을 크게 능가하는 최고의 검증 정확도를 기록했다.
  • 매우 깊은 네트워크에서는 기울기 정규화가 기울기 소실/폭발 문제를 더 효과적으로 완화함으로써 특히 유리한 성능을 발휘한다.
  • RNN에서는 적응형 단계 크기 방법(예: AdamNG)이 상수 단계 크기 방법(예: SGDMNG)보다 우수한 성능을 보였고, 반대로 CNN에서는 반대의 경향을 보였으며, 이는 작업에 따라 최적의 설정이 다름을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.