Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforced stochastic gradient descent for deep neural network learning

Haiping Huang, Taro Toyoizumi|arXiv (Cornell University)|2017. 01. 27.
Stochastic Gradient Optimization Techniques참고 문헌 26인용 수 3
한 줄 요약

이 논문은 시간에 따라 증가하는 확률을 사용해 누적된 과거 기울기를 현재 기울기와 무작위로 강화하는 새로운 SGD 변종인 강화된 확률적 기울기 하강법(R-SGD)을 제안한다. R-SGD는 학습 속도를 크게 향상시키고 과적합을 줄이며, 메모리 사용량을 절반으로 줄였음에도 불구하고 Adam과 유사한 일반화 성능을 달성한다. 이는 합성 및 MNIST 벤치마크에서 표준 SGD와 적응형 방법보다 뛰어난 성능을 보인다.

ABSTRACT

Stochastic gradient descent (SGD) is a standard optimization method to minimize a training error with respect to network parameters in modern neural network learning. However, it typically suffers from proliferation of saddle points in the high-dimensional parameter space. Therefore, it is highly desirable to design an efficient algorithm to escape from these saddle points and reach a parameter region of better generalization capabilities. Here, we propose a simple extension of SGD, namely reinforced SGD, which simply adds previous first-order gradients in a stochastic manner with a probability that increases with learning time. As verified in a simple synthetic dataset, this method significantly accelerates learning compared with the original SGD. Surprisingly, it dramatically reduces over-fitting effects, even compared with state-of-the-art adaptive learning algorithm---Adam. For a benchmark handwritten digits dataset, the learning performance is comparable to Adam, yet with an extra advantage of requiring one-fold less computer memory. The reinforced SGD is also compared with SGD with fixed or adaptive momentum parameter and Nesterov's momentum, which shows that the proposed framework is able to reach a similar generalization accuracy with less computational costs. Overall, our method introduces stochastic memory into gradients, which plays an important role in understanding how gradient-based training algorithms can work and its relationship with generalization abilities of deep networks.

연구 동기 및 목표

  • 딥 네ural 네트워크 학습 중 고차원 손실 곡면에서 SGD가 안장점과 평탄한 영역에 갇히는 문제를 해결하기 위해.
  • 계산 비용이나 메모리 사용량을 늘리지 않고도 일반화 성능과 수렴 속도를 향상시키기 위해.
  • 역사적 기울기 정보를 무작위로 통합함으로써 탐색 능력 향상과 열악한 국소 최소값 탈출 가능성을 탐색하기 위해.
  • 정확도와 효율성 측면에서 R-SGD의 성능을 Adam과 같은 최신 적응형 최적화 방법과 비교하기 위해.
  • 실증적 평가를 통해 기울기 메모리와 일반화 간의 관계를 조사하기 위해.

제안 방법

  • R-SGD는 학습 단계에 따라 증가하는 시간 의존적 강화 확률을 도입하여 현재 기울기와 과거 기울기의 가중합을 무작위로 조합한다.
  • 이 방법은 각 업데이트 단계에서 강화된 기울기(현재 + 과거)를 적용할지 아니면 오직 현재 기울기만을 적용할지 결정하기 위한 확률적 메커니즘을 사용한다.
  • 강화는 시간이 지남에 따라 증가하는 확률로 누적된 과거 기울기의 스케일링된 버전을 현재 기울기에 더하여 구현된다.
  • 알고리즘은 과거 기울기의 누적 평균을 유지하고 이를 무작위로 적용함으로써 최적화 과정에 통제된 메모리를 도입한다.
  • 이 프레임워크는 시그모이드 활성화 함수를 사용하는 완전 연결 딥 네트워크에서 평가되었으며, 합성 비선형 매핑 및 MNIST 숫자 분류 작업에서 테스트되었다.
  • 훈련/검증 손실과 일반화 정확도를 지표로 하여 R-SGD는 표준 SGD, Adam, 모멘텀 기반 SGD 변종과 비교되었다.

실험 결과

연구 질문

  • RQ1과거 기울기의 무작위 강화가 딥 네럴 네트워크 학습에서 수렴 속도와 일반화 성능 향상에 기여하는가?
  • RQ2R-SGD는 더 적은 메모리 사용량으로 Adam보다 일반화 성능에서 뛰어나게 되는가?
  • RQ3역사적 기울기 정보의 통합이 고차원 비凸 손실 곡면에서 최적화 궤적에 어떤 영향을 미치는가?
  • RQ4R-SGD는 표준 SGD가 억류당하는 안장점과 평탄한 영역을 효과적으로 탈출할 수 있는가?
  • RQ5다양한 초기화 조건 하에서 R-SGD의 성능은 모멘텀 기반 및 적응형 방법과 비교해 어떻게 되는가?

주요 결과

  • 합성 비선형 매핑 작업에서 R-SGD는 표준 SGD와 Adam보다 학습 속도를 크게 향상시키고 과적합을 줄였다.
  • MNIST 벤치마크에서 R-SGD는 메모리 사용량을 절반으로 줄였음에도 불구하고 Adam과 유사한 일반화 성능을 달성했다.
  • R-SGD는 Adam과 동일한 일반화 정확도를 달성했고, 적응형 모멘텀을 사용하는 SGD보다도 낮은 계산 비용으로 이를 달성했다.
  • 이중선형 보간 분석 결과, R-SGD는 Adam보다 무게 공간에서 더 날카운 부분공간을 탐색하는 것으로 나타났으며, 이는 다른 일반화 성질을 시사한다.
  • 고정 또는 적응형 모멘텀을 사용하는 SGD 및 네스테로프 모멘텀보다 수렴 속도와 일반화 성능에서 뛰어난 성능을 보였다.
  • R-SGD는 다양한 무작위 초기화 조건에서도 성능이 뛰어나 일관된 최적화 행동을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.