Skip to main content
QUICK REVIEW

[논문 리뷰] On the Noisy Gradient Descent that Generalizes as SGD

Jingfeng Wu, Wenqing Hu|arXiv (Cornell University)|2019. 06. 18.
Sparse and Compressive Sensing Techniques참고 문헌 52인용 수 19
한 줄 요약

이 논문은 기울기 행렬과 샘플링 노이즈의 곱으로 기울기 노이즈를 모델링함으로써 노이즈가 있는 경사하강법에 대한 새로운 프레임워크를 제안한다. 이는 노이즈의 분포 유형이 일반화에 결정적이지 않음을 입증하며, 크기와 공분산 구조가 적절히 설정되어 있다면 충분하다. 주요 기여는 계산적으로 효율적인 알고리즘 [MSGD-Fisher]-B로, 희박한 가우시안 샘플링 노이즈를 주입하여 대용량 배치 학습에서 일반화 격차를 해소함으로써 표준 대용량 배치 SGD를 능가하고 소용량 배치 SGD 성능과 동등한 성능을 달성한다.

ABSTRACT

The gradient noise of SGD is considered to play a central role in the observed strong generalization abilities of deep learning. While past studies confirm that the magnitude and the covariance structure of gradient noise are critical for regularization, it remains unclear whether or not the class of noise distributions is important. In this work we provide negative results by showing that noises in classes different from the SGD noise can also effectively regularize gradient descent. Our finding is based on a novel observation on the structure of the SGD noise: it is the multiplication of the gradient matrix and a sampling noise that arises from the mini-batch sampling procedure. Moreover, the sampling noises unify two kinds of gradient regularizing noises that belong to the Gaussian class: the one using (scaled) Fisher as covariance and the one using the gradient covariance of SGD as covariance. Finally, thanks to the flexibility of choosing noise class, an algorithm is proposed to perform noisy gradient descent that generalizes well, the variant of which even benefits large batch SGD training without hurting generalization.

연구 동기 및 목표

  • 스토케스틱 경사하강법(SGD)의 일반화 성능에 있어 노이즈 분포의 유형이 필수적인가를 조사하는 것.
  • 작업을 위해 기울기 노이즈를 기울기 행렬과 샘플링 노이즈 성분으로 분해함으로써 SGD 내 기울기 노이즈의 기원을 이해하는 것.
  • 대용량 배치 SGD가 소용량 배치 SGD와 동등한 일반화 성능을 달성할 수 있도록 구조화된 노이즈를 주입하는 실용적이고 효율적인 알고리즘을 개발하는 것.
  • 스케일된 피셔 또는 기울기 공분산을 사용하는 기존 가우시안 노이즈 기반 정규화 방법들을 공통의 샘플링 노이즈 프레임워크 아래 통합하는 것.

제안 방법

  • 논문은 미니배치 선택에서 비롯된 샘플링 노이즈와 기울기 행렬의 곱으로 SGD 기울기 노이즈를 분해하는 방법을 도입한다.
  • 샘플링 노이즈가 기울기 행렬만으로는 결정되지 않고, SGD 내 효과적 노이즈 분포를 결정함을 규명한다.
  • 대용량 배치 학습에서의 노이즈 부족을 보완하기 위해 희박한 가우시안 샘플링 노이즈를 주입하는 [MSGD-Fisher]-B를 제안한다.
  • 기울기 행렬의 공분산 구조를 유지하는 구조화된 샘플링 노이즈를 사용함으로써 SVD 기반 노이즈 주입의 고비용을 피한다.
  • 이론적 분석을 통해 이산 반복과 연속적인 SDE 간의 강한 수렴이 가우시안 MSGD에서 달성 가능함을 보여주며, 이는 더 빠른 수렴을 가능하게 한다.
  • 토이 데이터셋과 CIFAR-10에서의 ResNet-18과 같은 실제 모델을 대상으로 일반화 성능 및 수렴 속도를 비교하기 위한 경험적 검증을 수행한다.

실험 결과

연구 질문

  • RQ1노이즈 분포의 유형이 스트로케스틱 최적화 방법의 일반화 성능에 결정적인가?
  • RQ2미니배치 SGD의 샘플링 절차가 관측된 기울기 노이즈 구조를 어떻게 생성하는가?
  • RQ3크기와 공분산이 적절히 제어된다면, 가우시안 외의 다른 노이즈 유형도 기울기 하강법을 효과적으로 정규화할 수 있는가?
  • RQ4대용량 배치 SGD에서 일반화를 복원하기 위해 보완 노이즈를 주입할 수 있는 계산적으로 효율적인 알고리즘을 설계할 수 있는가?
  • RQ5다양한 노이즈 분포는 수렴 속도와 최종 일반화 성능 측면에서 어떻게 비교되는가?

주요 결과

  • 노이즈의 분포 유형은 정규화에 결정적인 요소가 아니며, 노이즈의 크기와 공분산 구조가 일반화에 더 중요하다.
  • SGD 내 기울기 노이즈는 기울기 행렬과 샘플링 노이즈의 곱으로 발생하며, 이는 스케일된 피셔를 사용하는 방법과 기울기 공분산을 공분산으로 사용하는 방법을 통합한다.
  • 제안된 [MSGD-Fisher]-B 알고리즘은 대용량 배치 학습에서 일반화 격차를 성공적으로 해소하여, CIFAR-10에서 ResNet-18을 사용할 때 소용량 배치 SGD와 동등한 성능을 달성한다.
  • 가우시안 MSGD는 이산 반복과 연속적인 SDE 간의 강한 수렴 덕분에 다른 노이즈 유형보다 더 빠르게 수렴한다.
  • 기울기 행렬은 정규화에 필수적인 구조적 정보를 유지하므로, MSGD-Bernoulli/Fisher가 GLD-diag보다 뛰어난 성능을 보임을 실험적으로 입증한다.
  • 실험 결과, 노이즈 크기를 조정한 후에도 보완 조치 없이 대용량 배치 SGD는 일반화 성능이 떨어지지만, [MSGD-Fisher]-B는 훈련 속도를 희생시키지 않고 일반화 성능을 복원함을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.