Skip to main content
QUICK REVIEW

[논문 리뷰] A Study of Gradient Variance in Deep Learning

Fartash Faghri, David Duvenaud|arXiv (Cornell University)|2020. 07. 09.
Domain Adaptation and Few-Shot Learning참고 문헌 42인용 수 13
한 줄 요약

이 논문은 딥러닝에서 기울기 분산을 조사하며, 기울기 공간에서 가중치가 부여된 클러스터에서 샘플링하여 분산을 최소화하는 Gradient Clustering(GC)를 제안한다. 연구 결과, 기울기 분산은 훈련 중에 증가함을 발견하였으며, 이는 일반적인 가정과 반대된다. 또한 수렴 속도를 더 잘 예측하는 지표로 정규화된 기울기 분산을 제안하며, 데이터에 중복이 존재할 경우 GC가 분산을 크게 감소시킴을 보였다.

ABSTRACT

The impact of gradient noise on training deep models is widely acknowledged but not well understood. In this context, we study the distribution of gradients during training. We introduce a method, Gradient Clustering, to minimize the variance of average mini-batch gradient with stratified sampling. We prove that the variance of average mini-batch gradient is minimized if the elements are sampled from a weighted clustering in the gradient space. We measure the gradient variance on common deep learning benchmarks and observe that, contrary to common assumptions, gradient variance increases during training, and smaller learning rates coincide with higher variance. In addition, we introduce normalized gradient variance as a statistic that better correlates with the speed of convergence compared to gradient variance.

연구 동기 및 목표

  • 딥러닝 훈련 중 기울기 분포의 구조와 최적화에 미치는 영향을 이해하는 것.
  • 학습률, 배치 크기, 모델 아키텍처, 데이터 분포와 같은 요소들이 기울기 분산에 미치는 영향을 조사하는 것.
  • 기울기 공간 내 클러스터링을 활용하여 미니배치 기울기 추정의 분산을 줄이는 방법을 개발하는 것.
  • 기울기 분산과 그 정규화된 형태가 표준 분산보다 훈련 속도와 일반화 성능과 더 잘 상관되는지 평가하는 것.
  • 학습률 감소 후 손실이 급격히 감소하는 등 기대에 어긋나는 현상과 SVRG가 딥 네트워크에서 실패하는 이유를 설명하는 것.

제안 방법

  • 기울기 공간에서 기울기를 클러스터링하고, 가중치가 부여된 클러스터에서 샘플링하여 평균 미니배치 기울기 분산을 최소화하는 Gradient Clustering(GC)를 제안한다.
  • 이론적으로 기울기 공간에서 가중치가 부여된 클러스터에서 샘플을 추출할 경우 평균 미니배치 기울기 분산이 최소화됨을 증명한다.
  • 수렴 속도와의 상관관계가 더 높은 통계량으로 정규화된 기울기 분산을 도입한다.
  • 기울기 클러스터링 기반의 분류 샘플링을 통해 기울기 추정의 안정성 향상과 분산 감소를 도모한다.
  • 실제 벤치마크(MNIST, CIFAR-10, ImageNet)와 합성 랜덤 특징 모델을 적용하여 분산 동역학을 측정한다.
  • 중복된 데이터 포인트를 포함한 제어 실험을 통해 GC가 데이터 중복 상황에서 분산 감소에 얼마나 효과적인지 테스트한다.

실험 결과

연구 질문

  • RQ1딥러닝에서 기울기 분포는 클러스터링과 같은 구조적 모드를 보이는가?
  • RQ2기울기 분산은 훈련 중 어떻게 변화하며, 학습률이나 배치 크기에 의존하는가?
  • RQ3기울기 클러스터링을 활용하면 표준 샘플링보다 미니배치 기울기 추정의 분산을 더 효과적으로 줄일 수 있는가?
  • RQ4정규화된 기울기 분산은 표준 기울기 분산보다 수렴 속도와 더 강한 상관관계를 가지는가?
  • RQ5학습률 감소 후 손실이 급격히 감소하는 이유는 무엇이며, 기울기 노이즈는 이 현상과 어떻게 관련되는가?

주요 결과

  • 기울기 분산은 훈련 중에 증가하며, 이는 일반적으로 분산이 시간이 지남에 따라 감소한다는 가정과 정반대된다.
  • 작은 학습률은 더 높은 기울기 분산과 관련되어 있어 최적화 안정성에서 놀라운 상충관계를 보인다.
  • 정규화된 기울기 분산은 표준 기울기 분산보다 수렴 속도와 더 강한 상관관계를 보이며, 더 나은 진단 도구가 된다.
  • 데이터에 중복이 존재할 경우 Gradient Clustering(GC)가 기울기 분산을 크게 감소시킨다. 특히 과다매개변수화된 영역에서 두드러진다.
  • 경미한 과다매개변수화 상황에서는 GC가 이중배치 SGD(SG-2B)와 유사한 성능을 보이며, 표준 SGD(SG-B)보다 분산 감소에서 뛰어난 성능을 보인다.
  • SVRG가 딥러닝에서 실패하는 이유는 제어 변수의 노후화 때문이 아니라, 과다매개변수화된 영역에서 내재된 노이즈 분산이 낮기 때문일 가능성이 높다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.