Skip to main content
QUICK REVIEW

[논문 리뷰] Hessian based analysis of SGD for Deep Nets: Dynamics and Generalization

Xinyan Li, Qilong Gu|arXiv (Cornell University)|2019. 07. 24.
Stochastic Gradient Optimization Techniques참고 문헌 76인용 수 6
한 줄 요약

이 논문은 딥 네ural 네트워크에서 확률적 경사 하강법(SGD)에 대한 헤시안 기반 분석을 제시하며, 이차 정보를 통해 최적화 역학과 일반화를 연결한다. 임계값을 적용한 헤시안 기반 가우시안 사후분포를 사용하여 척도 불변 일반화 경계를 도입하여, 곡률과 초기화 이후 매개변수 이동이 함께 일반화를 결정함을 보이며, 레이블 노이즈가 다양하게 설정된 MNIST 및 CIFAR-10에서 실험적 검증을 수행한다.

ABSTRACT

While stochastic gradient descent (SGD) and variants have been surprisingly successful for training deep nets, several aspects of the optimization dynamics and generalization are still not well understood. In this paper, we present new empirical observations and theoretical results on both the optimization dynamics and generalization behavior of SGD for deep nets based on the Hessian of the training loss and associated quantities. We consider three specific research questions: (1) what is the relationship between the Hessian of the loss and the second moment of stochastic gradients (SGs)? (2) how can we characterize the stochastic optimization dynamics of SGD with fixed and adaptive step sizes and diagonal pre-conditioning based on the first and second moments of SGs? and (3) how can we characterize a scale-invariant generalization bound of deep nets based on the Hessian of the loss, which by itself is not scale invariant? We shed light on these three questions using theoretical results supported by extensive empirical observations, with experiments on synthetic data, MNIST, and CIFAR-10, with different batch sizes, and with different difficulty levels by synthetically adding random labels.

연구 동기 및 목표

  • 딥 네트워크에서 훈련 손실의 헤시안과 확률적 경사하강법(SGs)의 두 번째 모멘트 사이의 관계를 이해한다.
  • 고정 및 적응형 스텝 사이즈, 대각 행렬 전치를 사용한 SGD의 스토케스틱 최적화 역학을 마팅게일 차분 수열을 이용해 특성화한다.
  • 헤시안의 최소점에서 유도된 정밀도 행렬을 활용하여 척도 불변 일반화 경계를 개발한다.
  • 데이터 난이도가 증가함에 따라(예: 무작위 레이블) 일반화 오차가 손실 곡률과 초기화 이후 매개변수 이동과 어떻게 관련되는지 조사한다.

제안 방법

  • 손실, 경사, 헤시안 역학의 전체 분포를 경험적으로 특성화하기 위해 10,000개의 독립적인 SGD 훈련 실행을 수행한다.
  • 헤시안의 최상위 고유공간과 확률적 경사하강법의 두 번째 모멘트 사이의 정렬을 분석하여 SGD가 이차 정보를 암묵적으로 어떻게 사용하는지 평가한다.
  • 마팅게일 차분 수열을 사용하여 SGD 역학을 스토케스틱 과정으로 모델링하고, 대규모 이탈 경계와 수렴 속도를 유도한다.
  • 임계값을 적용한 헤시안에서 유도된 정밀도 행렬을 사용한 비대칭 가우시안 사후분포를 활용한 PAC-베이지안 일반화 경계를 제안한다.
  • 대각 매개변수 재정의 하에 불변성을 증명하여 사후분포와 사전분포 간의 KL 발산이 척도 불변임을 확립한다.
  • 두 가지 척도 불변 항을 정의한다: 임계값을 적용한 헤시안 기반의 유효 곡률과 초기화 이후 매개변수 이동의 가중 페로노르비우스 노름.

실험 결과

연구 질문

  • RQ1딥 네트워크에서 손실의 헤시안은 확률적 경사하강법의 두 번째 모멘트와 어떻게 관련이 있는가?
  • RQ2고정 및 적응형 스텝 사이즈를 사용한 SGD의 스토케스틱 역학은 마팅게일 차분 수열을 통해 이론적으로 어떻게 특성화될 수 있는가?
  • RQ3헤시안이 척도 불변이 아니므로, 손실의 헤시안을 사용하여 척도 불변 일반화 경계를 구성할 수 있는가?
  • RQ4일반화 경계의 구성요소인 곡률과 매개변수 이동은 레이블 노이즈나 문제 난이도가 증가함에 따라 어떻게 변화하는가?

주요 결과

  • 헤시안의 최상위 고유공간과 확률적 경사하강법의 두 번째 모멘트 사이에 훈련 반복 및 데이터셋 간 지속적인 정렬이 관찰되어, SGD가 이차 정보를 암묵적으로 사용하고 있음을 시사한다.
  • 적응형 스텝 사이즈 또는 대각 전치는 SGD 역학을 슈퍼마팅게일로 변환할 수 있으며, 적절한 가정 하에 이론적 수렴 보장을 가능하게 한다.
  • 제안된 일반화 경계는 척도 불변이다: 사후분포와 사전분포 간의 KL 발산은 네트워크의 대각 재정의 하에 변화하지 않는다.
  • 무작위 레이블 설정에서는 유효 곡률과 초기화 이후 매개변수 이동의 가중 페로노르비우스 노름이 모두 증가하며, 이는 높은 일반화 오차와 상관관계가 있다.
  • MNIST 및 CIFAR-10에서의 경험적 결과는 레이블 노이즈가 0%에서 15%로 증가함에 따라 일반화 경계가 더 높은 값으로 이동함을 보이며, 이는 그 예측 능력을 검증한다.
  • 헤시안의 대각 성분은 레이블 노이즈가 증가함에 따라 증가하며, 이는 더 높은 국소 곡률을 나타내며, 일반화 경계의 첫 번째 항에 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.