Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Theoretical Understanding of Large Batch Training in Stochastic Gradient Descent

Xiaowu Dai, Yuhua Zhu|arXiv (Cornell University)|2018. 12. 03.
Stochastic Gradient Optimization Techniques참고 문헌 4인용 수 8
한 줄 요약

이 논문은 유한 시간 내 탈출 시간과 점 渐진 수렴 행동을 분석하여, 대용량 배치 SGD가 날카로운 최소값으로 수렴하는 가설에 대한 이론적 근거를 제공한다. 이는 배치 크기와 관계없이 SGD가 더 평평한 최소값으로 수렴함을 증명하며, 학습률 대 배치 크기 비율이 높을수록 수렴 속도가 증가하지만 일반화 성능에 악영향을 줄 수 있음을 밝힌다.

ABSTRACT

Stochastic gradient descent (SGD) is almost ubiquitously used for training non-convex optimization tasks. Recently, a hypothesis proposed by Keskar et al. [2017] that large batch methods tend to converge to sharp minimizers has received increasing attention. We theoretically justify this hypothesis by providing new properties of SGD in both finite-time and asymptotic regimes. In particular, we give an explicit escaping time of SGD from a local minimum in the finite-time regime and prove that SGD tends to converge to flatter minima in the asymptotic regime (although may take exponential time to converge) regardless of the batch size. We also find that SGD with a larger ratio of learning rate to batch size tends to converge to a flat minimum faster, however, its generalization performance could be worse than the SGD with a smaller ratio of learning rate to batch size. We include numerical experiments to corroborate these theoretical findings.

연구 동기 및 목표

  • Keskar 등(2017)이 제안한 바와 같이 대용량 배치 SGD가 날카로운 최소값으로 수렴한다는 가설에 대한 이론적 근거를 제공하는 것.
  • 로컬 최소값에서의 SGD 유한 시간 탈출 행동을 분석하여 수렴 동역학을 이해하는 것.
  • 배치 크기와 무관하게 최소값의 평탄함 측면에서 SGD의 점 渐진 수렴 성질을 조사하는 것.
  • 학습률 대 배치 크기 비율이 평탄한 최소값으로의 수렴 속도와 일반화 성능에 미치는 영향을 분석하는 것.
  • SGD 하이퍼파rameter와 최소값의 평탄함 사이의 관계에 대한 이론적 및 실험적 근거를 제공하는 것.

제안 방법

  • 미니배치 SGD를 기울기 추정치로부터 유도된 이동항과 확산항을 가진 확률적 미분방정식(SDE)의 이산화로 모델링한다.
  • Euler 스킴을 사용하여 SDE를 표준 SGD 업데이트 규칙과 연결함으로써 확산 과정을 통한 이론적 분석을 가능하게 한다.
  • 대규모 탈리드 이론과 Freidlin-Wentzell 이론을 적용하여 로컬 최소값에서 가장 가까운 이웃 최소값으로의 탈출 시간을 유도한다.
  • SGD의 점근적 정적 분포를 유도하여 평탄한 최소값이 점점 더 선호됨을 보여준다.
  • 각 최소값으로 수렴할 확률을 정량화하기 위해 헤시안 행렬의 행렬식과 고유값을 포함한 확률 표현식을 도입한다.
  • 다중 최소값을 가진 합성 손실 함수를 사용하여 $M/\gamma$, 헤시안, 분산의 역할에 대한 이론적 예측을 검증하는 수치적 예시를 수행한다.

실험 결과

연구 질문

  • RQ1대용량 배치 SGD는 실제로 날카로운 최소값으로 수렴하는가, 그리고 이는 이론적으로 정당화될 수 있는가?
  • RQ2SGD의 로컬 최소값에서의 유한 시간 탈출 시간은 배치 크기와 학습률에 어떻게 의존하는가?
  • RQ3점 渐진적으로 볼 때 SGD의 최소값 평탄함 측면에서의 행동은 어떠한가, 그리고 이는 배치 크기와 무관하게 평탄한 최소값을 선호하는가?
  • RQ4학습률 대 배치 크기 비율은 평탄한 최소값으로의 수렴 속도에 어떻게 영향을 주는가?
  • RQ5다양한 $\gamma/M$ 비율에서 평탄한 최소값으로의 수렴 속도와 일반화 성능 사이의 상충 관계는 어떠한가?

주요 결과

  • SGD는 로컬 최소값에서 가장 가까운 이웃 최소값으로의 탈출 시간이 유한하며, 이 시간은 학습률 대 배치 크기 비율이 클수록 감소한다.
  • 점 渐진적 영역에서 SGD는 배치 크기와 관계없이 평탄한 최소값으로 수렴하지만, 수렴에 지수적 시간이 소요될 수 있다.
  • 학습률 대 배치 크기 비율이 클수록 평탄한 최소값으로의 수렴 속도가 증가하지만, 이는 일반화 성능을 악화시킬 수 있다.
  • 최소값으로 수렴할 확률은 해당 최소값에서 헤시안 행렬의 고유값의 곱에 비례하며, 합이나 극값 고유값과는 비례하지 않는다.
  • 기울기 추정치의 분산이 증가하면 $M/\gamma$ 비율이 평탄한 최소값을 선호하는 데서 효과가 감소한다.
  • 수치 실험 결과, $M/\gamma$가 증가할수록 평탄한 최소값으로의 수렴 확률이 날카로운 최소값으로의 수렴 확률보다 더 빠르게 증가하는 것으로 확인되었으며, 특히 최소값 간의 헤시안 비율이 증가할수록 이 경향이 뚜렷하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.