Skip to main content
QUICK REVIEW

[논문 리뷰] Understanding Gradient Descent on Edge of Stability in Deep Learning

Sanjeev Arora, Zhiyuan Li|arXiv (Cornell University)|2022. 05. 19.
Stochastic Gradient Optimization Techniques인용 수 4
한 줄 요약

이 논문은 딥러닝에서 경계의 안정성(EoS)에 대한 경사하강법의 수학적 분석을 제공하며, 비연속 손실 곡면과 적응형 학습률이 영제 손실 다양체 위에서 결정론적 흐름을 유도함을 보여준다. 비연속성과 적응형 학습률 조건 하에서 영제 손실 다양체 위의 결정론적 흐름을 통한 암묵적 정규화를 통해, 두 경우인 정규화된 경사하강법과 √L 위의 경사하강법이 모두 EoS 단계에 진입함을 증명한다. 이 단계에서는 날카움이 2/η 근처에서 안정화되며, 손실은 비단조적 진동에도 불구하고 전체적으로 감소한다. 이는 더 평탄한 최소점으로 향하는 암묵적 정규화의 결과이다.

ABSTRACT

Deep learning experiments by Cohen et al. [2021] using deterministic Gradient Descent (GD) revealed an Edge of Stability (EoS) phase when learning rate (LR) and sharpness (i.e., the largest eigenvalue of Hessian) no longer behave as in traditional optimization. Sharpness stabilizes around $2/$LR and loss goes up and down across iterations, yet still with an overall downward trend. The current paper mathematically analyzes a new mechanism of implicit regularization in the EoS phase, whereby GD updates due to non-smooth loss landscape turn out to evolve along some deterministic flow on the manifold of minimum loss. This is in contrast to many previous results about implicit bias either relying on infinitesimal updates or noise in gradient. Formally, for any smooth function $L$ with certain regularity condition, this effect is demonstrated for (1) Normalized GD, i.e., GD with a varying LR $η_t =\fracη{\| abla L(x(t)) \|}$ and loss $L$; (2) GD with constant LR and loss $\sqrt{L- \min_x L(x)}$. Both provably enter the Edge of Stability, with the associated flow on the manifold minimizing $λ_{1}( abla^2 L)$. The above theoretical results have been corroborated by an experimental study.

연구 동기 및 목표

  • 유한한 학습률을 사용할 때도 손실 감소를 지속하는 경향을 보이는 딥러닝 학습에서 관찰된 경계의 안정성(EoS) 현상에 대한 설명.
  • 전통적인 매끄러움 가정을 넘어서, 유한한 학습률 하에서 손실 감소를 보장하는 조건으로서의 안정성(stableness)을 공식화.
  • EoS 행동을 확실히 이끌어내는 두 가지 메커니즘—비연속 손실 함수와 적응형 학습률—을 규명하고 엄밀히 분석.
  • √L 위의 경사하강법과 정규화된 GD가 모두 λ₁(∇²L)를 최소화하는 결정론적 흐름을 따라 움직이며 더 평탄한 최소점으로 향함을 보여줌.

제안 방법

  • 비연속 설정으로 일반화된 표준 내림함수 보조정리(Descent Lemma)를 위한 형식적 정의인 안정성 S_L(x,η) = η·sup₀≤s≤η λ₁(∇²L(x−s∇L(x))) ≤ 2 를 도입.
  • L가 매끄럽고 min L(x) = 0인 경우 √L 위의 경사하강법을 분석하며, 최소점 근처에서 ∇²√L가 발산함으로써 EoS 행동이 유도됨을 보여줌.
  • 정규화된 경사하강법을 적응형 학습률 η_t = η / ||∇L(x(t))|| 를 가진 GD로 간주하여 분석함. 최소점 근처에서 학습률이 커지며 EoS에 확실히 진입함을 증명.
  • 영제 손실 다양체 Γ = {x | L(x) = 0} 위에 대한 극한 리만 다양체 흐름을 유도하며, 업데이트가 λ₁(∇²L)의 최대 고유값을 최소화하도록 움직임을 보임.
  • 최상위 헤시안 고유벡터 v₁(x)를 계산하기 위해 거듭제곱 반복법을 사용하고, 다양체의 탄성공간 위로 기울기를 투영하여 극한 흐름을 시뮬레이션.
  • 합성 및 분류 작업에서의 시뮬레이션을 통해 이론적 결과를 실증적으로 검증하며, 손실, 날카움, 흐름 역학을 추적함.

실험 결과

연구 질문

  • RQ1유한한 학습률을 사용할 때도 고전적 조건 η < 2/λ를 위반함에도 불구하고 경사하강법이 어떻게 손실 감소를 계속할 수 있는가?
  • RQ2경계의 안정성 단계에서 날카움이 2/η 근처에서 안정화되는 수학적 메커니즘은 무엇인가?
  • RQ3손실 곡면의 비연속성 또는 적응형 학습률이 결정론적 흐름을 유도하여 EoS 행동을 설명할 수 있는가?
  • RQ4√L 위의 경사하강법 또는 정규화된 GD가 확실히 EoS 단계에 진입하고 더 평탄한 최소점으로 향하는가?
  • RQ5영제 손실 다양체 위의 극한 리만 흐름으로 EoS 역학을 기술할 수 있는가?

주요 결과

  • √L 위의 경사하강법은 최소점 근처에서 헤시안 곡률이 발산함에 따라 EoS 단계에 확실히 진입하며, 날카움이 2/η 근처에서 안정화됨.
  • 기울기 노름에 따라 학습률이 적응되는 정규화된 경사하강법은 EoS에 확실히 진입하며, λ₁(∇²L)를 최소화하는 결정론적 흐름을 따라 움직임.
  • 정규화된 GD의 극한 흐름이 영제 손실 다양체 위의 리만 기울기 흐름임을 증명하며, 업데이트가 해집합의 탄성공간 위로 투영됨.
  • 실험 결과, √L과 정규화된 GD의 궤적은 영제 손실 다양체 주변을 진동하면서 서서히 더 평탄한 최소점으로 이동하며, 날카움이 2/η 근처를 유지함.
  • 이론적 분석을 통해 EoS 행동은 조건부로 작은 λ₁(∇²L)를 가진 최소점으로 향하는 암묵적 정규화에 기인함을 보여줌. 이는 무한소가 아닌 유한한 단계에서도 성립함.
  • 특히 비연속 영역에서 손실 감소를 더 잘 예측하는 지표로, S_L(x,η) ≤ 2 조건이 고전적 ηλ₁(∇²L(x)) < 2 보다 더 우수함이 입증됨.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.