Skip to main content
QUICK REVIEW

[논문 리뷰] New Convergence Aspects of Stochastic Gradient Algorithms

Lam M. Nguyen, Phuong Ha Nguyen|arXiv (Cornell University)|2018. 11. 10.
Stochastic Gradient Optimization Techniques참고 문헌 20인용 수 11
한 줄 요약

이 논문은 강하게 볼록 목적 함수의 맥락에서 확률적 경사 하강법(SGD)과 Hogwild!에 대한 새로운 수렴 분석을 제안한다. 기존의 균일한 유계 확률적 경사의 가정을 제거함으로써, 진정한 경사에 대한 경사 노름에 기반한 점진적 감소하는 학습률을 사용함으로써 더 넓은 조건 하에서 수렴을 증명한다. 이는 유계 경사 가정이 필요 없는 상태에서 SGD의 최신 수렴 영역을 확장한다.

ABSTRACT

The classical convergence analysis of SGD is carried out under the assumption that the norm of the stochastic gradient is uniformly bounded. While this might hold for some loss functions, it is violated for cases where the objective function is strongly convex. In Bottou et al. (2018), a new analysis of convergence of SGD is performed under the assumption that stochastic gradients are bounded with respect to the true gradient norm. We show that for stochastic problems arising in machine learning such bound always holds; and we also propose an alternative convergence analysis of SGD with diminishing learning rate regime. We then move on to the asynchronous parallel setting, and prove convergence of Hogwild! algorithm in the same regime in the case of diminished learning rate. It is well-known that SGD converges if a sequence of learning rates $\{η_t\}$ satisfies $\sum_{t=0}^\infty η_t ightarrow \infty$ and $\sum_{t=0}^\infty η^2_t < \infty$. We show the convergence of SGD for strongly convex objective function without using bounded gradient assumption when $\{η_t\}$ is a diminishing sequence and $\sum_{t=0}^\infty η_t ightarrow \infty$. In other words, we extend the current state-of-the-art class of learning rates satisfying the convergence of SGD.

연구 동기 및 목표

  • 기존의 SGD 수렴 분석에서 균일한 유계 확률적 경사 가정을 필요로 하는 한계를 해결하기 위해.
  • 확률적 경사가 진짜 경사의 노름에 상대적으로 유계일 때, 더 약한 더 현실적인 경사 유계 조건 하에서 SGD의 수렴을 확립하기 위해.
  • 동일한 완화된 가정과 점진적 감소하는 학습률 하에서 이성적(Hogwild!) 알고리즘의 수렴 결과를 확장하기 위해.
  • 기존의 균일한 유계성 가정 없이도 강하게 볼凸 목적 함수에 대해 SGD의 수렴을 증명하기 위해, 단지 ∑ηₜ = ∞를 만족하는 감소하는 스텝 사이즈만을 사용하기 위해.
  • 기존의 ∑ηₜ = ∞ 및 ∑ηₜ² < ∞ 조건을 초월하여, 수렴을 보장하는 학습률 수열의 클래스를 일반화하기 위해.

제안 방법

  • 기존의 경사 노름 가정을 대체할 새로운 가정을 도입: E[‖∇f(w;ξ)‖²] ≤ 4L(F(w)−F(w*)) + N/kₜ. 이는 강하게 볼凸 목적 함수를 가진 머신 러닝 문제에서 자연스럽게 성립한다.
  • 최적 해에 대한 기대 제곱 거리 E[‖wₜ₊₁−w*‖²]를 분석하기 위해 리아푸노프 함수 접근법을 사용한다.
  • ηₜ ≤ 1/(2LD) 조건 하에서 재귀 부등식을 유도: E[‖wₜ₊₁−w*‖²] ≤ (1−μηₜ)E[‖wₜ−w*‖²] + ηₜ²(ND/kₜ).
  • 적분 변환을 통한 연속 시간 근사 기법을 적용하여, M(t) = ∫₀ᵗ μn(x)dx 및 K(t) = ∫₁ᵗ k(x)dx를 정의함으로써 잔차 항의 수렴을 분석한다.
  • 변수 치환 및 대체(x = K⁻¹(y))를 통해 이산 재귀를 D.6 절의 결과로 분석 가능한 형태로 변환하여 잔차 항의 수렴을 증명한다.
  • ∑ηₜ = ∞ 및 ηₜ ≤ 1/(2LD) 조건 하에서 잔차 항 C(t) → 0 (t → ∞)임을 보여, 반복값 wₜ가 w*로 수렴함을 확립한다.

실험 결과

연구 질문

  • RQ1강하게 볼凸 목적 함수에서 균일한 유계 확률적 경사 가정 없이도 SGD가 수렴할 수 있는가?
  • RQ2확률적 경사가 진짜 경사의 노름에 따라 유계일 때, 즉 상대적 경사 유계 조건이 성립할 경우에도 SGD 수렴이 유지되는가?
  • RQ3동일한 완화된 경사 가정 하에서 이성적(Hogwild!) 알고리즘의 수렴 분석을 확장할 수 있는가?
  • RQ4고전적인 유계 경사 가정이 제거된 상황에서 어떤 종류의 감소하는 학습률이 SGD의 수렴을 보장하는가?
  • RQ5기존의 ∑ηₜ = ∞ 및 ∑ηₜ² < ∞ 조건을 초월하여 수렴 증명을 일반화할 수 있는가?

주요 결과

  • 논문은 강하게 볼凸 목적 함수를 가진 머신 러닝 문제에서 자연스럽게 성립하는 조건 하에, 확률적 경사가 진짜 경사의 노름에 상대적으로 유계일 때 SGD가 최적 해 w*로 수렴함을 증명한다.
  • ∑ₜ₌₀^∞ ηₜ = ∞ 및 ηₜ ≤ 1/(2LD) 조건을 만족하는 임의의 감소하는 학습률 수열 {ηₜ}에 대해, 고전적인 균일한 유계 경사 가정 없이도 수렴이 보장됨을 입증한다.
  • 분석은 이성적(Hogwild!) 알고리즘으로까지 확장되어, 동일한 학습률 및 경사 유계 조건 하에서 그 수렴이 입증된다.
  • 저자들은 고전적인 경사 유계 가정이 강하게 볼凸 설정에서 수렴을 위해 필수적인 것이 아니라고 보여주며, SGD의 이론적 기반을 넓혔다.
  • 수렴 경계의 잔차 항 C(t)는 t → ∞ 일 때 0으로 수렴함을 보여, 최적 해에 대한 기대 거리가 0으로 수렴함을 의미한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.