Skip to main content
QUICK REVIEW

[논문 리뷰] How Good is SGD with Random Shuffling?

Itay Safran, Ohad Shamir|arXiv (Cornell University)|2019. 07. 31.
Stochastic Gradient Optimization Techniques참고 문헌 15인용 수 5
한 줄 요약

이 논문은 유한합, 미분 가능하고 강凸인 문제에서 무작위 셔플링을 사용하는 확률적 경사 하강법(SGD)의 최적화 오차에 대해 처음으로 날카운 하한을 제시한다. 반복적인 무작위 재정렬이 단일 셔플링($\Omega(1/(nk^2))$)보다 더 빠른 수렴 속도 $\Omega(1/(nk)^2 + 1/(nk^3))$를 달성함을 증명하여, 일정한 스텝 사이즈 하에서 두 전략 간의 본질적 성능 격차를 입증한다.

ABSTRACT

We study the performance of stochastic gradient descent (SGD) on smooth and strongly-convex finite-sum optimization problems. In contrast to the majority of existing theoretical works, which assume that individual functions are sampled with replacement, we focus here on popular but poorly-understood heuristics, which involve going over random permutations of the individual functions. This setting has been investigated in several recent works, but the optimal error rates remain unclear. In this paper, we provide lower bounds on the expected optimization error with these heuristics (using SGD with any constant step size), which elucidate their advantages and disadvantages. In particular, we prove that after $k$ passes over $n$ individual functions, if the functions are re-shuffled after every pass, the best possible optimization error for SGD is at least $Ω\left(1/(nk)^2+1/nk^3 ight)$, which partially corresponds to recently derived upper bounds. Moreover, if the functions are only shuffled once, then the lower bound increases to $Ω(1/nk^2)$. Since there are strictly smaller upper bounds for repeated reshuffling, this proves an inherent performance gap between SGD with single shuffling and repeated shuffling. As a more minor contribution, we also provide a non-asymptotic $Ω(1/k^2)$ lower bound (independent of $n$) for the incremental gradient method, when no random shuffling takes place. Finally, we provide an indication that our lower bounds are tight, by proving matching upper bounds for univariate quadratic functions.

연구 동기 및 목표

  • 유한합 최적화에서 무작위 셔플링을 사용하는 SGD의 이론적 성능 한계를 이해하는 것.
  • 반복적인 무작위 재정렬이 단일 셔플링 또는 고정 순서의 증분 방법보다 증명 가능한 이점을 제공하는지 여부라는 열린 문제를 해결하는 것.
  • 다양한 셔플링 전략 하에서 일정 스텝 사이즈 SGD의 최적화 오차에 대한 날카운 하한을 수립하는 것.
  • 기존 상한이 최적임을 입증하기 위해 단변수 이차 함수에 대해 일치하는 하한을 도출하는 것.

제안 방법

  • 반복적인 무작위 재정렬, 단일 셔플링, 증분 경사 방법에 대해 기대 최적화 오차의 하한을 유도한다.
  • 기존 상한과 일치하는 날카운 하한을 구성하기 위해 단변수 이차 함수 모델을 사용한다.
  • 수축 계수의 곱을 bound하기 위해 농도 불등식과 AM-GM 부등식을 적용한다.
  • 재귀적 기대값 bound를 사용하여 $k$번의 반복 동안 오차 전파를 분석하고, 재정렬된 반복 간의 독립성을 활용한다.
  • 무작위 셔플링 없이도 비점근적 $\Omega(1/k^2)$ 하한을 증명한 증분 경사 방법에 대해 제시한다.
  • 분석에서 수렴과 오차 항을 균형 잡기 위해 스텝 사이즈 $\eta = \frac{\log(n^{0.5}k)}{\lambda n k}$를 사용한다.

실험 결과

연구 질문

  • RQ1무작위 셔플링을 사용하는 SGD가 매끄럽고 강凸인 유한합 문제에서 최적화 가능한 오차 속도는 무엇인가?
  • RQ2반복적인 무작위 재정렬이 단일 셔플링 또는 고정 순서의 증분 방법보다 증명 가능한 이점을 제공하는가?
  • RQ3다양한 셔플링 방식 하에서 일정 스텝 사이즈 SGD의 최적화 오차에 대한 근본적인 하한은 무엇인가?
  • RQ4기존 반복 재정렬에 대한 상한이 날카로운가, 아니면 향상시킬 수 있는가?
  • RQ5무작위 셔플링가 없는 경우 증분 경사 방법의 수렴 속도에 어떤 영향을 미치는가?

주요 결과

  • 반복적인 무작위 재정렬을 사용하는 SGD의 기대 최적화 오차는 최소 $\Omega(1/(nk)^2 + 1/(nk^3))$이며, 이는 기존 상한과 일치한다.
  • 단일 셔플링의 경우 하한은 $\Omega(1/(nk^2))$이며, 이는 반복 재정렬의 경우보다 엄격히 열등하다.
  • 이것은 반복적 및 단일 셔플링 간의 본질적 성능 격차를 입증하며, 반복 재정렬이 이론적으로 열등함을 보여준다.
  • 무작위 셔플링가 없는 증분 경사 방법에 대해 비점근적 $\Omega(1/k^2)$ 하한이 확립되었으며, 이는 $n$과 무관하다.
  • 단변수 이차 함수에 대해 하한이 상한과 일치하여 분석의 날카로움을 확인한다.
  • 분석은 반복 재정렬 하에서 도달 가능한 최선의 오차 속도가 $\tilde{\mathcal{O}}(1/(nk)^2 + 1/(nk^3))$를 초과할 수 없으며, 이 하한이 날카로움을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.