Skip to main content
QUICK REVIEW

[논문 리뷰] SGD without Replacement: Sharper Rates for General Smooth Convex Functions

Prateek Jain, Nagaraj, Dheeraj|arXiv (Cornell University)|2019. 03. 04.
Stochastic Gradient Optimization Techniques참고 문헌 15인용 수 10
한 줄 요약

이 논문은 일반적인 미분 가능하고 강凸인 함수에 대해, 교환 가능한 쌍을 사용하여 워샤우스테인 거리의 상한을 구함으로써, 무작위로 선택한 경사하강법(SGD without replacement, SGDo)에 대한 최초의 비점근 수렴 분석을 제공한다. 표준적인 미분 가능성과 강凸성 조건 하에서, 헤시안 행렬의 리프시츠 조건을 요구하지 않고도 $\widetilde{O}(1/nK^2)$ 수렴 속도를 확립한다. 이는 기존 SGD의 $O(1/nK)$ 수렴 속도보다 더 빠르다.

ABSTRACT

We study stochastic gradient descent {\em without replacement} (\sgdwor) for smooth convex functions. \sgdwor is widely observed to converge faster than true \sgd where each sample is drawn independently {\em with replacement} \cite{bottou2009curiously} and hence, is more popular in practice. But it's convergence properties are not well understood as sampling without replacement leads to coupling between iterates and gradients. By using method of exchangeable pairs to bound Wasserstein distance, we provide the first non-asymptotic results for \sgdwor when applied to {\em general smooth, strongly-convex} functions. In particular, we show that \sgdwor converges at a rate of $O(1/K^2)$ while \sgd is known to converge at $O(1/K)$ rate, where $K$ denotes the number of passes over data and is required to be {\em large enough}. Existing results for \sgdwor in this setting require additional {\em Hessian Lipschitz assumption} \cite{gurbuzbalaban2015random,haochen2018random}. For {\em small} $K$, we show \sgdwor can achieve same convergence rate as \sgd for {\em general smooth strongly-convex} functions. Existing results in this setting require $K=1$ and hold only for generalized linear models \cite{shamir2016without}. In addition, by careful analysis of the coupling, for both large and small $K$, we obtain better dependence on problem dependent parameters like condition number.

연구 동기 및 목표

  • 실제로 사용되는 SGDo와 이론적으로 분석된 경사하강법(with replacement) 간의 이론적 격차를 해소하고자 하며, 후자의 수렴 속도가 더 느리다는 점을 고려한다.
  • 표준 조건인 미분 가능성, 강凸성, 기울기 리프시츠 조건 하에서 SGDo에 대해 더 날카운 비점근 수렴 속도를 확립하고자 한다.
  • 이전 연구에서 요구한 추가적인 헤시안 리프시츠 조건이나 일반선형 모델 또는 $K=1$에 국한된 결과를 초월하고자 한다.
  • 큰 $K$와 작은 $K$의 두 경우를 모두 분석하여, 반복 횟수에 따라 SGDo가 SGD의 수렴 속도를 따라하거나 뛰어넘는다는 것을 보여주고자 한다.
  • 샘플링 시 무작위로 선택하는 방식이 유도하는 의존성을 다룰 수 있는 최적 운반 이론(교환 가능한 쌍)을 활용한 커플링 기법을 개발하고자 한다.

제안 방법

  • SGDo의 반복값과 SGD의 반복값 간의 워샤우스테인 거리를 상한으로 제시하기 위해 교환 가능한 쌍의 방법을 사용한다. 이를 통해 두 알고리즘의 수렴 행동을 비교할 수 있다.
  • 수렴 속도 향상과 분산 감소를 위해 마지막 $K/2$번의 반복에 대해 후행 평균화 기법을 적용한다.
  • 강凸성과 미분 가능성 성질을 활용하여 최적 해와의 제곱 거리 $\mathbb{E}[\|x_k - x^*\|^2]$에 대한 재귀적 상한을 유도한다.
  • 편향과 분산을 균형 있게 조절하기 위해 단계 크기 $\alpha = \Theta(\log(nK)/(\mu nK))$를 사용한다.
  • 무작위로 선택하는 방식이 유도하는 기울기와 반복값 간의 커플링을 분석한다. 이는 표준 SGD에서는 존재하지 않는 의존성을 포함한다.
  • 볼록성과 기울기 리프시츠 조건을 활용하여 문제에 따라 달라지는 매개변수(예: 조건수 $\kappa$)에 따라 부적합도 $\mathbb{E}[F(x) - F(x^*)]$를 상한으로 제시한다.

실험 결과

연구 질문

  • RQ1SGDo는 헤시안 리프시츠 연속성 조건 없이도 일반적인 미분 가능하고 강凸인 함수에 대해 SGD보다 더 빠른 수렴 속도를 달성할 수 있는가?
  • RQ2반복 횟수 $K$가 작을 경우(예: $K \lesssim n$) SGDo의 비점근 수렴 속도는 어떻게 되는가?
  • RQ3SGDo의 성능은 조건수 $\kappa$에 대해 SGD와 비교해 어떻게 되는가?
  • RQ4무작위로 선택하는 방식이 유도하는 커플링을 공식적으로 상한으로 제시하여 수렴 분석을 가능하게 할 수 있는가?
  • RQ5SGDo는 일반적인 미분 가능하고 강凸인 함수에 대해 $O(1/K^2)$ 수렴 속도를 달성할 수 있는가? 이는 경험적 관찰과 일치하는가?

주요 결과

  • SGDo는 일반적인 미분 가능하고 강凸인 함수에 대해 $\widetilde{O}(1/nK^2)$ 수렴 속도를 달성한다. 이는 SGD의 $O(1/nK)$ 수렴 속도보다 더 빠르다.
  • 이 결과는 헤시안 리프시츠 조건을 요구하지 않는 표준 조건인 미분 가능성, 강凸성, 기울기 리프시츠 조건 하에서도 성립한다.
  • $K \gtrsim \kappa^2 \log(nK)$일 경우 SGDo의 수렴 속도는 SGD를 초월한다. 이는 이전 연구에서 $K \gtrsim \kappa^{1.5} \sqrt{n}$이 필요로 했던 것과 대비된다.
  • 작은 $K$의 경우 SGDo는 SGD와 동일한 $O(1/nK)$ 수렴 속도를 달성한다. 이는 일반적인 미분 가능하고 강凸인 함수에 대해 최초의 결과이며, 이전에는 일반선형 모델에서만 알려져 있었다.
  • 분석을 통해 조건수 $\kappa$에 대한 의존성이 향상되었으며, 부적합도는 $O(\kappa^2 G^2 (\log(nK))^2 / (nK^2))$로 상한이 제시된다.
  • 교환 가능한 쌍과 워샤우스테인 거리의 사용은 의존적인 기울기를 가진 SGDo의 더 빠른 수렴을 체계적으로 분석할 수 있도록 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.