Skip to main content
QUICK REVIEW

[논문 리뷰] Closing the convergence gap of SGD without replacement

Shashank Rajput, Anant Gupta|arXiv (Cornell University)|2020. 02. 24.
Stochastic Gradient Optimization Techniques인용 수 10
한 줄 요약

이 논문은 강凸(quadratic) 함수에 대해 최적의 수렴 속도 $\mathcal{O}\left(\frac{1}{T^2} + \frac{n^2}{T^3}\right)$ 를 증명함으로써, 무작위로 선택된 샘플을 사용하지 않는 확률적 경사 하강법(SGDo)의 이론적 수렴 갭을 해결한다. 이는 알려진 최상의 하한값과 일치한다. 또한 일반적인 미분 가능하고 강凸인 함수에 대해 $\Omega\left(\frac{n}{T^2}\right)$ 의 새로운 하한값을 확립하여, SGDo의 수렴 이론에서 오랫동안 미해결되었던 불확실성을 해소한다.

ABSTRACT

Stochastic gradient descent without replacement sampling is widely used in practice for model training. However, the vast majority of SGD analyses assumes data is sampled with replacement, and when the function minimized is strongly convex, an $\mathcal{O}\left(\frac{1}{T} ight)$ rate can be established when SGD is run for $T$ iterations. A recent line of breakthrough works on SGD without replacement (SGDo) established an $\mathcal{O}\left(\frac{n}{T^2} ight)$ convergence rate when the function minimized is strongly convex and is a sum of $n$ smooth functions, and an $\mathcal{O}\left(\frac{1}{T^2}+\frac{n^3}{T^3} ight)$ rate for sums of quadratics. On the other hand, the tightest known lower bound postulates an $Ω\left(\frac{1}{T^2}+\frac{n^2}{T^3} ight)$ rate, leaving open the possibility of better SGDo convergence rates in the general case. In this paper, we close this gap and show that SGD without replacement achieves a rate of $\mathcal{O}\left(\frac{1}{T^2}+\frac{n^2}{T^3} ight)$ when the sum of the functions is a quadratic, and offer a new lower bound of $Ω\left(\frac{n}{T^2} ight)$ for strongly convex functions that are sums of smooth functions.

연구 동기 및 목표

  • 강凸 설정에서 무작위로 선택된 샘플을 사용하지 않는 확률적 경사 하강법(SGDo)의 상한과 하한 사이의 이론적 수렴 갭을 해소하기 위해.
  • 목적이 다항식의 합 또는 부드러운 함수일 경우 SGDo의 수렴 속도에 대해 날카운 상한과 하한을 확립하기 위해.
  • 기존 SGDo의 상한이 느슨한지 또는 정보 이론적으로 최적인지 여부를 밝혀내기 위해.
  • 부드러운 성분들의 합으로 이루어진 강凸 함수에 대해 $\Omega\left(\frac{n}{T^2}\right)$ 의 새로운 하한값을 제공하기 위해.

제안 방법

  • 강凸성, 미분 가능성, 유계 기울기 등의 표준 가정 하에 SGDo 수렴을 분석한다.
  • 집중 및 마틴갈레 이론을 활용하여 다항식 목적이 있는 경우 $\mathcal{O}\left(\frac{1}{T^2} + \frac{n^2}{T^3}\right)$ 의 상한을 유도한다.
  • 이전 연구에서 유래한 1차원 함수를 기반으로 한 새로운 하한 예시를 구성하며, 이를 2차원으로 확장하여 최악의 경우 행동을 보여준다.
  • 각 좌표가 SGDo 하에 독립적으로 진화하는 2차원 구성 방식을 사용하여, 각 차원의 수렴을 별도로 분석할 수 있도록 한다.
  • 조건부 기대값과 尾確率(꼬리 확률) 경계를 적용하여 반복값의 이탈을 통제하고 오차 하한을 도출한다.
  • 이전 연구 결과(예: HaoChen & Sra, Nagaraj 등)와 새로운 기술적 보조정리를 조합하여 경계를 더욱 날카롭게 한다.

실험 결과

연구 질문

  • RQ1SGDo가 다항식에 대해 $\tilde{\mathcal{O}}\left(\frac{1}{T^2} + \frac{n^3}{T^3}\right)$ 의 상한을 가지는 것은 날카로운가, 아니면 향상될 수 있는가?
  • RQ2부드러운 성분들의 합으로 이루어진 강凸 함수에 대해 SGDo의 정보 이론적으로 최적의 수렴 속도는 무엇인가?
  • RQ3일반적인 부드러운 강凸 함수 설정에서 SGDo에 대해 알려진 최상의 상한과 일치하는 하한을 확립할 수 있는가?
  • RQ4SGDo가 SGD와 비교해 실제로 더 뛰어난 성능을 보이는 것은 수렴 속도 측면에서 이론적으로 타당한가?

주요 결과

  • 논문은 다항식의 합일 경우 SGDo에 대해 $\mathcal{O}\left(\frac{1}{T^2} + \frac{n^2}{T^3}\right)$ 의 날카운 상한을 확립하여 기존 알려진 하한과의 격차를 메운다.
  • 부드러운 성분들의 합으로 이루어진 강凸 함수에 대해 $\Omega\left(\frac{n}{T^2}\right)$ 의 새로운 하한값을 증명하였으며, 이는 이 클래스에서 알려진 최상의 상한과 일치한다.
  • 다항식의 경우 상한이 이전 최고 성능 $\tilde{\mathcal{O}}\left(\frac{1}{T^2} + \frac{n^3}{T^3}\right)$ 에 비해 $n^3$ 항을 $n^2$ 으로 줄여 향상되었다.
  • 결과적으로 SGDo는 다항식 및 일반적인 부드러운 강凸 설정 모두에서 정보 이론적으로 최적의 수렴 속도를 달성함을 보여준다.
  • 분석 결과는 SGDo가 SGD와 비교해 실제로 더 뛰어난 수렴 성능을 보이는 것이 수렴 속도 측면에서 이론적으로 타당하다는 것을 확인한다.
  • 하한 증명에서 사용된 구성은 이전 연구의 1차원 함수를 2차원으로 확장한 것으로, 적어도 한 좌표는 오차 $\Omega\left(\frac{G^2 n}{T^2}\right)$ 를 겪어야 함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.