Skip to main content
QUICK REVIEW

[논문 리뷰] Random Reshuffling: Simple Analysis with Vast Improvements

Konstantin Mishchenko, Ahmed Khaled|arXiv (Cornell University)|2020. 06. 10.
Stochastic Gradient Optimization Techniques참고 문헌 32인용 수 16
한 줄 요약

이 논문은 유한합 최적화를 위한 랜덤 리셰출(RR)에 대한 정교화된 이론적 분석을 제시하며, 이전 연구에서 요구하던 단계 크기, 기울기 범위, 반복 횟수에 대한 가정을 제거한다. 수렴 속도를 개선하여 조건수 의존성의 차수를 $\kappa^2$에서 $\kappa$ (또는 $\sqrt{\kappa}$)로 낮추며, RR의 경험적 우수성을 설명하는 별도의 분산 구조를 규명하고, Shuffle-Once(SO)의 수렴을 엄밀하게 분석하여 기존 알려진 하한값과 일치시킨다.

ABSTRACT

Random Reshuffling (RR) is an algorithm for minimizing finite-sum functions that utilizes iterative gradient descent steps in conjunction with data reshuffling. Often contrasted with its sibling Stochastic Gradient Descent (SGD), RR is usually faster in practice and enjoys significant popularity in convex and non-convex optimization. The convergence rate of RR has attracted substantial attention recently and, for strongly convex and smooth functions, it was shown to converge faster than SGD if 1) the stepsize is small, 2) the gradients are bounded, and 3) the number of epochs is large. We remove these 3 assumptions, improve the dependence on the condition number from $κ^2$ to $κ$ (resp. from $κ$ to $\sqrtκ$) and, in addition, show that RR has a different type of variance. We argue through theory and experiments that the new variance type gives an additional justification of the superior performance of RR. To go beyond strong convexity, we present several results for non-strongly convex and non-convex objectives. We show that in all cases, our theory improves upon existing literature. Finally, we prove fast convergence of the Shuffle-Once (SO) algorithm, which shuffles the data only once, at the beginning of the optimization process. Our theory for strongly-convex objectives tightly matches the known lower bounds for both RR and SO and substantiates the common practical heuristic of shuffling once or only a few times. As a byproduct of our analysis, we also get new results for the Incremental Gradient algorithm (IG), which does not shuffle the data at all.

연구 동기 및 목표

  • 유한합 최적화에서 랜덤 리셰출(RR)의 더 날카운 이론적 이해를 제공하는 것.
  • 이전 RR 수렴 분석에서 흔히 요구되던 제한적인 가정—작은 단계 크기, 유계 기울기, 많은 반복 횟수—를 제거하는 것.
  • RR가 SGD보다 경험적으로 뛰어난 성능을 보이는 이유를 새로운 분산 구조를 통한 수렴 분석으로 설명하는 것.
  • 강凸성 이론을 초월해 비강凸성 및 비凸성 목표 함수로의 분석 확장을 위한 것.
  • Shuffle-Once(SO) 및 증분 기울기(IG) 알고리즘에 대해 엄밀한 수렴 속도를 확립하여 기존 알려진 하한값과 일치시키는 것.

제안 방법

  • RR에서 발생하는 편향된 기울기를 다룰 수 있도록 Bregman 산란과 재귀적 오차 경계를 활용한 새로운 분석 프레임워크를 개발한다.
  • RR의 수렴 행동이 SGD와 다름을 설명할 수 있는 새로운 분산 분해를 도입하며, 실질적 성능 향상의 이론적 근거를 제공한다.
  • 최소한의 가정 하에 강凸성, 비강凸성, 비凸성 목표 함수에 대해 수렴 속도를 유도하기 위해 프레임워크를 적용한다.
  • 반복 및 반복 주기 간 오차 전파를 제어하기 위해 재귀와 합계 경계를 사용한다.
  • RR에서 사용한 동일한 도구를 활용해 Shuffle-Once(SO)에 대해 엄밀한 수렴 경계를 도출하며, 이가 알려진 하한값과 일치함을 보인다.
  • 동일한 분석을 증분 기울기(IG)에 적용하여 보조적으로 새로운 수렴 결과를 도출한다.

실험 결과

연구 질문

  • RQ1랜덤 리셰출의 수렴을 작은 단계 크기, 유계 기울기, 많은 반복 횟수에 대한 가정 없이 분석할 수 있는가?
  • RQ2RR의 수렴 속도가 조건수 $\kappa$에 대해 진정으로 어떻게 의존하는가? 그리고 이를 향상시킬 수 있는가?
  • RQ3RR는 SGD와 다른 분산 구조를 보이며, 이는 그가 더 빠른 경험적 수렴을 보이는 이유를 설명하는가?
  • RQ4Shuffle-Once(SO)에 대해 엄밀한 수렴 경계를 확립할 수 있는가? 이는 초기화 시 한 번만 셔플링하는 것에 해당한다.
  • RQ5제안된 분석은 비凸성 및 비강凸성 목표 함수로 어떻게 확장되는가?

주요 결과

  • 강凸성 함수에 대해 RR의 수렴 속도는 조건수 의존성의 차수를 $\kappa^2$에서 $\kappa$로 개선한다.
  • 비강凸성 목표 함수에 대해서는 조건수 의존성이 $\kappa$에서 $\sqrt{\kappa}$로 감소한다.
  • 분석을 통해 RR가 특별한 분산 구조를 가지며, 이는 더 빠른 수렴에 기여함을 규명하며, 그 경험적 우수성에 대한 이론적 근거를 제공한다.
  • Shuffle-Once(SO)에 대해 엄밀한 수렴 경계를 확립하였으며, 이는 알려진 하한값과 일치한다. 이는 한 번만 셔플링하는 것이 일반적으로 허용되는 히우리스틱임을 검증한다.
  • 분석은 비凸성 목표 함수로도 적용 가능하며, 이전 연구 대비 향상된 수렴 속도를 도출한다.
  • 증분 기울기(IG)에 대해 새로운 수렴 결과를 도출하였으며, 이는 고정된 순서로 업데이트를 수행하는 알고리즘이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.