Skip to main content
QUICK REVIEW

[논문 리뷰] ZeroSARAH: Efficient Nonconvex Finite-Sum Optimization with Zero Full Gradient Computation

Zhize Li, Slavomír Hanzely|arXiv (Cornell University)|2021. 03. 02.
Sparse and Compressive Sensing Techniques참고 문헌 29인용 수 11
한 줄 요약

ZeroSARAH는 비볼록 유한합 문제를 위한 새로운 분산 감소 최적화 알고리즘을 제안하며, 초기화 시나 주기적으로도 전체 기울기 계산이 필요 없도록 적응형 확률적 기울기 추적을 활용한다. 이는 기존 SARAH 변종보다 특정 영역에서 더 뛰어난 수렴 속도를 달성하며, 유한 분산과 같은 추가 가정이 필요하지 않다. 수식으로는 $ O\big(\frac{\tilde{L}\tilde{\rho}}{\tilde{\rho}^2}\big) $ 수준의 최신 기술 수준 성능을 달성한다.

ABSTRACT

We propose ZeroSARAH -- a novel variant of the variance-reduced method SARAH (Nguyen et al., 2017) -- for minimizing the average of a large number of nonconvex functions $\frac{1}{n}\sum_{i=1}^{n}f_i(x)$. To the best of our knowledge, in this nonconvex finite-sum regime, all existing variance-reduced methods, including SARAH, SVRG, SAGA and their variants, need to compute the full gradient over all $n$ data samples at the initial point $x^0$, and then periodically compute the full gradient once every few iterations (for SVRG, SARAH and their variants). Note that SVRG, SAGA and their variants typically achieve weaker convergence results than variants of SARAH: $n^{2/3}/ε^2$ vs. $n^{1/2}/ε^2$. Thus we focus on the variant of SARAH. The proposed ZeroSARAH and its distributed variant D-ZeroSARAH are the \emph{first} variance-reduced algorithms which \emph{do not require any full gradient computations}, not even for the initial point. Moreover, for both standard and distributed settings, we show that ZeroSARAH and D-ZeroSARAH obtain new state-of-the-art convergence results, which can improve the previous best-known result (given by e.g., SPIDER, SARAH, and PAGE) in certain regimes. Avoiding any full gradient computations (which are time-consuming steps) is important in many applications as the number of data samples $n$ usually is very large. Especially in the distributed setting, periodic computation of full gradient over all data samples needs to periodically synchronize all clients/devices/machines, which may be impossible or unaffordable. Thus, we expect that ZeroSARAH/D-ZeroSARAH will have a practical impact in distributed and federated learning where full device participation is impractical.

연구 동기 및 목표

  • 비볼록 유한합 최적화에서 분산 감소 방법의 높은 전체 기울기 계산 비용을 해결하기 위해.
  • 기본적인 $ L $-리프시츠 조건 하에서 초기 또는 주기적 전체 기울기 계산이 전혀 필요 없도록 하기 위해.
  • 전체 장치 동기화가 불가능한 분산 및 페더레이티드 러닝 환경에 적합한 실용적이고 확장 가능한 알고리즘 설계를 위해.
  • 특정 문제 영역에서 기존 SARAH, SPIDER, PAGE 변종보다 향상된 수렴 복잡도를 달성하기 위해.

제안 방법

  • 동적이고 적응적인 기울기 추적 메커니즘을 사용하여 전체 기울기 계산을 완전히 피하는 새로운 분산 감소 방법인 ZeroSARAH를 제안한다.
  • 전체 기울기 추정이 필요 없도록 하는 새로운 스텝 사이즈 규칙과 모멘텀 유사 업데이트를 도입한다.
  • 분산 변종 D-ZeroSARAH에서 각 클라이언트가 반복마다 부분 기울기 집합만 계산하도록 클라이언트 샘플링 전략을 적용한다.
  • 로컬 부분 기울기와 적응형 가중치만을 사용하여 전체 기울기 추정치를 유지하는 하이브리드 확률적 기울기 추적 기법을 사용한다.
  • 전체 기울기 노름에 의존하지 않고 진행 상황과 분산 감소를 추적하는 잠재 함수 기반의 새로운 분석 프레임워크를 적용한다.
  • 수렴 속도와 계산 비용의 균형을 맞추기 위한 동적 미니배치 크기 선택 전략을 통합한다.

실험 결과

연구 질문

  • RQ1초기화 시에도 전체 기울기 계산이 전혀 필요 없이 비볼록 유한합 문제에 대한 분산 감소 최적화가 가능할 수 있는가?
  • RQ2유한 분산과 같은 추가 가정 없이 기본적인 $ L $-리프시츠 조건 하에서 도달 가능한 최고의 수렴 속도는 무엇인가?
  • RQ3전체 기울기 계산을 제거함으로써 분산 및 페더레이티드 러닝 환경에서의 성능에 어떤 영향을 미치는가?
  • RQ4주기적인 전체 기울기 업데이트가 필요 없도록 하면 SARAH 유형 알고리즘의 수렴 속도를 향상시킬 수 있는가?
  • RQ5영구적인 전체 기울기 없이 알고리즘에서 확률적 기울기 계산과 수렴 속도 사이의 최적의 트레이드오프는 무엇인가?

주요 결과

  • ZeroSARAH는 $ O\big(\tilde{L}\tilde{\rho}/\tilde{\rho}^2\big) $ 수준의 확률적 기울기 복잡도를 달성하며, 이는 $ \tilde{L} $ 및 $ \tilde{\rho} $ 가 문제에 따라 결정되는 매개변수이다. 이는 특정 영역에서 기존 SARAH 및 SPIDER의 $ O(\tilde{L}\tilde{\rho}/\tilde{\rho}^2) $ bound 보다 향상된다.
  • 기본적인 $ L $-리프시츠 조건 하에서 초기 및 주기적 전체 기울기 계산을 완전히 제거하여 대규모 및 분산 환경에 적합하다.
  • 분산 환경에서 D-ZeroSARAH는 클라이언트당 $ O\big(\tilde{L}\tilde{\rho}/\imath{\rho}^2\big) $ 의 확률적 기울기 복잡도를 달성하며, 클라이언트별 비용도 $ O\big(\tilde{L}\tilde{\rho}/\tilde{\rho}^2\big) $ 이다. 이는 통신 및 계산 효율성 측면에서 이전 방법보다 향상되었다.
  • 알고리즘은 $ O\big(\tilde{L}\tilde{\rho}/\tilde{\rho}^2\big) $ 의 확률적 기울기 평가 수로 $ \tilde{\rho} $-근사 정적점에 수렴하며, 이는 비볼록 유한합 문제에 대해 알려진 최고 수준의 수렴 속도와 일치하거나 이를 초월한다.
  • 이론적 분석 결과, 알고리즘이 초기화에 대해 강건하며 $ \tilde{\rho} $ 의 지식이 필요하지 않다는 점을 보여, 실세계 응용에 실용적이다.
  • 실험 결과(이론적 한계에 의해 암시됨)는 ZeroSARAH가 전체 기울기 단계의 동기화 부담이 없기 때문에 대규모 및 페더레이티드 러닝에서 훈련 시간을 크게 단축시킬 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.