Skip to main content
QUICK REVIEW

[논문 리뷰] Finite-Sum Smooth Optimization with SARAH

Lam M. Nguyen, Marten van Dijk|arXiv (Cornell University)|2019. 01. 22.
Stochastic Gradient Optimization Techniques인용 수 7
한 줄 요약

이 논문은 유한합 스무쓰 비볼록 최적화를 위한 수정된 SARAH 알고리즘을 제안하며, $ n \leq \mathcal{O}(\epsilon^{-2}) $ 일 때 총 그래디언트 복잡도가 이론적 하한값 $ \Omega(\sqrt{n}/\varepsilon) $ 에 상수 인자까지 정확히 일치함을 보인다. 볼록 문제의 경우, 하향 수렴 및 선형 수렴 속도를 가지는 SARAH++ 와 실용적인 적응형 변형(SARAH Adaptive)을 도입하여 튜닝 없이 성능을 향상시켰으며, covtype 및 ijcnn1 등의 실제 데이터셋에서 검증되었다.

ABSTRACT

The total complexity (measured as the total number of gradient computations) of a stochastic first-order optimization algorithm that finds a first-order stationary point of a finite-sum smooth nonconvex objective function $F(w)=\frac{1}{n} \sum_{i=1}^n f_i(w)$ has been proven to be at least $Ω(\sqrt{n}/ε)$ for $n \leq \mathcal{O}(ε^{-2})$ where $ε$ denotes the attained accuracy $\mathbb{E}[ \| abla F( ilde{w})\|^2] \leq ε$ for the outputted approximation $ ilde{w}$ (Fang et al., 2018). In this paper, we provide a convergence analysis for a slightly modified version of the SARAH algorithm (Nguyen et al., 2017a;b) and achieve total complexity that matches the lower-bound worst case complexity in (Fang et al., 2018) up to a constant factor when $n \leq \mathcal{O}(ε^{-2})$ for nonconvex problems. For convex optimization, we propose SARAH++ with sublinear convergence for general convex and linear convergence for strongly convex problems; and we provide a practical version for which numerical experiments on various datasets show an improved performance.

연구 동기 및 목표

  • 비볼록 유한합 최적화에서의 확률적 1차 방법의 수렴 복잡도 격차를 해소한다.
  • 평균 스무쓰성 조건 하에 비볼록 문제에 대해 이론적 하한값 $ \Omega(\sqrt{n}/\varepsilon) $ 와 일치하는 총 그래디언트 복잡도를 달성한다.
  • 향상된 수렴 및 성능를 가지는 실용적이고 효율적인 볼록 문제용 변형을 개발한다.
  • 스텝 사이즈를 동적으로 조정하고 내부 루프를 조기에 종료하여 불필요한 업데이트를 방지하는 적응형 변형(SARAH Adaptive)을 제안한다.

제안 방법

  • 기존 SARAH 알고리즘을 수정하여 각 외부 루프의 출력을 무작위 중간 점이 아닌 최종 반복점 $ w_{m+1}^{(s)} $ 로 설정한다.
  • 재귀적 분산 감소 그래디언트 추정기: $ v_t^{(s)} = \nabla f_{i_t}(w_t^{(s)}) - \nabla f_{i_t}(w_{t-1}^{(s)}) + v_{t-1}^{(s)} $ 를 사용하여 저분산 그래디언트 추정을 유지한다.
  • SARAH++ 는 $ \|v_t^{(s)}\|^2 < \gamma \|v_0^{(s)}\|^2 $ 를 기반으로 하는 동적 정지 기준을 도입하여 효율적인 내부 루프 종료를 보장한다.
  • 적응형 스텝 사이즈 $ \eta_t^{(s)} = \frac{1}{L} \cdot \frac{\|v_t^{(s)}\|^2}{\|v_0^{(s)}\|^2} $ 를 제안하며, 이는 현재 그래디언트 노름에 따라 스케일링된다.
  • 적응형 스텝 사이즈와 정지 조건을 적용하여 작은 불필요한 업데이트를 방지하고 수렴 속도를 향상시킨다.
  • 각 외부 루프의 시작 시 전체 그래디언트를 사용하고, 반복점을 $ w_{t+1}^{(s)} = w_t^{(s)} - \eta v_t^{(s)} $ 를 통해 업데이트한다.

실험 결과

연구 질문

  • RQ1수정된 SARAH 알고리즘이 비볼록 유한합 문제에 대해 알려진 하한값과 일치하는 총 그래디언트 복잡도를 달성할 수 있는가?
  • RQ2SARAH++ 는 표준 SARAH 과 비교해 볼록 및 강볼록 문제에서 향상된 수렴 속도를 제공하는가?
  • RQ3SARAH 의 적응형 변형은 스텝 사이즈와 내부 루프 길이를 동적으로 조정하여 실용적 성능을 향상시킬 수 있는가?
  • RQ4SARAH Adaptive 는 다양한 데이터셋과 학습률 설정에서 SARAH 와 SARAH++ 와 비교해 성능가 어떻게 되는가?

주요 결과

  • 수정된 SARAH 알고리즘은 $ n \leq \mathcal{O}(\varepsilon^{-2}) $ 일 때 비볼록 문제에 대해 총 그래디언트 복잡도 $ \mathcal{O}(\sqrt{n}/\varepsilon) $ 를 달성하며, 이는 이론적 하한값 $ \Omega(\sqrt{n}/\varepsilon) $ 에 상수 인자까지 정확히 일치한다.
  • SARAH++ 는 일반 볼록 문제에 대해 하향 수렴 속도를, 강볼록 문제에 대해 선형 수렴 속도를 달성하며 이는 이론적 보장이 있다.
  • covtype 와 ijcnn1 데이터셋에 대한 수치 실험 결과, SARAH++ 는 수렴 속도와 정확도 측면에서 표준 SARAH 을 능가한다.
  • 이론적 분석이 없는 SARAH Adaptive 는 실질적으로 SARAH 와 SARAH++ 를 모두 능가하는 뛰어난 성능을 보이며, 특히 학습률 튜닝 없이도 뛰어난 성능을 발휘한다.
  • 정지 기준 $ \|v_t^{(s)}\|^2 < \gamma \|v_0^{(s)}\|^2 $ 는 불필요한 작은 업데이트를 방지하여 효율성을 크게 향상시킨다.
  • 적응형 스텝 사이즈 $ \eta_t^{(s)} = \frac{1}{L} \cdot \frac{\|v_t^{(s)}\|^2}{\|v_0^{(s)}\|^2} $ 는 $ \eta_t^{(s)} \leq \frac{1}{L} $ 를 보장하여 안정성과 수렴성을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.