[논문 리뷰] Adaptive SGD with Polyak stepsize and Line-search: Robust Convergence and Variance Reduction
이 논문은 문제에 특화된 파rameter가 필요로 하지 않고, 보간 및 비보간 설정 모두에서 강력한 수렴성을 달성하는 적응형 확률적 경사 하강법(variant)인 AdaSPS와 AdaSLS를 제안한다. 새로운 분산 감소 기법을 통합함으로써, 이 알고리즘들은 볼록 함수에서 $\mathcal{O}(\varepsilon)$-하위최적성에 대해 $\widetilde{\mathcal{O}}(n + 1/\varepsilon)$의 경사 복잡도를 달성하며, AdaSVRG의 빠른 수렴 속도를 따라가지만 내부-외부 루프 구조를 피한다.
The recently proposed stochastic Polyak stepsize (SPS) and stochastic line-search (SLS) for SGD have shown remarkable effectiveness when training over-parameterized models. However, in non-interpolation settings, both algorithms only guarantee convergence to a neighborhood of a solution which may result in a worse output than the initial guess. While artificially decreasing the adaptive stepsize has been proposed to address this issue (Orvieto et al. [2022]), this approach results in slower convergence rates for convex and over-parameterized models. In this work, we make two contributions: Firstly, we propose two new variants of SPS and SLS, called AdaSPS and AdaSLS, which guarantee convergence in non-interpolation settings and maintain sub-linear and linear convergence rates for convex and strongly convex functions when training over-parameterized models. AdaSLS requires no knowledge of problem-dependent parameters, and AdaSPS requires only a lower bound of the optimal function value as input. Secondly, we equip AdaSPS and AdaSLS with a novel variance reduction technique and obtain algorithms that require $\smash{\widetilde{\mathcal{O}}}(n+1/ε)$ gradient evaluations to achieve an $\mathcal{O}(ε)$-suboptimality for convex functions, which improves upon the slower $\mathcal{O}(1/ε^2)$ rates of AdaSPS and AdaSLS without variance reduction in the non-interpolation regimes. Moreover, our result matches the fast rates of AdaSVRG but removes the inner-outer-loop structure, which is easier to implement and analyze. Finally, numerical experiments on synthetic and real datasets validate our theory and demonstrate the effectiveness and robustness of our algorithms.
연구 동기 및 목표
- 기존의 SPS 및 SLS와 같은 적응형 SGD 방법들이 비보간 설정에서 학습할 때 수렴성이 떨어지는 문제를 해결하기 위해.
- 문제에 종속된 파rameter를 알지 못해도 볼록 및 강력 볼록 영역 모두에서 빠른 수렴 속도를 유지할 수 있는 적응형 스텝 사이즈 방법을 개발하기 위해.
- Polyak 및 선색색 기반 스텝 사이즈와 분산 감소를 통합하면서도 비보간 영역에서 이론적 보장을 유지하기 위해.
- AdaSVRG와 같이 내부-외부 루프 구조를 피함으로써 구현성과 분석 용이성을 향상시키기 위해.
- 합성 및 실세계 데이터셋에서의 수치 실험을 통해 이론적 개선 사항을 검증하기 위해.
제안 방법
- 보간 설정 외부에서 수렴을 보장하기 위해 최적 함수 값의 하한을 사용하는 Stochastic Polyak Step Size의 변종인 AdaSPS를 제안한다.
- 문제에 종속된 파rameter가 전혀 필요로 하지 않는 선색색 기반의 적응형 방법인 AdaSLS를 도입하여 다양한 설정에서 강력한 수렴성을 달성한다.
- 누적 함수 값 차이와 기울기 노름을 동적으로 조정하여 스텝 사이즈를 조절하는 새로운 분산 감소 메커니즘을 활용한다.
- 적응형 스텝 사이즈 선택과 분산 감소의 상호작용을 분석하여 수렴 속도를 유도하며, 볼록 및 강력 볼록 함수에 대해 비선형 및 선형 수렴을 보장한다.
- 딥 러닝 확장에 적합한 재시작 메커니즘을 설계하여 스텝 사이즈를 증가시켜 실제에서 관찰되는 순환 행동을 모방한다.
- 안정성과 수렴성을 유지하기 위해 적응형 스텝 사이즈와 백트랙킹을 조합한 하이브리드 업데이트 규칙을 사용한다.
실험 결과
연구 질문
- RQ1Polyak 스텝 사이즈와 선색색 기반 적응형 SGD는 보간 및 비보간 설정 모두에서 강력한 수렴성을 달성할 수 있는가?
- RQ2Polyak 및 선색색 스텝 사이즈와 분산 감소를 성공적으로 통합하면서도 이론적 수렴 보장을 유지할 수 있는가?
- RQ3제안된 알고리즘은 비보간 영역에서 기존의 적응형 방법보다 더 빠른 수렴 속도를 달성하는가?
- RQ4내부-외부 루프 구조 없이 AdaSVRG의 빠른 수렴 속도를 따라잡을 수 있는가?
- RQ5제안된 방법은 비볼록 딥 러닝 설정에서 효과적이고 강력한가?
주요 결과
- AdaSPS와 AdaSLS는 SPS 및 SLS가 해의 근처로 수렴하는 데 그치는 한계를 극복하여 비보간 설정에서도 수렴을 보장한다.
- AdaSPS는 최적 함수 값의 하한만 필요로 하며, AdaSLS는 문제에 종속된 파rameter가 전혀 필요로 하지 않아 실용적 사용성 향상에 기여한다.
- 분산 감소 버전은 볼록 함수에서 $\mathcal{O}(\varepsilon)$-하위최적성에 대해 $\widetilde{\mathcal{O}}(n + 1/\varepsilon)$의 경사 복잡도를 달성하며, 비분산 감소 버전의 $\mathcal{O}(1/\varepsilon^2)$ 속도보다 향상된다.
- 제안된 알고리즘은 AdaSVRG의 빠른 수렴 속도를 따라가지만 복잡한 내부-외부 루프 구조를 피함으로써 구현 및 분석을 단순화한다.
- 합성 및 실세계 데이터셋에서의 수치 실험은 이론적 결과를 확인하며, SPS, DecSPS, Adam 및 모멘터럼을 사용한 SGD보다 뛰어난 강건성과 성능을 보여준다.
- 비볼록 확장인 AdaSPS (DL)는 ResNet-34를 사용해 CIFAR10 및 CIFAR100에서 경쟁적인 성능을 보이며, 볼록 설정을 초월한 실용적 잠재력을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.