Skip to main content
QUICK REVIEW

[논문 리뷰] Momentum-based variance-reduced proximal stochastic gradient method for composite nonconvex stochastic optimization

Yangyang Xu, Xu, Yibo|arXiv (Cornell University)|2020. 05. 31.
Stochastic Gradient Optimization Techniques참고 문헌 36인용 수 6
한 줄 요약

이 논문은 복합 비볼록 스토하스틱 최적화를 위한 모멘텀 기반 분산 감소 프록시 스토하스틱 경사하강법인 PStorm을 제안한다. 이는 각 업데이트당 하나 또는 $O(1)$개의 샘플만을 사용함으로써 최적의 $O(\varepsilon^{-3})$ 복잡도를 달성한다. 모멘텀과 브레지엔 발산 기반 미러-프록스 업데이트를 활용함으로써 PStorm는 개선된 일반화 성능을 보이며, 소형 배치 학습을 효율적으로 수행하며, 기존 최적 방법들과 순수한 SGD보다 뛰어난 성능을 보인다.

ABSTRACT

Stochastic gradient methods (SGMs) have been extensively used for solving stochastic problems or large-scale machine learning problems. Recent works employ various techniques to improve the convergence rate of SGMs for both convex and nonconvex cases. Most of them require a large number of samples in some or all iterations of the improved SGMs. In this paper, we propose a new SGM, named PStorm, for solving nonconvex nonsmooth stochastic problems. With a momentum-based variance reduction technique, PStorm can achieve the optimal complexity result $O(\varepsilon^{-3})$ to produce a stochastic $\varepsilon$-stationary solution, if a mean-squared smoothness condition holds. Different from existing optimal methods, PStorm can achieve the ${O}(\varepsilon^{-3})$ result by using only one or $O(1)$ samples in every update. With this property, PStorm can be applied to online learning problems that favor real-time decisions based on one or $O(1)$ new observations. In addition, for large-scale machine learning problems, PStorm can generalize better by small-batch training than other optimal methods that require large-batch training and the vanilla SGM, as we demonstrate on training a sparse fully-connected neural network and a sparse convolutional neural network.

연구 동기 및 목표

  • 비볼록 비미분 가능 문제에 대해 최적의 수렴 복잡도를 달성하면서도 각 업데이트당 최소한의 샘플링을 사용하는 스토하스틱 경사하강법을 설계하는 것.
  • 각 반복에서 하나 또는 $O(1)$개의 샘플만을 사용하여 효과적인 소형 배치 및 온라인 학습을 가능하게 하여 기계 학습에서 일반화 성능을 향상시키는 것.
  • 분산 감소 기법을 비미분 가능 정규화를 가진 복합 비볼록 문제로 확장하면서도 최적의 수렴 속도를 유지하는 것.
  • 순수한 SGD 및 기타 최적 방법들과 비교하여 희박한 신경망 학습에서 뛰어난 성능을 보이는 것.

제안 방법

  • PStorm는 Bregman 발산 $V(\mathbf{x}, \mathbf{z})$ 를 정의하기 위해 1-강한 볼록 잠재 함수 $w$ 를 사용하는 미러-프록스 프레임워크를 적용한다.
  • 알고리즘은 수렴 가속과 분산 감소를 위해 수열 $\{\beta_k\}$ 을 사용하는 모멘텀 기반 스토하스틱 경사하강 업데이트를 사용한다.
  • 각 반복에서 현재 및 이전 반복점에서의 스토하스틱 경사하강을 계산하기 위해 $\xi$ 에 대해 하나 또는 몇 개의 샘플만 사용된다.
  • 모멘텀를 통한 분산 감소와 프록시 업데이트를 결합함으로써, 평균 제곱 평활성 조건 하에서 $O(\varepsilon^{-3})$ 복잡도를 달성한다.
  • 알고리즘은 STORM 방법의 프록시 버전으로, PStorm로 명명되었으며 온라인 및 소형 배치 학습을 위해 설계되었다.
  • 수렴과 안정성의 균형을 이루기 위해 단계 크기 규칙과 적응형 모멘텀을 사용한다.

실험 결과

연구 질문

  • RQ1스토하스틱 경사하강법이 각 업데이트당 $O(1)$개의 샘플만을 사용하면서도 비볼록 비미분 가능 문제에 대해 최적의 $O(\varepsilon^{-3})$ 복잡도를 달성할 수 있는가?
  • RQ2모멘텀 기반 분산 감소는 소형 배치 학습에서 희박한 신경망의 수렴과 일반화 성능을 어떻게 향상시키는가?
  • RQ3프록시 스토하스틱 경사하강법은 대규모 배치가 필요 없이 평균 제곱 평활성 조건 하에서도 최적의 복잡도를 유지할 수 있는가?
  • RQ4PStorm는 테스트 정확도, 정류점 위반, 신경망 학습에서의 희박성 측면에서 순수한 SGD 및 기타 최적 방법들과 비교해 어떻게 성능을 내는가?

주요 결과

  • PStorm는 평균 제곱 평활성 조건 하에서 각 업데이트당 하나의 샘플만을 사용함으로써 $\varepsilon$-정류점 해를 찾는 데 최적의 $O(\varepsilon^{-3})$ 복잡도를 달성한다.
  • 희박한 완전 연결 신경망에서 PStorm는 $\lambda = 5 \times 10^{-4}$ 일 때 88.17%의 테스트 정확도를 기록하여 순수한 SGD와 Hybrid-SGD를 능가했다.
  • AllCNN을 사용한 Cifar10 데이터셋에서 PStorm는 $\lambda = 5 \times 10^{-4}$ 일 때 88.53%의 테스트 정확도를 기록하여 Hybrid-SGD와 동등하거나 이를 초월했으며, Spiderboost보다도 뚜렷하게 향상된 성능을 보였다.
  • $\lambda = 0$ 일 때 PStorm는 모든 방법 중에서 가장 낮은 정류점 위반 수치(0.19)를 기록했고, $\lambda = 2 \times 10^{-4}$ 일 때는 72.78%의 높은 희박성(비제로 요소 비율)을 유지했다.
  • 모든 테스트된 하이퍼파rameter와 데이터셋에서 PStorm는 테스트 정확도와 정류점 위반 수치에서 항상 최고 또는 2위 성능을 기록했다.
  • 소형 배치 학습 능력과 분산 감소 메커니즘 덕분에 PStorm는 순수한 SGD 및 기타 최적 방법들보다 더 우수한 일반화 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.