Skip to main content
QUICK REVIEW

[논문 리뷰] Asynchronous Stochastic Proximal Optimization Algorithms with Variance Reduction

Qi Meng, Wei Chen|arXiv (Cornell University)|2016. 09. 27.
Stochastic Gradient Optimization Techniques참고 문헌 18인용 수 10
한 줄 요약

이 논문은 대규모 정규화된 경험 위험 최소화 문제에서 더 빠른 수렴을 위해 분산 감소 기법을 활용한 ProxSVRG 및 ProxSVRCD의 비동기적 변종인 Async-ProxSVRG와 Async-ProxSVRCD를 제안한다. 데이터가 희소한 경우 Async-ProxSVRG가 거의 선형적 속도 향상을 달성함을 증명하였으며, 블록 크기가 작을 경우 어떤 희소성 조건에도 불구하고 Async-ProxSVRCD가 선형적 속도 향상을 달성함을 보였다. 이는 벤치마크 데이터셋을 통한 실험으로 검증되었다.

ABSTRACT

Regularized empirical risk minimization (R-ERM) is an important branch of machine learning, since it constrains the capacity of the hypothesis space and guarantees the generalization ability of the learning algorithm. Two classic proximal optimization algorithms, i.e., proximal stochastic gradient descent (ProxSGD) and proximal stochastic coordinate descent (ProxSCD) have been widely used to solve the R-ERM problem. Recently, variance reduction technique was proposed to improve ProxSGD and ProxSCD, and the corresponding ProxSVRG and ProxSVRCD have better convergence rate. These proximal algorithms with variance reduction technique have also achieved great success in applications at small and moderate scales. However, in order to solve large-scale R-ERM problems and make more practical impacts, the parallel version of these algorithms are sorely needed. In this paper, we propose asynchronous ProxSVRG (Async-ProxSVRG) and asynchronous ProxSVRCD (Async-ProxSVRCD) algorithms, and prove that Async-ProxSVRG can achieve near linear speedup when the training data is sparse, while Async-ProxSVRCD can achieve near linear speedup regardless of the sparse condition, as long as the number of block partitions are appropriately set. We have conducted experiments on a regularized logistic regression task. The results verified our theoretical findings and demonstrated the practical efficiency of the asynchronous stochastic proximal algorithms with variance reduction.

연구 동기 및 목표

  • 대규모 정규화된 경험 위험 최소화(R-ERM) 문제에서 확장 가능하고 병렬화된 최적화의 필요성을 해결한다.
  • 분산 감소 기반 프록시 알고리즘(ProxSVRG 및 ProxSVRCD)을 비동기 병렬 환경으로 확장하여 학습 효율성을 향상시킨다.
  • 이러한 알고리즘의 비동기 구현에 대한 수렴성과 속도 향상 조건을 이론적으로 분석한다.
  • 이론적 결과를 실제 세계의 벤치마크 데이터셋을 사용하여 실험적으로 검증한다. 데이터의 희소성과 차원 수에 따라 변화하는 조건을 고려한다.

제안 방법

  • 전체 파라미터 벡터의 원자적 업데이트를 보장하기 위해 일致한 읽기 의미 체계를 사용한 ProxSVRG의 비동기적 변종인 Async-ProxSVRG를 제안한다.
  • 좌표 블록의 원자적 업데이트를 허용하여 시스템 효율성을 향상시키기 위해 비일관된 읽기 의미 체계를 사용한 ProxSVRCD의 비동기적 변종인 Async-ProxSVRCD를 제안한다.
  • 비동기 프레임워크에 분산 감소 기법을 통합하여 기울기 분산을 감소시키고, 일정한 스텝 사이즈로 선형 수렴을 가능하게 한다.
  • 이론적 분석 결과, 데이터가 희소할 경우 Async-ProxSVRG가 거의 선형적 속도 향상을 달성하며, 블록 크기가 입력 차원에 비해 작을 경우 Async-ProxSVRCD도 이를 달성함을 보였다.
  • 표준 초모수를 사용하여 두 알고리즘을 구현: 스텝 사이즈 η = 0.04, 미니배치 크기 B = 200, 내부 루프 크기 K는 2n 또는 2nm로 설정함.
  • 입력 특징을 정규화하여 리프시츠 상수 L ≤ 0.25로 제한함으로써 안정적인 수렴을 보장한다.

실험 결과

연구 질문

  • RQ1ProxSVRG의 비동기 병렬화가 거의 선형적 속도 향상을 달성할 수 있는가? 어떤 데이터 조건에서 가능한가?
  • RQ2비동기 ProxSVRCD는 데이터의 희소성에 의존하지 않고 거의 선형적 속도 향상을 달성할 수 있는가? 어떤 블록 크기 조건이 필요한가?
  • RQ3실제로 비동기 ProxSVRG와 ProxSVRCD의 수렴 속도와 속도 향상은 순차적 대안보다 어떻게 비교되는가?
  • RQ4프록시 스토하스틱 최적화에서 비동기성과 분산 감소 기법을 효과적으로 조합할 수 있는가? 수렴 성능이 악화되지 않는가?

주요 결과

  • Async-ProxSVRG는 rcv1와 같은 희소 데이터셋에서 거의 선형적 속도 향상을 달성하며, 가장 희소한 데이터에서 가장 높은 속도 향상을 보였다.
  • Async-ProxSVRCD는 news20과 같은 고차원 밀집 데이터셋에서 뚜렷한 속도 향상을 보였으며, 입력 차원에 비해 블록 크기가 작은 조건을 충족함에 따라 이론적 조건과 일치하였다.
  • 세 가지 벤치마크 데이터셋(rcv1, real-sim, news20) 전반에서, 두 비동기 알고리즘 모두 Async-ProxSGD 및 Async-ProxSCD와 같은 분산 감소 기법이 적용되지 않은 대안들보다 수렴 속도가 빠르게 나타났다.
  • Async-ProxSVRG의 속도 향상은 rcv1(희소)에서 가장 높고, news20(밀집)에서 가장 낮았으며, 이는 이론적 희소성 의존성과 일치함을 확인하였다.
  • Async-ProxSVRCD의 속도 향상은 news20에서 가장 두드러졌는데, 이는 블록 크기 조건이 가장 쉽게 충족되었기 때문이며, 이는 이론적 통찰을 실험적으로 검증한 결과이다.
  • 실험 결과는 비동기성과 분산 감소 기법을 효과적으로 조합할 수 있으며, 이는 대규모 R-ERM 문제에서 더 빠른 수렴을 가능하게 함을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.