Skip to main content
QUICK REVIEW

[논문 리뷰] A Class of Parallel Doubly Stochastic Algorithms for Large-Scale Learning

Aryan Mokhtari, Alec Koppel|arXiv (Cornell University)|2016. 06. 15.
Stochastic Gradient Optimization Techniques인용 수 8
한 줄 요약

이 논문은 대규모 학습을 위한 새로운 병렬 이重확률 알고리즘인 RAPSA를 제안한다. 이 알고리즘은 동시에 매개변수 블록과 학습 샘플에 대해 확률적으로 무작위화한다. 볼록성 조건 하에서 최적 해로 수렴함을 증명하였으며, 이론적 보장을 갖는 비선형 수렴 속도를 가지는 비동기 및 가속 버전(ARAPSA)으로 확장하였다.

ABSTRACT

We consider learning problems over training sets in which both, the number of training examples and the dimension of the feature vectors, are large. To solve these problems we propose the random parallel stochastic algorithm (RAPSA). We call the algorithm random parallel because it utilizes multiple parallel processors to operate on a randomly chosen subset of blocks of the feature vector. We call the algorithm stochastic because processors choose training subsets uniformly at random. Algorithms that are parallel in either of these dimensions exist, but RAPSA is the first attempt at a methodology that is parallel in both the selection of blocks and the selection of elements of the training set. In RAPSA, processors utilize the randomly chosen functions to compute the stochastic gradient component associated with a randomly chosen block. The technical contribution of this paper is to show that this minimally coordinated algorithm converges to the optimal classifier when the training objective is convex. Moreover, we present an accelerated version of RAPSA (ARAPSA) that incorporates the objective function curvature information by premultiplying the descent direction by a Hessian approximation matrix. We further extend the results for asynchronous settings and show that if the processors perform their updates without any coordination the algorithms are still convergent to the optimal argument. RAPSA and its extensions are then numerically evaluated on a linear estimation problem and a binary image classification task using the MNIST handwritten digit dataset.

연구 동기 및 목표

  • 특징 차원과 학습 데이터셋 크기가 모두 막대한 대규모 학습 문제에 도전한다.
  • 블록 선택과 학습 샘플 선택 양쪽에서 병렬화된 새로운 최적화 프레임워크를 개발한다.
  • 최소한의 조율로 볼록 목표 함수 하에서 최적 해로 수렴함을 보장한다.
  • 확장성과 내구성을 향상시키기 위해 알고리즘을 비동기 설정으로 확장한다.
  • 곡률 정보를 활용한 Hessian 근사치를 도입하여 수렴 속도를 향상시킨 가속 버전(ARAPSA)을 제안한다.

제안 방법

  • RAPSA는 매개변수 벡터를 B개의 블록으로 나누고, 각 반복에서 I개의 병렬 프로세서가 블록과 학습 샘플을 무작위로 선택한다.
  • 각 프로세서는 선택된 블록에 대해 무작위로 선택된 학습 함수의 부분집합을 사용하여 확률적 그래디언트 성분을 계산한다.
  • 알고리즘은 점점 감소하는 스텝 사이즈 규칙을 사용하며, ARAPSA에서는 수렴 속도를 향상시키기 위해 Hessian 근사 행렬을 통합한다.
  • 지연이 있는 마팅게일 차분 수열을 활용하여 수렴성을 증명하며, 기대 내내림과 합산 가능한 오차 항을 고려한다.
  • 비동기성을 고려하기 위해 지연 업데이트를 모델링하고, 목표 함수 오차의 거의 확실 수렴을 보여준다.
  • 특정 스텝 사이즈 및 파라미터 조건 하에서 ARAPSA의 기대 목표 함수 오차에 대해 O(1/t)의 비선형 수렴 속도를 유도한다.

실험 결과

연구 질문

  • RQ1매개변수 블록 선택과 학습 샘플 선택 양쪽에서 병렬화된 확률적 알고리즘을 설계할 수 있는가?
  • RQ2이러한 이중 확률적 알고리즘이 볼록성 가정 하에서 최적 해로 수렴하는가?
  • RQ3글로벌 조율 없이도 비동기 설정에서 수렴성이 유지되는가?
  • RQ4이 프레임워크에서 Hessian의 곡률 정보가 수렴 속도를 향상시킬 수 있는가?
  • RQ5제안된 알고리즘의 기대 수렴 속도는 얼마인가?

주요 결과

  • 목표 함수가 볼록일 경우 RAPSA는 거의 확실하게 최적 해 F(x*)로 수렴한다.
  • RAPSA의 기대 목표 함수 오차는 O(1/t)의 비선형 속도로 감소하며, E[F(x^t) - F(x*)] ≤ C / (t + T^0)로 수식화된 경계에 따라 나타난다.
  • 가속 버전인 ARAPSA는 내림방향에 Hessian 근사 행렬을 통합하여 더 빠른 수렴을 달성한다.
  • 프로세서가 조율 없이 업데이트하는 비동기 설정에서도 알고리즘이 수렴성을 유지한다. 이는 업데이트 지연이 유한하기 때문이다.
  • 이론적 분석은 내림항의 합 ∑β^t이 거의 확실하게 유한함을 확인하며, 이는 목표 함수 갭의 liminf가 0임을 의미한다.
  • 수렴 속도 경계는 강볼록성 상수 m, Hessian 리프시츠 상수 M, 지연 τ와 같은 문제 파라미터에 의존한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.