Skip to main content
QUICK REVIEW

[논문 리뷰] Zeroth-order Asynchronous Doubly Stochastic Algorithm with Variance Reduction

Bin Gu, Zhouyuan Huo|arXiv (Cornell University)|2016. 12. 05.
Advanced Bandit Algorithms Research참고 문헌 18인용 수 11
한 줄 요약

이 논문은 이중 스토하스틱 제로스터드 오차 최적화 알고리즘인 AsyDSZOVR를 제안하며, 분산 감소 기법을 통합하여 수렴 속도를 $O(1/T)$로 향상시켜 기존의 이방성 및 순차적 스토하스틱 제로스터드 최적화 방법의 $O(1/\sqrt{T})$ 수렴 속도를 크게 초월한다. 이 방법은 잠금이 없는 병렬 환경에서 동시에 데이터 미니배치와 좌표 부분집합을 샘플링함으로써 도함수 정보가 없는 환경에서 대규모 최적화를 효율적으로 수행할 수 있도록 한다.

ABSTRACT

Zeroth-order (derivative-free) optimization attracts a lot of attention in machine learning, because explicit gradient calculations may be computationally expensive or infeasible. To handle large scale problems both in volume and dimension, recently asynchronous doubly stochastic zeroth-order algorithms were proposed. The convergence rate of existing asynchronous doubly stochastic zeroth order algorithms is $O(\frac{1}{\sqrt{T}})$ (also for the sequential stochastic zeroth-order optimization algorithms). In this paper, we focus on the finite sums of smooth but not necessarily convex functions, and propose an asynchronous doubly stochastic zeroth-order optimization algorithm using the accelerated technology of variance reduction (AsyDSZOVR). Rigorous theoretical analysis show that the convergence rate can be improved from $O(\frac{1}{\sqrt{T}})$ the best result of existing algorithms to $O(\frac{1}{T})$. Also our theoretical results is an improvement to the ones of the sequential stochastic zeroth-order optimization algorithms.

연구 동기 및 목표

  • 대규모, 도함수 없는 기계학습 문제를 위한 빠른 수렴 특성을 갖는 이방성 제로스터드 최적화 방법의 부족을 해결한다.
  • 순차적 및 이방성 환경에서 기존의 $O(1/\sqrt{T})$ 수렴 속도를 갖는 스토하스틱 제로스터드 최적화 알고리즘의 느린 수렴을 극복한다.
  • 도함수 정보가 필요 없이 고차원 및 고용량 데이터를 처리할 수 있는 확장 가능한, 잠금이 없는 병렬 알고리즘을 개발한다.
  • 이방성 및 이중 스토하스틱 프레임워크 내에서 분산 감소 기법을 활용해 수렴 속도를 가속화한다.

제안 방법

  • 이중 스토하스틱 제로스터드 알고리즘인 AsyDSZOVR를 제안하며, 병렬적으로 데이터의 미니배치와 좌표 부분집합을 무작위로 샘플링한다.
  • 제어 변수 메커니즘을 사용한 분산 감소 기반의 기울기 추정기법을 적용하여 기울기 근사값의 노이즈를 감소시킨다.
  • 적응형 단계 크기 $\gamma = \frac{u_0 b}{\widetilde{L} l^\alpha}$와 모멘텀 유사 항을 포함한 재귀적 업데이트 규칙을 사용하여 수렴 속도를 가속화한다.
  • 리아파노프 함수 기반 분석을 도입하여 기대 기울기 노름을 제한함으로써 이방성 업데이트 조건 하에서 수렴을 보장한다.
  • 반복 단계당 진행 정도의 하한 $\widetilde{\Gamma}$를 유도하며, 이는 $O(1/T)$ 수렴 속도를 확립하는 데 사용된다.
  • 스레드가 동기화 없이 공유 파rameter를 독립적으로 읽고, 계산하며 업데이트하는 잠금이 없는 병렬 컴퓨팅 모델을 적용한다.

실험 결과

연구 질문

  • RQ1분산 감소 기법이 이방성, 제로스터드 최적화에 효과적으로 적용되어 더 빠른 수렴을 이룰 수 있는가?
  • RQ2분산 감소 기법을 적용한 이방성, 이중 스토하스틱 제로스터드 최적화 알고리즘의 이론적 수렴 속도는 무엇인가?
  • RQ3순차적 및 이방성 환경에서 $O(1/\sqrt{T})$ 수렴 속도를 초월할 수 있는가?
  • RQ4제안된 방법은 데이터 볼륨과 차원성 측면에서 대규모 문제를 어떻게 처리하는가?
  • RQ5명시적인 도함수 계산 없이도 잠금이 없는 이방성 병렬 환경에서 수렴을 보장하는 조건은 무엇인가?

주요 결과

  • 제안된 AsyDSZOVR 알고리즘은 $O(1/T)$ 수렴 속도를 달성하여 기존의 이방성 및 순차적 스토하스틱 제로스터드 최적화 방법의 $O(1/\sqrt{T})$ 수렴 속도를 향상시킨다.
  • 이론적 분석을 통해 기대 기울기 노름이 $O(1/T)$ 속도로 감소함을 증명하였으며, $\omega = 0$일 때 $\frac{1}{T}\sum_{s=0}^{S-1}\sum_{t=0}^{m-1}\mathbb{E}\left\|\nabla f(x^{s+1}_t)\right\|^2 \leq \frac{\widetilde{L}l^\alpha(f(x^0) - \mathbb{E}(f(x^S)))}{\sigma b T}$ 라는 경계가 성립한다.
  • 도함수 정보가 없더라도 분산 감소 및 적응형 단계 크기 스케줄링 덕분에 수렴 속도 향상이 가능하다.
  • 공유 메모리 기반의 잠금이 없는 환경에서 확장 가능하고 효율적이며, 동기화 오버헤드 없이 병렬 업데이트를 가능하게 한다.
  • 분석을 통해 $\widetilde{\Gamma} \geq \frac{\sigma b}{\widetilde{L}l^\alpha}$ 라는 하한을 확립하였으며, 적절한 파rameter 선택 조건 하에서 $O(1/T)$ 수렴 속도를 보장한다.
  • 이 방법은 매끄럽고, 일반적으로 비볼록일 수 있는 함수들의 유한합에 적용 가능하며, 로지스틱 회귀나 릿지 회귀와 같은 일반적인 기계학습 문제를 포함한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.