Skip to main content
QUICK REVIEW

[논문 리뷰] Complexity of Highly Parallel Non-Smooth Convex Optimization

Sébastien Bubeck, Qijia Jiang|arXiv (Cornell University)|2019. 06. 25.
Stochastic Gradient Optimization Techniques참고 문헌 22인용 수 12
한 줄 요약

이 논문은 고도로 병렬화된 비미분 가능 볼록 최적화에 대해 처음으로 날카운 복잡도 경계를 확립하며, $Q = \mathrm{poly}(d)$의 기울기 쿼리가 동시에 이용 가능한 경우 기울기 하강법이 오직 $\widetilde{O}(\sqrt{d})$ 라운드까지 최적이 되며, 이후에는 더 이상 향상될 수 없다는 것을 보여준다. 새로운 가속화 방법을 제안하여 깊이 $d^{1/3}/\varepsilon^{2/3}$를 달성하였으며, 이는 이전 작업을 향상시키고 $\varepsilon \in [d^{-1}, d^{-1/2}]$에서 최적이 될 가능성이 있다고 추측한다. 분석은 미분 가능 최적화에서 유래한 고차원 가속 기법을 활용하여 이 결과를 도출한다.

ABSTRACT

A landmark result of non-smooth convex optimization is that gradient descent is an optimal algorithm whenever the number of computed gradients is smaller than the dimension $d$. In this paper we study the extension of this result to the parallel optimization setting. Namely we consider optimization algorithms interacting with a highly parallel gradient oracle, that is one that can answer $\mathrm{poly}(d)$ gradient queries in parallel. We show that in this case gradient descent is optimal only up to $ ilde{O}(\sqrt{d})$ rounds of interactions with the oracle. The lower bound improves upon a decades old construction by Nemirovski which proves optimality only up to $d^{1/3}$ rounds (as recently observed by Balkanski and Singer), and the suboptimality of gradient descent after $\sqrt{d}$ rounds was already observed by Duchi, Bartlett and Wainwright. In the latter regime we propose a new method with improved complexity, which we conjecture to be optimal. The analysis of this new method is based upon a generalized version of the recent results on optimal acceleration for highly smooth convex optimization.

연구 동기 및 목표

  • 각 라운드당 $Q = \mathrm{poly}(d)$ 쿼리가 이용 가능한 고도로 병렬화된 비미분 가능 볼록 최적화 알고리즘의 최적 깊이에 대한 이해 격차를 메우기.
  • 무작위 병렬 알고리즘에 대해서도 기울기 하강법을 초월해 명백한 향상이 불가능함을 보여주는 매칭 하한선을 확립하기.
  • 깊이 $\sqrt{d} \leq \text{깊이} \leq d$ 범위에서 이전 작업의 $d^{1/4}/\varepsilon$ 깊이를 초월하는 개선된 깊이 복잡도를 갖는 새로운 알고리즘을 제안하기.
  • 고차원 가속 기법과의 연결을 바탕으로 $\varepsilon \in [d^{-1}, d^{-1/2}]$ 범위에서 제안된 $d^{1/3}/\varepsilon^{2/3}$ 깊이가 최적이 될 것이라고 추측하기.

제안 방법

  • 무작위 병렬 알고리즘에 대한 새로운 하한선을 유도하여 기울기 하강법이 $\widetilde{O}(\sqrt{d})$ 라운드까지 최적이 되며, 이는 이전의 $d^{1/3}$ 하한선을 향상시킨다.
  • 최근의 미분 가능 볼록 최적화 결과에서 유도된 일반화된 고차원 가속 기법을 기반으로 한 새로운 알고리즘을 제안한다.
  • 정확도와 수렴성을 유지하기 위해 매개변수 $\theta$에 대한 이진 탐색을 기반으로 한 선형 탐색 절차와 적응형 스텝 크기 조절을 사용한다.
  • 기울기 오라클의 병렬 환경에서의 행동을 모델링하기 위해 함수 $\omega(\cdot)$를 통한 일반화된 곡률 및 오라클 복잡도 개념을 도입한다.
  • 잠재 함수 $\zeta^*(\theta)$의 도함수에 대한 경계와 미분 부등식을 활용한 수렴 속도의 정교한 분석을 적용한다.
  • 정확도 기준을 충족시키기 위해 이진 탐색의 정밀도를 보장하는 정지 기준 $\tau = |u - \ell|$을 도입한다.

실험 결과

연구 질문

  • RQ1각 라운드당 $Q = \mathrm{poly}(d)$ 쿼리가 이용 가능한 병렬 비미분 가능 볼록 최적화의 최적 깊이는 무엇인가?
  • RQ2Duchi 등(2012)의 $d^{1/4}/\varepsilon$ 깊이를 향상시킬 수 있으며, 만약 가능하면 얼마나 향상시킬 수 있는가?
  • RQ3고도로 병렬화된 환경에서 깊이와 작업량 사이에 본질적인 상충 관계가 존재하는가? 국소 탐색이 비효율적이 되는 임계 깊이는 무엇인가?
  • RQ4미분 가능 최적화에서 유래한 고차원 가속 기법을 비미분 가능 설정으로 적응시켜 병렬 깊이 복잡도를 향상시킬 수 있는가?
  • RQ5제안된 $d^{1/3}/\varepsilon^{2/3}$ 깊이 복잡도가 $\varepsilon \in [d^{-1}, d^{-1/2}]$ 범위에서 최적이 되는가?

주요 결과

  • 논문은 고도로 병렬화된 환경에서 기울기 하강법이 $\widetilde{O}(\sqrt{d})$ 라운드까지 최적이 되며, 이는 이전의 $d^{1/3}$ 하한선을 향상시킨다는 것을 보여주는 매칭 하한선을 확립한다.
  • 깊이 $d^{1/3}/\varepsilon^{2/3}$를 갖는 새로운 알고리즘을 제안하며, 이는 $\varepsilon \in [d^{-1}, d^{-1/2}]$ 범위에서 기울기 하강법($1/\varepsilon^2$)과 중심의 무게($d\log(1/\varepsilon)$)보다 순서적으로 우수하다.
  • 제안된 방법은 병렬 환경에서 '이차 가속' 형태를 달성하며, 국소 탐색이 비효율적이 되는 임계 깊이가 순차적 환경의 $\widetilde{O}(d)$에서 고도로 병렬화된 환경의 $\widetilde{O}(\sqrt{d})$로 이동함을 보여준다.
  • 분석 결과 $\varepsilon < d^{-1/2}$일 경우 중심의 무게 방법이 깊이 측면에서 비효율적이며, 새로운 방법이 깊이 $\sqrt{d}$에서 $d$ 사이의 범위에서 이를 향상시킨다.
  • 논문은 $d^{1/3}/\varepsilon^{2/3}$ 깊이 복잡도가 $\varepsilon \in [d^{-1}, d^{-1/2}]$ 범위에서 최적이 될 것이라고 추측하며, 깊이 최적화된 알고리즘 중 최적의 작업량은 여전히 열린 질문으로 남긴다.
  • 하한선은 무작위 알고리즘에도 적용되며, 병렬 비미분 가능 최적화의 복잡도에 오랫동안 존재하던 격차를 메우며 Nemirovski의 원래 $d^{1/3}$ 구성보다 향상된 결과를 도출한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.