[논문 리뷰] On the Complexity Analysis of the Primal Solutions for the Accelerated Randomized Dual Coordinate Ascent
이 논문은 가속화된 난수화된 이중좌표상승(ARDCA)에서 원래 해의 최적 $ O\left(\sqrt{\frac{n}{\epsilon}}\right) $ 반복 복잡도를 확립하며, 이는 이중 수렴 속도와 일치한다. 이중 함수가 이차 기능 성장 조건을 만족할 경우 선형 수렴을 증명하고, 이전의 스무딩 또는 Catalyst 기반 방법에서 흔히 나타나는 $ \log(1/\epsilon) $ 요소를 제거하여, 정규화된 경험 위험 최소화 문제에서 이중좌표상승의 최초로 최적의 원래 복잡도를 달성한다.
Dual first-order methods are essential techniques for large-scale constrained convex optimization. However, when recovering the primal solutions, we need $T(ε^{-2})$ iterations to achieve an $ε$-optimal primal solution when we apply an algorithm to the non-strongly convex dual problem with $T(ε^{-1})$ iterations to achieve an $ε$-optimal dual solution, where $T(x)$ can be $x$ or $\sqrt{x}$. In this paper, we prove that the iteration complexity of the primal solutions and dual solutions have the same $O\left(\frac{1}{\sqrtε} ight)$ order of magnitude for the accelerated randomized dual coordinate ascent. When the dual function further satisfies the quadratic functional growth condition, by restarting the algorithm at any period, we establish the linear iteration complexity for both the primal solutions and dual solutions even if the condition number is unknown. When applied to the regularized empirical risk minimization problem, we prove the iteration complexity of $O\left(n\log n+\sqrt{\frac{n}ε} ight)$ in both primal space and dual space, where $n$ is the number of samples. Our result takes out the $\left(\log \frac{1}ε ight)$ factor compared with the methods based on smoothing/regularization or Catalyst reduction. As far as we know, this is the first time that the optimal $O\left(\sqrt{\frac{n}ε} ight)$ iteration complexity in the primal space is established for the dual coordinate ascent based stochastic algorithms. We also establish the accelerated linear complexity for some problems with nonsmooth loss, i.e., the least absolute deviation and SVM.
연구 동기 및 목표
- 가속화된 난수화된 이중좌표상승(ARDCA)에서 이중 수렴 복잡도와 원래 수렴 복잡도 간 격차를 해소하기 위해.
- 비강한볼록 문제에서 이중 반복을 통해 유도된 원래 해의 반복 복잡도를 분석하기 위해.
- 정규화된 경험 위험 최소화(ERM) 문제에서 원래 해에 대한 최적의 $ O\left(\sqrt{\frac{n}{\epsilon}}\right) $ 반복 복잡도를 확립하기 위해.
- 이차 기능 성장 조건 하에서 조건수를 알지 못하더라도 원래 해와 이중 해 양쪽 모두 선형 수렴을 보임을 보여주기 위해.
- 스무딩 또는 Catalyst 기반 접근법에서 흔히 나타나는 $ \log(1/\epsilon) $ 요소를 복잡도 한계에서 제거하기 위해.
제안 방법
- 라그랑주 이중 프레임워크와 이중성 갭을 이용해 이중 반복에서 원래 해를 복구하는 분석을 수행한다.
- 원래 오차가 $ O\left(\sqrt{D(\mathbf{u}^K) - D(\mathbf{u}^*)} + D(\mathbf{u}^K) - D(\mathbf{u}^*)\right) $ 로 유계임을 증명하며, 원래 해와 이중 수렴을 연결한다.
- 이중 함수가 이차 기능 성장 조건을 만족할 경우 정기적인 간격으로 재시작 전략을 도입하여 선형 수렴을 달성한다.
- 리아푸노프 함수와 재귀적 분석을 사용하여 기대 이중성 갭과 원래 부분최적화를 유계로 제한한다.
- n개의 샘플을 가진 ERM 문제에 이 방법을 적용하여 원래 공간과 이중 공간 양쪽에서 $ O\left(n\log n + \sqrt{\frac{n}{\epsilon}}\right) $ 의 복잡도를 도출한다.
- 최소 절대 편차와 SVM과 같은 비스무스 손실 함수에 대해서도 비스무스 손실 함수에 대해 가속화된 선형 수렴을 확립한다.
실험 결과
연구 질문
- RQ1ARDCA의 원래 해 수렴 복잡도가 이중 수렴 복잡도와 일치할 수 있는가?
- RQ2이차 기능 성장 조건이 조건수를 알지 못하더라도 ARDCA에서 원래 해와 이중 해 양쪽 모두 선형 수렴을 가능하게 하는가?
- RQ3스무딩 또는 Catalyst 기반 접근법에서 흔히 나타나는 $ \log(1/\epsilon) $ 요소를 이중좌표상승의 원래 복잡도에서 제거할 수 있는가?
- RQ4이중좌표상승을 사용할 때 ERM 문제의 원래 해에 대해 $ O\left(\sqrt{\frac{n}{\epsilon}}\right) $ 복잡도가 최적인가?
- RQ5ARDCA는 L1 및 SVM과 같은 비스무스 손실 함수에 대해 가속화된 선형 수렴을 달성할 수 있는가?
주요 결과
- ARDCA의 원래 해 수렴 복잡도는 $ O\left(\frac{1}{\sqrt{\epsilon}}\right) $ 로, 이중 복잡도와 일치하여 오랫동안 남아있던 격차를 해결한다.
- 이차 기능 성장 조건 하에서 조건수를 알지 못하더라도 원래 해와 이중 해 모두 선형 수렴을 달성한다.
- 정규화된 경험 위험 최소화 문제에서 반복 복잡도는 원래 공간과 이중 공간 양쪽에서 $ O\left(n\log n + \sqrt{\frac{n}{\epsilon}}\right) $ 이다.
- 스무딩 또는 Catalyst 기반 방법과 비교해 $ \log(1/\epsilon) $ 요소가 제거되어, 이중좌표상승에 대해 최초로 최적의 $ O\left(\sqrt{\frac{n}{\epsilon}}\right) $ 원래 복잡도를 달성한다.
- 기능 성장 조건 하에서 비스무스 손실 함수를 가진 문제에 대해 선형 수렴이 입증된다. 이는 최소 절대 편차와 SVM을 포함한다.
- 분석을 통해 이중성 갭이 원래 부분최적화를 제어함을 증명하며, 재귀적 리아푸노프 함수 기법을 통해 날카로운 유계를 확보할 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.