Skip to main content
QUICK REVIEW

[논문 리뷰] Convergence Rates Analysis of The Quadratic Penalty Method and Its Applications to Decentralized Distributed Optimization

Huan Li, Cong Fang|arXiv (Cornell University)|2017. 11. 29.
Sparse and Compressive Sensing Techniques참고 문헌 32인용 수 11
한 줄 요약

이 논문은 선형 제약 조건이 있는 볼록 최적화 문제에 대해 보조 변수가 증가하고 하위 문제를 단일 프록시 그래디언트 단계로만 해결하는 비정확한 연속 기반 평판 방법을 분석한다. 일반 문제와 강력 볼록 문제에 대해 각각 $O(1/\sqrt{K})$ 및 $O(1/K)$ 수준의 수렴 속도를 확립하며, 네스테로프 가속 기법을 적용하여 이들 수렴 속도를 각각 $O(1/K)$ 및 $O(1/K^2)$로 향상시킨다. 분산 최적화에 적용했을 때, 이 방법은 기존 분산 기반 기울기 방법의 수렴 속도를 $O(\log K / \sqrt{K})$ 에서 $O(1/\sqrt{K})$ 로 향상시키며, $O(1/\varepsilon)$ 번의 통신과 $O(1/\varepsilon^{2+\delta})$ 번의 계산을 요구하는 통신 효율적인 변형을 가능하게 한다.

ABSTRACT

In this paper, we study a variant of the quadratic penalty method for linearly constrained convex problems, which has already been widely used but actually lacks theoretical justification. Namely, the penalty parameter steadily increases and the penalized objective function is minimized inexactly rather than exactly, e.g., with only one step of the proximal gradient descent. For such a variant of the quadratic penalty method, we give counterexamples to show that it may not give a solution to the original constrained problem. By choosing special penalty parameters, we ensure the convergence and further establish the convergence rates of $O\left(\frac{1}{\sqrt{K}} ight)$ for the generally convex problems and $O\left(\frac{1}{K} ight)$ for strongly convex ones, where $K$ is the number of iterations. Furthermore, by adopting Nesterov's extrapolation we show that the convergence rates can be improved to $O\left(\frac{1}{K} ight)$ for the generally convex problems and $O\left(\frac{1}{K^2} ight)$ for strongly convex ones. When applied to the decentralized distributed optimization, the penalty methods studied in this paper become the widely used distributed gradient method and the fast distributed gradient method. However, due to the totally different analysis framework, we can improve their $O\left(\frac{\log K}{\sqrt{K}} ight)$ and $O\left(\frac{\log K}{K} ight)$ convergence rates to $O\left(\frac{1}{\sqrt{K}} ight)$ and $O\left(\frac{1}{K} ight)$ with fewer assumptions on the network topology for general convex problems. Using our analysis framework, we also extend the fast distributed gradient method to a communication efficient version, i.e., finding an $\varepsilon$ solution in $O\left(\frac{1}{\varepsilon} ight)$ communications and $O\left(\frac{1}{\varepsilon^{2+δ}} ight)$ computations for the non-smooth problems, where $δ$ is a small constant.

연구 동기 및 목표

  • 실제 비정확한 구현과 평판 방법의 수렴 보장 간 이론적 격차를 해소하기 위해.
  • 비정확한 최소화와 증가하는 평판 매개수를 사용하는 평판 방법의 변형에 대해 수렴 속도를 확립하기 위해.
  • 새로운 분석 프레임워크를 적용하여 널리 사용되는 분산 분산 최적화 알고리즘의 수렴 속도를 향상시키기 위해.
  • 비미분 가능 문제에 대해 최적의 통신 및 계산 복잡도를 갖는 통신 효율적인 빠른 분산 기울기 방법의 변형을 개발하기 위해.

제안 방법

  • 반복 과정에서 평판 매개수가 증가하고 하위 문제를 단일 프록시 그래디언트 단계로 비정확하게 해결하는 연속 기반 평판 방법을 제안한다.
  • 제어된 오차를 갖는 평판 하위 문제를 해결하기 위해 프록시 그래디언트(PG) 및 가속 프록시 그래디언트(APG) 방법을 사용한다.
  • 네스테로프의 외삽 기법을 적용하여 수렴 속도를 가속화하고, 일반 문제와 강력 볼록 문제 모두에 대해 향상된 수렴 속도를 달성한다.
  • 지역 변수와 공통 제약 조건을 갖는 공통화 공식화로 문제를 모델링하여 분산 환경에 이 방법을 적응시킨다.
  • 비미분 가능 정규화를 효율적으로 처리하기 위해 스무딩 기반 내부 솔버(AdaptSmooth)를 도입한다.
  • 평판 매개수 시퀀스와 오차 허용 범위를 통한 하위 최적성과 타당성 위반을 제어함으로써 수렴 경계를 확립한다.

실험 결과

연구 질문

  • RQ1일단 하위 문제를 한 번의 단계로만 해결하는 비정확한 연속 기반 평판 방법은 원래 제약 조건 문제의 진짜 해로 수렴할 수 있는가?
  • RQ2일반 및 강력 볼록 설정 하에서 이러한 변형에 대해 보장할 수 있는 수렴 속도는 무엇인가?
  • RQ3새로운 분석 프레임워크를 사용하여 기존 분산 기울기 방법의 수렴 속도를 $O(\log K / \sqrt{K})$ 에서 $O(1/\sqrt{K})$ 로 향상시킬 수 있는가?
  • RQ4비미분 가능 문제에 대해 최적의 통신 및 계산 복잡도를 갖는 통신 효율적인 빠른 분산 기울기 방법의 변형을 설계할 수 있는가?

주요 결과

  • 증가하는 평판 매개수와 한 단계의 PG 업데이트를 사용하는 비정확한 평판 방법은 반례를 통해 진짜 해로 수렴하지 못할 수 있음을 보여준다.
  • PG 기반 방법의 경우 일반 볼록 문제에 대해 $O(1/\sqrt{K})$ 수렴 속도를, 강력 볼록 문제에 대해 $O(1/K)$ 수렴 속도를 확보한다.
  • 네스테로프 가속 기법을 적용한 APG 기반 방법은 일반 문제에 대해 $O(1/K)$, 강력 볼록 문제에 대해 $O(1/K^2)$ 수렴 속도를 달성한다.
  • 분산 최적화에 적용했을 때, 이 방법은 네트워크 토폴로지에 대한 더 약한 가정 하에서 기존 분산 기울기 방법의 수렴 속도를 $O(\log K / \sqrt{K})$ 에서 $O(1/\sqrt{K})$ 로 향상시킨다.
  • 비미분 가능 문제에 대해 $O(1/\varepsilon)$ 번의 통신과 $O(1/\varepsilon^{2+\delta})$ 번의 계산을 요구하는 빠른 분산 기울기 방법의 통신 효율적인 변형을 개발하였다.
  • 이 분석 프레임워크는 타당성과 최적성 오차를 직접 제어함으로써 더 날카운 수렴 경계를 확립하여 이전의 분산 방법보다 향상된 수렴 속도를 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.