Skip to main content
QUICK REVIEW

[논문 리뷰] Complexity of Proximal augmented Lagrangian for nonconvex optimization with nonlinear equality constraints

Yue Xie, Stephen J. Wright|arXiv (Cornell University)|2019. 07. 31.
Sparse and Compressive Sensing Techniques참고 문헌 35인용 수 5
한 줄 요약

이 논문은 비볼록 최적화 문제에 비선형 등식 제약 조건이 있는 Proximal Augmented Lagrangian (Proximal AL) 방법의 최악의 경우 복잡도를 분석한다. Proximal 매개수 $\beta = \mathcal{O}(\epsilon^{\eta})$ 이고 페널티 매개수 $\rho = \Omega(1/\epsilon^{\eta})$ 일 때, 1차 최적성 조건에 대한 $\epsilon$-해 또는 2차 최적성 조건에 대한 $\epsilon$-해는 $\mathcal{O}(1/\epsilon^{2-\eta})$ 번의 외부 반복 안에 달성되며, 이는 뉴턴-CG 하위문제 해법을 사용할 경우에 해당한다. 여기서 $\eta \in [0,2]$ 는 1차 경우, $\eta \in [1,2]$ 는 2차 경우에 해당한다.

ABSTRACT

We analyze worst-case complexity of a Proximal augmented Lagrangian (Proximal AL) framework for nonconvex optimization with nonlinear equality constraints. When an approximate first-order (second-order) optimal point is obtained in the subproblem, an $ε$ first-order (second-order) optimal point for the original problem can be guaranteed within $\mathcal{O}(1/ ε^{2 - η})$ outer iterations (where $η$ is a user-defined parameter with $η\in[0,2]$ for the first-order result and $η\in [1,2]$ for the second-order result) when the proximal term coefficient $β$ and penalty parameter $ρ$ satisfy $β= \mathcal{O}(ε^η)$ and $ρ= Ω(1/ε^η)$, respectively. We also investigate the total iteration complexity and operation complexity when a Newton-conjugate-gradient algorithm is used to solve the subproblems. Finally, we discuss an adaptive scheme for determining a value of the parameter $ρ$ that satisfies the requirements of the analysis.

연구 동기 및 목표

  • 비볼록 최적화 문제에 비선형 등식 제약 조건이 있을 때 Proximal Augmented Lagrangian 프레임워크의 최악의 경우 반복 복잡도를 분석하는 것.
  • $\epsilon$-1차 최적성 조건 및 $\epsilon$-2차 최적성 조건을 달성하기 위한 수렴 속도를 확립하는 것.
  • 하위문제를 뉴턴-CG 알고리즘으로 풀었을 때의 총 반복 및 연산 복잡도를 조사하는 것.
  • $\epsilon$ 를 사전에 알지 못하는 상황에서도 복잡도 범위를 유지하면서 페널티 매개수 $\rho$ 를 적응적으로 업데이트하는 전략을 개발하는 것.

제안 방법

  • Proximal AL 프레임워크는 이차 페널티 항이 포함된 Proximal 증강 라그랑주 하위문제를 반복적으로 최소화하여 원래의 비볼록 문제를 해결한다.
  • 이 방법은 근사적인 하위문제 해를 통해 근본 변수 $x$ 를 갱신하고, 투영을 포함한 경사상승법을 통해 이중 변수 $\lambda$ 를 갱신하는 방식으로 번갈아가며 수행된다.
  • 하위문제는 뉴턴-CG 알고리즘을 사용하여 해결되며, 정확도 요구사항과 문제 파라미터에 따라 반복 횟수를 조정한다.
  • 하위문제 목적함수의 충분한 감소를 보장하기 위해 백트래킹 선 탐색 전략을 사용하며, 미립수 함수를 통해 수렴 여부를 모니터링한다.
  • 적응 전략은 외부 반복 과정에서 $\rho$ 를 동적으로 증가시키고 하위문제 정확도 임계값 $\epsilon$ 을 조정함으로써 $\rho = \Omega(1/\epsilon^{\eta})$ 와 $\beta = \mathcal{O}(\epsilon^{\eta})$ 를 유지한다.
  • 이론적 경계는 그래디언트와 헤시안의 리프시츠 연속성, 제약 함수의 유계성, 증강 라그랑주 함수의 헤시안의 정정규성 등의 가정을 기반으로 유도된다.

실험 결과

연구 질문

  • RQ1하위문제를 근사적으로 풀었을 때 Proximal AL 방법의 최악의 경우 외부 반복 복잡도는 무엇인가?
  • RQ2Proximal 매개수 $\beta$ 와 페널티 매개수 $\rho$ 의 선택이 $\epsilon$-1차 또는 $\epsilon$-2차 최적성 조건에 수렴하는 데 어떻게 영향을 미치는가?
  • RQ3적응형 $\rho$ 전략이 $\rho$ 가 사전에 알려져 있을 때와 동일한 복잡도 경계를 유지할 수 있는가?
  • RQ4뉴턴-CG로 하위문제를 풀었을 때의 총 반복 복잡도는 무엇이며, $\epsilon$ 에 따라 어떻게 척도가 변하는가?
  • RQ5$\epsilon$-최적성을 달성하기 위해 필요한 헤시안-벡터 곱의 연산 복잡도는 어떻게 되는가?

주요 결과

  • 1차 최적성 조건에 대한 $\epsilon$-해는 $\beta = \mathcal{O}(\epsilon^{\eta})$ 이고 $\rho = \Omega(1/\epsilon^{\eta})$ 일 때, $\eta \in [0,2]$ 를 만족하는 경우 $\mathcal{O}(1/\epsilon^{2-\eta})$ 번의 외부 반복 안에 달성된다.
  • 2차 최적성 조건에 대한 $\epsilon$-해는 $\beta = \mathcal{O}(\epsilon^{\eta})$ 이고 $\rho = \Omega(1/\epsilon^{\eta})$ 일 때, $\eta \in [1,2]$ 를 만족하는 경우 $\mathcal{O}(1/\epsilon^{2-\eta})$ 번의 외부 반복 안에 달성된다.
  • 하위문제를 해결하기 위해 필요한 뉴턴-CG 반복 수는 $\tilde{\mathcal{O}}(\epsilon^{\eta-2})$ 이며, $\rho$ 가 적응적으로 업데이트됨에 따라 로그 인자만 증가할 뿐, $\rho$ 가 사전에 알려져 있을 경우와 비교해 큰 증가가 없다.
  • 적응형 $\rho$ 전략은 $\rho$ 가 사전에 알려져 있을 경우와 비교해 외부 반복 수를 오직 로그 인자 수준으로만 증가시킨다.
  • 연산 복잡도는 헤시안-벡터 곱의 횟수로 제한되며, 동일한 매개수 조건 하에서 $\tilde{\mathcal{O}}(\epsilon^{\eta-2})$ 수준으로 척도가 변한다.
  • 페널티 매개수 $\rho$ 가 반복 과정에서 동적으로 업데이트되더라도, $\epsilon^{\eta}$ 에 상대적으로 필요한 속도로 증가할 경우, 복잡도 경계는 유지된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.