Skip to main content
QUICK REVIEW

[论文解读] Complexity of Proximal augmented Lagrangian for nonconvex optimization with nonlinear equality constraints

Yue Xie, Stephen J. Wright|arXiv (Cornell University)|Jul 31, 2019
Sparse and Compressive Sensing Techniques参考文献 35被引用 5
一句话总结

本文分析了在具有非线性等式约束的非凸优化问题中,近端增广拉格朗日(Proximal AL)方法的最坏情况复杂度。研究结果表明,当近端参数 $\beta = \mathcal{O}(\epsilon^{\eta})$ 且惩罚参数 $\rho = \Omega(1/\epsilon^{\eta})$ 时,使用牛顿-共轭梯度(Newton-CG)子问题求解器,$\epsilon$-一阶(或 $\epsilon$-二阶)最优解可在 $\mathcal{O}(1/\epsilon^{2-\eta})$ 次外层迭代内达到,其中一阶情形下 $\eta \in [0,2]$,二阶情形下 $\eta \in [1,2]$。

ABSTRACT

We analyze worst-case complexity of a Proximal augmented Lagrangian (Proximal AL) framework for nonconvex optimization with nonlinear equality constraints. When an approximate first-order (second-order) optimal point is obtained in the subproblem, an $ε$ first-order (second-order) optimal point for the original problem can be guaranteed within $\mathcal{O}(1/ ε^{2 - η})$ outer iterations (where $η$ is a user-defined parameter with $η\in[0,2]$ for the first-order result and $η\in [1,2]$ for the second-order result) when the proximal term coefficient $β$ and penalty parameter $ρ$ satisfy $β= \mathcal{O}(ε^η)$ and $ρ= Ω(1/ε^η)$, respectively. We also investigate the total iteration complexity and operation complexity when a Newton-conjugate-gradient algorithm is used to solve the subproblems. Finally, we discuss an adaptive scheme for determining a value of the parameter $ρ$ that satisfies the requirements of the analysis.

研究动机与目标

  • 分析具有非线性等式约束的非凸优化问题中近端增广拉格朗日框架的最坏情况迭代复杂度。
  • 建立实现 $\epsilon$-一阶和 $\epsilon$-二阶最优性条件的收敛速率。
  • 研究使用牛顿-共轭梯度算法求解子问题时的总迭代复杂度和操作复杂度。
  • 提出一种无需预先知晓 $\epsilon$ 的惩罚参数 $\rho$ 自适应更新策略,同时保持复杂度界不变。

提出的方法

  • 近端增广拉格朗日框架通过迭代求解带有二次惩罚项的近端增广拉格朗日子问题来解决原始非凸问题。
  • 该方法在通过不精确子问题解更新原始变量 $x$ 和通过带投影的梯度上升法更新对偶变量 $\lambda$ 之间交替进行。
  • 子问题使用牛顿-共轭梯度算法求解,迭代次数根据精度要求和问题参数进行自适应调整。
  • 采用回溯线搜索策略以确保子问题目标函数充分下降,同时通过一个增益函数监控收敛性。
  • 提出一种自适应方案,在外层迭代中动态增加 $\rho$ 并调整子问题精度阈值 $\epsilon$,以保证 $\rho = \Omega(1/\epsilon^{\eta})$ 且 $\beta = \mathcal{O}(\epsilon^{\eta})$。
  • 理论界基于梯度和黑塞矩阵的利普希茨连续性、约束函数的有界性以及增广拉格朗日函数黑塞矩阵的正定性等假设推导得出。

实验结果

研究问题

  • RQ1当子问题被不精确求解时,近端增广拉格朗日方法的最坏情况外层迭代复杂度是多少?
  • RQ2近端参数 $\beta$ 和惩罚参数 $\rho$ 的选择如何影响收敛至 $\epsilon$-一阶或 $\epsilon$-二阶最优性?
  • RQ3能否设计一种 $\rho$ 的自适应方案,使其在复杂度界方面与已知 $\rho$ 的情形保持一致?
  • RQ4使用牛顿-共轭梯度算法求解子问题时,总迭代复杂度是多少?其与 $\epsilon$ 的关系如何?
  • RQ5为达到 $\epsilon$-最优性,所需黑塞向量乘积的运算复杂度是多少?

主要发现

  • 当 $\beta = \mathcal{O}(\epsilon^{\eta})$ 且 $\rho = \Omega(1/\epsilon^{\eta})$ 时,$\epsilon$-一阶最优解可在 $\mathcal{O}(1/\epsilon^{2-\eta})$ 次外层迭代内达到,其中 $\eta \in [0,2]$。
  • 当 $\beta = \mathcal{O}(\epsilon^{\eta})$ 且 $\rho = \Omega(1/\epsilon^{\eta})$ 时,$\epsilon$-二阶最优解可在 $\mathcal{O}(1/\epsilon^{2-\eta})$ 次外层迭代内达到,其中 $\eta \in [1,2]$。
  • 求解子问题所需的牛顿-共轭梯度总迭代次数为 $\tilde{\mathcal{O}}(\epsilon^{\eta-2})$,由于自适应 $\rho$ 的引入,仅带来对数因子的增加,与已知 $\rho$ 的情形相比。
  • $\rho$ 的自适应方案使外层迭代次数相比 $\rho$ 已知的情形仅增加对数因子。
  • 运算复杂度受黑塞向量乘积次数的限制,其规模在相同参数条件下为 $\tilde{\mathcal{O}}(\epsilon^{\eta-2})$。
  • 只要 $\rho$ 的增长速率与 $\epsilon^{\eta}$ 保持所需关系,该框架即使在 $\rho$ 动态更新的情况下也能维持复杂度界。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。