Skip to main content
QUICK REVIEW

[论文解读] Evaluation complexity bounds for smooth constrained nonlinear optimisation using scaled KKT conditions, high-order models and the criticality measure $χ$

Coralia Cartis, Nicholas I. M. Gould|arXiv (Cornell University)|May 13, 2017
Advanced Optimization Algorithms Research参考文献 6被引用 4
一句话总结

本文通过使用高阶模型和缩放的Karush-Kuhn-Tucker(KKT)条件,建立了求解光滑约束非线性优化问题的更优最坏情况评估复杂度界。在弱于以往工作的假设下,证明了找到一个$\epsilon$-近似缩放的一阶临界点仅需$O(\rho^{-1/p}\rho_{\text{D}}^{-(p+1)/p})$次目标函数和导数评估。该结果推广了凸与非凸情形下的先前成果。

ABSTRACT

Evaluation complexity for convexly constrained optimization is considered and it is shown first that the complexity bound of $O(ε^{-3/2})$ proved by Cartis, Gould and Toint (IMAJNA 32(4) 2012, pp.1662-1695) for computing an $ε$-approximate first-order critical point can be obtained under significantly weaker assumptions. Moreover, the result is generalized to the case where high-order derivatives are used, resulting in a bound of $O(ε^{-(p+1)/p})$ evaluations whenever derivatives of order $p$ are available. It is also shown that the bound of $O(ε_P^{-1/2}ε_D^{-3/2})$ evaluations ($ε_P$ and $ε_D$ being primal and dual accuracy thresholds) suggested by Cartis, Gould and Toint (SINUM, 2015) for the general nonconvex case involving both equality and inequality constraints can be generalized to a bound of $O(ε_P^{-1/p}ε_D^{-(p+1)/p})$ evaluations under similarly weakened assumptions. This paper is variant of a companion report (NTR-11-2015, University of Namur, Belgium) which uses a different first-order criticality measure to obtain the same complexity bounds.

研究动机与目标

  • 在弱于以往工作的假设下,建立约束非线性优化问题的更紧致最坏情况评估复杂度界。
  • 将一阶临界点的复杂度界$O(\epsilon^{-3/2})$推广至$ p $阶导数,得到$O(\epsilon^{-(p+1)/p})$次评估。
  • 将非凸问题的复杂度界$O(\epsilon_{\text{P}}^{-1/2}\epsilon_{\text{D}}^{-3/2})$推广至高阶导数与缩放KKT条件,得到$O(\epsilon_{\text{P}}^{-1/p}\epsilon_{\text{D}}^{-(p+1)/p})$。
  • 通过引入高阶模型与临界性度量,强化不精确恢复与信赖域方法的理论基础。
  • 证明临界性度量$\chi$的使用可在保持评估复杂度界的同时,提供更强的收敛保证。

提出的方法

  • 本文提出一种基于拉格朗日函数梯度范数与约束违反度的临界性度量$\chi$,并按拉格朗日乘子的大小进行缩放。
  • 对目标函数与约束函数采用$ p $阶高阶泰勒模型,假设函数$ p $次连续可微且$ p $阶导数满足Lipschitz连续性。
  • 分析采用缩放的KKT条件,其中原始与对偶的不可行性分别相对于拉格朗日乘子大小与约束违反度进行度量。
  • 考虑两阶段算法:第一阶段最小化不可行性$\|c(x)\|$,第二阶段使用高阶模型最小化一个增广函数。
  • 通过统计为达到$\epsilon_{\text{P}}$-原始精度与$\epsilon_{\text{D}}$-对偶精度所需的目标函数与约束函数/导数评估次数,来界定评估复杂度。
  • 临界性度量$\chi$被用于定义对缩放不变且对退化具有鲁棒性的终止准则。

实验结果

研究问题

  • RQ1能否在弱于以往要求的假设下,实现寻找$\epsilon$-近似一阶临界点的评估复杂度界$O(\epsilon^{-3/2})$?
  • RQ2当使用$ p $阶高阶模型时,最坏情况评估复杂度是多少?其与$\epsilon$的依赖关系如何?
  • RQ3能否将非凸问题的复杂度界$O(\epsilon_{\text{P}}^{-1/2}\epsilon_{\text{D}}^{-3/2})$推广至高阶导数与缩放KKT条件?
  • RQ4临界性度量$\chi$的使用如何提升优化算法的鲁棒性与终止准则?
  • RQ5Łojasiewicz不等式在何种条件下失效?这与算法早期终止有何关联?

主要发现

  • 在较弱假设下,使用$ p $阶导数时,凸约束问题中寻找$\epsilon$-近似一阶临界点的评估复杂度为$O(\epsilon^{-(p+1)/p})$,优于以往结果。
  • 对于同时包含等式与不等式约束的一般非线性约束问题,评估复杂度被限制在$O(\epsilon_{\text{P}}^{-1/p}\epsilon_{\text{D}}^{-(p+1)/p})$,优于先前的$O(\epsilon_{\text{P}}^{-1/2}\epsilon_{\text{D}}^{-3/2})$界。
  • 该复杂度界在假设条件上严格弱于以往工作,例如无需迭代点的统一有界性,且对子问题解的条件也更宽松。
  • 通过拉格朗日函数梯度范数与约束违反度定义的临界性度量$\chi$,可实现鲁棒且缩放不变的终止准则。
  • 该框架表明,若Łojasiewicz不等式成立(对光滑函数通常成立),则在不可行点处终止的可能性极低,意味着此类点在实践中通常不是早期终止。
  • 结果对退化具有鲁棒性,且与Birgin等人提出的算法框架中的终止行为一致,同时提供了更强的理论保证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。