[论文解读] A systematic approach to general higher-order majorization-minimization algorithms for (non)convex optimization
本文提出了一种通用的高阶一致逼近-最小化(GHOM)框架,通过迭代最小化上界目标函数且误差受控的高阶代理函数,来求解非凸和非光滑优化问题。主要贡献在于:对于凸问题,提供了全局次线性收敛速率的保证;在一致凸性或Kurdyka-Łojasiewicz(KL)性质条件下,实现了局部超线性收敛速率;并恢复了已知的一阶与高阶方法的收敛边界。
Majorization-minimization algorithms consist of successively minimizing a sequence of upper bounds of the objective function so that along the iterations the objective function decreases. Such a simple principle allows to solve a large class of optimization problems, even nonconvex and nonsmooth. We propose a general higher-order majorization-minimization algorithmic framework for minimizing an objective function that admits an approximation (surrogate) such that the corresponding error function has a higher-order Lipschitz continuous derivative. We present convergence guarantees for our new method for general optimization problems with (non)convex and/or (non)smooth objective function. For convex (possibly nonsmooth) problems we provide global sublinear convergence rates, while for problems with uniformly convex objective function we obtain locally faster superlinear convergence rates. We also prove global stationary point guarantees for general nonconvex (possibly nonsmooth) problems and under Kurdyka-Lojasiewicz property of the objective function we derive local convergence rates ranging from sublinear to superlinear for our majorization-minimization algorithm. Moreover, for unconstrained nonconvex problems we derive convergence rates in terms of first- and second-order optimality conditions.
研究动机与目标
- 开发一种统一的算法框架,适用于一般(非)凸与(非)光滑优化问题的高阶一致逼近-最小化方法。
- 为具有非光滑或一致凸目标函数的凸问题,建立全局收敛速率。
- 为非凸问题提供全局渐近收敛至驻点的保证,并在Kurdyka-Łojasiewicz(KL)性质下提供局部收敛速率。
- 推导无约束非凸问题中,基于一阶与二阶最优性条件的收敛速率。
- 将现有张量方法与一阶方法的已知复杂度边界作为本框架的特例予以恢复。
提出的方法
- 该方法构造一个高阶代理函数,其对目标函数实现一致逼近,且误差函数具有p阶Lipschitz连续导数。
- 在每次迭代中,算法利用p阶导数构建目标函数的局部泰勒型模型,并引入基于误差函数p阶导数Lipschitz常数的惩罚项。
- 代理函数满足三个关键性质:对目标函数的一致逼近性、误差的p阶光滑性,以及在当前迭代点处与目标函数及其前p阶导数完全一致。
- 通过非凸优化中的工具(如Kurdyka-Łojasiewicz不等式和一致凸性假设)分析收敛性。
- 该框架通过统一的抽象化,将一阶方法(如邻近梯度)与高阶张量方法的收敛性分析统一起来。
- 通过定制化的代理函数构造,将该算法应用于各类问题类别,包括复合凸问题、无约束非凸问题以及具有简单约束的问题。
实验结果
研究问题
- RQ1能否构建一个统一的高阶一致逼近-最小化框架,以推广现有的一阶与高阶方法,适用于(非)凸与(非)光滑问题?
- RQ2对于具有非光滑或一致凸目标函数的凸问题,GHOM算法的收敛速率可保证为何种形式?
- RQ3在何种条件下,GHOM算法能对非凸问题实现全局收敛至驻点?
- RQ4在Kurdyka-Łojasiewicz(KL)性质下,局部收敛速率如何表现?其对KL参数的依赖关系为何?
- RQ5GHOM框架能否恢复特定问题类(如邻近梯度或张量方法所解决的问题)的已知收敛边界?
主要发现
- 对于凸(可能非光滑)问题,GHOM算法在目标函数值上实现全局次线性收敛速率,阶为$\mathcal{O}(k^{-p})$。
- 对于一致凸问题,GHOM算法在目标函数值与迭代点到最优解距离上均实现局部超线性收敛。
- 对于一般非凸(可能非光滑)问题,该算法确保全局渐近收敛至驻点,且$\min_{i=1:k} S(x_i) = \mathcal{O}(k^{-\frac{p}{p+1}})$,其中$S(x)$为次梯度范数。
- 在Kurdyka-Łojasiewicz(KL)性质下,局部收敛速率范围从次线性到超线性不等,且具有显式速率表征。
- 对于光滑无约束非凸问题,GHOM算法在第一阶与第二阶最优性条件上均实现次线性收敛。
- 该框架恢复了$ p=1 $时的已知收敛边界(如邻近梯度与高斯-牛顿法),并将其推广至$ p>1 $,为此前未被分析的问题类别提供了新结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。