[论文解读] A FISTA-type accelerated gradient algorithm for solving smooth nonconvex composite optimization problems
本文提出了两种用于求解光滑非凸复合优化问题的加速复合梯度(ACG)变体,将FISTA扩展至非凸设置。第一种变体需要一个曲率对 (M, m),但在凸情况下退化为FISTA;第二种变体可处理任意 (M, m) 输入,实现了更好的或相当的迭代复杂度,尤其当 M 小于真实值 M̄ 时,表现出显著的实证性能提升,且每轮迭代仅需一次近端算子评估(除对数有界异常情况外)。
In this paper, we describe and establish iteration-complexity of two accelerated composite gradient (ACG) variants to solve a smooth nonconvex composite optimization problem whose objective function is the sum of a nonconvex differentiable function $ f $ with a Lipschitz continuous gradient and a simple nonsmooth closed convex function $ h $. When $f$ is convex, the first ACG variant reduces to the well-known FISTA for a specific choice of the input, and hence the first one can be viewed as a natural extension of the latter one to the nonconvex setting. The first variant requires an input pair $(M,m)$ such that $f$ is $m$-weakly convex, $ abla f$ is $M$-Lipschitz continuous, and $m \le M$ (possibly $m
研究动机与目标
- 本文旨在将FISTA扩展至非凸设置,同时保证收敛性和迭代复杂度。
- 解决现有ACG方法中需要准确曲率对 (M, m) 的挑战,此类参数通常难以估计。
- 第二种子方法设计为可处理任意 (M, m) 输入,提升鲁棒性和性能。
- 目标包括建立与现有方法相当或更优的迭代复杂度边界,尤其在 m ∈ [m̄, M̄] 时。
- 通过在非凸问题(包括非负矩阵分解)上的数值验证,展示实际效率。
提出的方法
- 第一种子方法通过使用满足 m-弱凸性和 M--Lipschitz 梯度的曲率对 (M, m) 的动量更新,将FISTA扩展至非凸问题。
- 第二种方法 ADAP-NC-FISTA 动态调整参数,无需 (M, m) 满足 (2) 和 (4),从而实现对参数估计不佳的鲁棒性。
- 两种方法每轮迭代均仅执行一次 h 的近端算子评估,除对数有界数量的异常情况外。
- 算法采用类似线搜索的回溯策略,以确保目标函数的充分下降。
- 方法引入非单调线搜索,以改善在非凸景观下的收敛行为。
- 理论分析建立了形如 O(M̄d₀²/ρ² + (Md₀/ρ)²ᐟ³ + M̄m̄Dₕ²/ρ²) 的迭代复杂度边界,在某些情形下优于先前工作。
实验结果
研究问题
- RQ1能否在保持迭代复杂度保证的前提下,将FISTA风格加速扩展至非凸复合问题?
- RQ2当输入曲率对 (M, m) 不够理想或估计不佳时,所提出的第二种ACG变体是否仍能保持或改进复杂度边界?
- RQ3该方法能否在每轮迭代中仅执行一次近端算子评估,同时确保非凸设置下的全局收敛与加速?
- RQ4在非负矩阵分解等实际应用中,新ACG变体的性能与现有方法(如ANLS)相比如何?
- RQ5选择 M < M̄ 对第二种变体的实际性能有何影响?
主要发现
- 第二种ACG变体 ADAP-NC-FISTA 的迭代复杂度不劣于第一种子方法,且在某些情况下更优,尤其当 M 小于真实值 M̄ 时。
- 当 m ∈ [m̄, M̄] 时,第二种变体的复杂度表现与第一种子方法在 M = M̄ 时相似,表明对输入选择具有鲁棒性。
- 在非负矩阵分解(NMF)中,AD 方法在 28 次迭代和 4.6 秒内达到函数值 2.80×10⁹,而 ANLS 需要 1000 次迭代和 137.6 秒。
- AD 方法在 4.6 秒内达到相对残差 10⁻⁷,展示了更优的收敛速度。
- 第二种变体在除对数有界数量迭代外,每轮仅执行一次近端算子评估,确保计算效率。
- 计算结果表明,使用显著小于 M̄ 的 M 值可显著提升性能,验证了自适应方法的实际优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。