Skip to main content
QUICK REVIEW

[论文解读] A FISTA-type accelerated gradient algorithm for solving smooth nonconvex composite optimization problems

Jiaming Liang, Renato D. C. Monteiro|arXiv (Cornell University)|May 16, 2019
Sparse and Compressive Sensing Techniques参考文献 27被引用 6
一句话总结

本文提出了两种用于求解光滑非凸复合优化问题的加速复合梯度(ACG)变体,将FISTA扩展至非凸设置。第一种变体需要一个曲率对 (M, m),但在凸情况下退化为FISTA;第二种变体可处理任意 (M, m) 输入,实现了更好的或相当的迭代复杂度,尤其当 M 小于真实值 M̄ 时,表现出显著的实证性能提升,且每轮迭代仅需一次近端算子评估(除对数有界异常情况外)。

ABSTRACT

In this paper, we describe and establish iteration-complexity of two accelerated composite gradient (ACG) variants to solve a smooth nonconvex composite optimization problem whose objective function is the sum of a nonconvex differentiable function $ f $ with a Lipschitz continuous gradient and a simple nonsmooth closed convex function $ h $. When $f$ is convex, the first ACG variant reduces to the well-known FISTA for a specific choice of the input, and hence the first one can be viewed as a natural extension of the latter one to the nonconvex setting. The first variant requires an input pair $(M,m)$ such that $f$ is $m$-weakly convex, $ abla f$ is $M$-Lipschitz continuous, and $m \le M$ (possibly $m

研究动机与目标

  • 本文旨在将FISTA扩展至非凸设置,同时保证收敛性和迭代复杂度。
  • 解决现有ACG方法中需要准确曲率对 (M, m) 的挑战,此类参数通常难以估计。
  • 第二种子方法设计为可处理任意 (M, m) 输入,提升鲁棒性和性能。
  • 目标包括建立与现有方法相当或更优的迭代复杂度边界,尤其在 m ∈ [m̄, M̄] 时。
  • 通过在非凸问题(包括非负矩阵分解)上的数值验证,展示实际效率。

提出的方法

  • 第一种子方法通过使用满足 m-弱凸性和 M--Lipschitz 梯度的曲率对 (M, m) 的动量更新,将FISTA扩展至非凸问题。
  • 第二种方法 ADAP-NC-FISTA 动态调整参数,无需 (M, m) 满足 (2) 和 (4),从而实现对参数估计不佳的鲁棒性。
  • 两种方法每轮迭代均仅执行一次 h 的近端算子评估,除对数有界数量的异常情况外。
  • 算法采用类似线搜索的回溯策略,以确保目标函数的充分下降。
  • 方法引入非单调线搜索,以改善在非凸景观下的收敛行为。
  • 理论分析建立了形如 O(M̄d₀²/ρ² + (Md₀/ρ)²ᐟ³ + M̄m̄Dₕ²/ρ²) 的迭代复杂度边界,在某些情形下优于先前工作。

实验结果

研究问题

  • RQ1能否在保持迭代复杂度保证的前提下,将FISTA风格加速扩展至非凸复合问题?
  • RQ2当输入曲率对 (M, m) 不够理想或估计不佳时,所提出的第二种ACG变体是否仍能保持或改进复杂度边界?
  • RQ3该方法能否在每轮迭代中仅执行一次近端算子评估,同时确保非凸设置下的全局收敛与加速?
  • RQ4在非负矩阵分解等实际应用中,新ACG变体的性能与现有方法(如ANLS)相比如何?
  • RQ5选择 M < M̄ 对第二种变体的实际性能有何影响?

主要发现

  • 第二种ACG变体 ADAP-NC-FISTA 的迭代复杂度不劣于第一种子方法,且在某些情况下更优,尤其当 M 小于真实值 M̄ 时。
  • 当 m ∈ [m̄, M̄] 时,第二种变体的复杂度表现与第一种子方法在 M = M̄ 时相似,表明对输入选择具有鲁棒性。
  • 在非负矩阵分解(NMF)中,AD 方法在 28 次迭代和 4.6 秒内达到函数值 2.80×10⁹,而 ANLS 需要 1000 次迭代和 137.6 秒。
  • AD 方法在 4.6 秒内达到相对残差 10⁻⁷,展示了更优的收敛速度。
  • 第二种变体在除对数有界数量迭代外,每轮仅执行一次近端算子评估,确保计算效率。
  • 计算结果表明,使用显著小于 M̄ 的 M 值可显著提升性能,验证了自适应方法的实际优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。