Skip to main content
QUICK REVIEW

[论文解读] Optimal and Adaptive Monteiro-Svaiter Acceleration

Yair Carmon, Danielle Hausler|arXiv (Cornell University)|May 30, 2022
Advanced Optimization Algorithms Research被引用 5
一句话总结

本文提出了一种无需二分法的Monteiro-Svaiter加速框架变体,消除了每次迭代中求解隐式方程的需求,实现了具有Lipschitz高阶导数的凸优化问题的最优收敛速率。该方法引入了一种自适应二阶预言机,无需调整Hessian Lipschitz常数,其二阶与一阶实现版本均达到最优复杂度界,仅相差对数因子。

ABSTRACT

We develop a variant of the Monteiro-Svaiter (MS) acceleration framework that removes the need to solve an expensive implicit equation at every iteration. Consequently, for any $p\ge 2$ we improve the complexity of convex optimization with Lipschitz $p$th derivative by a logarithmic factor, matching a lower bound. We also introduce an MS subproblem solver that requires no knowledge of problem parameters, and implement it as either a second- or first-order method by solving linear systems or applying MinRes, respectively. On logistic regression our method outperforms previous second-order momentum methods, but under-performs Newton's method; simply iterating our first-order adaptive subproblem solver performs comparably to L-BFGS.

研究动机与目标

  • 解决Monteiro-Svaiter加速中二分法存在的开放问题,该问题带来对数复杂度并阻碍实际性能。
  • 设计一种自适应二阶预言机,消除对Hessian Lipschitz常数M调优的需求。
  • 实现具有Hölder连续Hessian函数的最优迭代与线性系统求解复杂度,仅相差对数因子。
  • 提供自适应预言机的二阶与一阶实现,达到最优评估复杂度。
  • 通过实证表明,所提方法在逻辑回归任务上优于非自适应方案,并与L-BFGS及牛顿型方法性能相当或更优。

提出的方法

  • 提出一种改进的Monteiro-Svaiter加速框架,通过重新定义近端参数更新方式避免求解隐式方程,从而消除二分法。
  • 引入一种新型自适应预言机aMSN,可在未知Hessian Lipschitz常数的情况下动态调整正则化参数。
  • 每轮预言机调用仅需双对数数量级的线性系统求解,相比先前方法显著降低计算开销。
  • 开发了一阶变体aMSN-fo,利用MinRes近似求解线性系统,并基于理论分析设计自适应停止准则。
  • 在加速框架中引入动量衰减机制,以确保收敛性,尤其在病态条件下表现更优。
  • 将自适应预言机与改进的加速框架结合,实现Hölder连续Hessian函数的最优外层迭代复杂度。

实验结果

研究问题

  • RQ1Monteiro-Svaiter加速框架能否被修改为在消除二分法的同时保持最优收敛速率?
  • RQ2能否设计一种自适应二阶预言机,使其无需对Hessian Lipschitz常数M进行调优?
  • RQ3具有Lipschitz p阶导数的凸优化问题,其二阶与一阶方法的最优评估复杂度是多少?
  • RQ4所提自适应预言机在逻辑回归上的性能与非自适应方案及L-BFGS相比如何?
  • RQ5加速框架中的动量衰减机制是否显著提升了收敛稳定性?

主要发现

  • 所提方法对具有ν阶Hölder连续Hessian的函数实现了最优收敛速率O(t^{-(4+3ν)/2}),与已知下界仅相差对数因子。
  • 自适应预言机aMSN每轮调用仅需双对数数量级的线性系统求解,优于先前基于MS方法的对数成本。
  • 一阶实现aMSN-fo在未知梯度Lipschitz常数的情况下,达到最优一阶评估复杂度,仅增加一个对数项。
  • 在逻辑回归任务中,自适应加速方法优于以往的二阶加速方案,并与L-BFGS性能相当。
  • 动量衰减机制对收敛至关重要;若移除该机制,所有测试数据集均出现失败。
  • 在具有Lipschitz Hessian的最坏情况实例中,加速方法实现了预期的O(t^{-7/2})收敛速率,验证了理论优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。