Skip to main content
QUICK REVIEW

[论文解读] Second-Order Methods with Cubic Regularization Under Inexact Information

Saeed Ghadimi, Han Liu|arXiv (Cornell University)|Oct 16, 2017
Sparse and Compressive Sensing Techniques参考文献 11被引用 20
一句话总结

本文提出了一种带有立方正则化的不精确二阶方法用于凸优化,通过使用近似海森矩阵来降低计算成本。在对海森矩阵近似误差施加温和假设的条件下,该方法实现了与最优一阶方法相当的全局收敛迭代复杂度,且数值结果表明,尽管理论界限劣于精确方法,不精确海森矩阵仍能显著加速实际性能。

ABSTRACT

In this paper, we generalize (accelerated) Newton's method with cubic regularization under inexact second-order information for (strongly) convex optimization problems. Under mild assumptions, we provide global rate of convergence of these methods and show the explicit dependence of the rate of convergence on the problem parameters. While the complexity bounds of our presented algorithms are theoretically worse than those of their exact counterparts, they are at least as good as those of the optimal first-order methods. Our numerical experiments also show that using inexact Hessians can significantly speed up the algorithms in practice.

研究动机与目标

  • 开发高效的二阶优化方法,以降低牛顿型方法中精确海森矩阵计算的高成本。
  • 将带有立方正则化的加速牛顿方法推广至海森矩阵信息不精确的场景。
  • 在对海森矩阵近似误差和海森矩阵光滑性施加温和假设的条件下,建立全局收敛速率。
  • 证明尽管理论复杂度界劣于精确方法,使用不精确海森矩阵近似可在实际中实现更快收敛。
  • 为在不精确二阶信息下(强)凸问题提供迭代复杂度和收敛速率的理论保证。

提出的方法

  • 该方法使用如下形式的子问题:最小化 f(x_k) + ⟨∇f(x_k), x−x_k⟩ + ½⟨H_k(x−x_k), x−x_k⟩ + (η/6)‖x−x_k‖³,其中 H_k 为不精确海森矩阵近似。
  • 假设海森矩阵近似满足误差界 μ_u 和 R,分别表示与真实海森矩阵的最大偏差以及迭代点到最优解的距离。
  • 在海森矩阵 γ-利普希茨连续的假设下进行分析,以保证海森矩阵的光滑性。
  • 通过结合立方正则化与不精确海森信息,推导出收敛速率,其显式依赖于 μ_u、R、γ 和 ε。
  • 通过 Nesterov 风格的动量实现加速,从而为强凸问题提供改进的收敛速率。
  • 子问题通过拉克斯法以高精度求解,海森矩阵近似通过子采样计算以降低计算成本。

实验结果

研究问题

  • RQ1能否将带有立方正则化的牛顿方法推广至使用不精确海森矩阵近似的同时保持全局收敛性?
  • RQ2在有界海森矩阵近似误差下,不精确立方正则化牛顿方法的理论收敛速率为何?
  • RQ3在实际中,不精确方法与精确方法及最优一阶方法的性能相比如何?
  • RQ4尽管理论复杂度界更差,使用子采样海森矩阵近似是否仍能实现更快收敛?
  • RQ5在迭代次数和运行时间方面,海森矩阵近似的最优子样本大小为何?

主要发现

  • 对于凸问题,达到 ε-解所需的总迭代次数被限制在 O(μ_u R² / ε + √(γ R³ / ε)),其复杂度与最优一阶方法相当。
  • 对于强凸问题,带有立方正则化的加速不精确牛顿方法的收敛速率优于标准一阶方法。
  • 在二值分类问题上的数值实验表明,使用 |S_H| = 0.005m 子样本的不精确海森矩阵在 Mushrooms 和 Gisette 数据集上均实现了最佳运行时间性能。
  • 在两个数据集上,INCR 方法在迭代次数和 CPU 时间方面均显著快于加速梯度法(AG)。
  • AINCR 和多阶段 AINCR 变体在迭代次数上优于 INCR,且运行时间相当或略优,表明在不精确海森信息下使用加速具有优势。
  • 尽管理论界表明更大的子样本大小可提高精度,但最佳实际性能却在相对较小的子样本大小(0.005m)下实现,表明过度精确的海森矩阵近似未必提升效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。