Skip to main content
QUICK REVIEW

[论文解读] Stochastic Newton and Cubic Newton Methods with Simple Local Linear-Quadratic Rates

Dmitry Kovalev, Konstantin Mishchenko|arXiv (Cornell University)|Dec 3, 2019
Stochastic Gradient Optimization Techniques参考文献 44被引用 16
一句话总结

本文提出了两种新颖的随机二阶方法——随机牛顿法(Stochastic Newton, SN)与随机三次牛顿法(Stochastic Cubic Newton, SCN),通过每轮迭代仅计算一次梯度与海森矩阵,实现了局部线性-二次收敛,且无需无偏估计或大批次大小。与以往方法不同,它们在存在有偏更新的情况下,仍能比一阶方法收敛更快,并自适应问题的曲率,通过为二阶随机优化量身定制的新李雅普诺夫函数实现。

ABSTRACT

We present two new remarkably simple stochastic second-order methods for minimizing the average of a very large number of sufficiently smooth and strongly convex functions. The first is a stochastic variant of Newton's method (SN), and the second is a stochastic variant of cubically regularized Newton's method (SCN). We establish local linear-quadratic convergence results. Unlike existing stochastic variants of second order methods, which require the evaluation of a large number of gradients and/or Hessians in each iteration to guarantee convergence, our methods do not have this shortcoming. For instance, the simplest variants of our methods in each iteration need to compute the gradient and Hessian of a {\em single} randomly selected function only. In contrast to most existing stochastic Newton and quasi-Newton methods, our approach guarantees local convergence faster than with first-order oracle and adapts to the problem's curvature. Interestingly, our method is not unbiased, so our theory provides new intuition for designing new stochastic methods.

研究动机与目标

  • 开发一种无需大批次大小或无偏梯度/海森矩阵估计的随机二阶方法,实现快速局部收敛。
  • 解决现有随机牛顿方法依赖高方差或有偏近似导致收敛性能差的局限性。
  • 设计一种能自适应问题曲率的算法,在局部区域内收敛速度超越一阶方法。
  • 为有意引入有偏性的方法建立收敛性保证,挑战二阶优化中对无偏随机估计的传统依赖。

提出的方法

  • 提出一种随机牛顿方法(SN),每轮迭代仅基于随机选取的一个函数的梯度与海森矩阵更新迭代点。
  • 引入一种随机三次牛顿方法(SCN),通过引入三次正则化项以确保局部收敛性与稳定性。
  • 采用专为二阶方法设计的新李雅普诺夫函数构造方法,证明在有偏更新下仍能实现局部线性-二次收敛。
  • 使用邻近子问题求解器处理三次正则化项,通过闭式邻近算子实现高效计算。
  • 设计更新规则简洁且可扩展,每轮迭代仅需一个函数的梯度与海森矩阵,与函数总数 n 无关。
  • 自适应调整三次正则化参数 M,表明该随机方法在小于确定性方法所需 M 值时仍能收敛。

实验结果

研究问题

  • RQ1能否在每轮迭代仅评估一次梯度与海森矩阵的前提下,使随机二阶方法实现局部线性-二次收敛?
  • RQ2为何有偏的随机更新在二阶方法中仍能实现收敛?其理论依据为何?
  • RQ3在不依赖方差减少或大批次大小的前提下,随机牛顿方法的收敛速度能否在局部区域内超越一阶方法?
  • RQ4在正则化需求与收敛速度方面,随机三次牛顿法相较于其确定性对应方法表现如何?
  • RQ5分析有偏随机二阶方法需要哪些新型李雅普诺夫函数?它们与一阶设置中使用的函数有何不同?

主要发现

  • 所提出的随机牛顿法(SN)与随机三次牛顿法(SCN)实现了局部线性-二次收敛速率,在局部区域内优于一阶方法。
  • 与大多数随机二阶方法不同,SN 与 SCN 每轮迭代仅需一次梯度与海森矩阵评估,避免了对大批次大小的需求。
  • 尽管方法是故意有偏的,但通过专为二阶随机优化设计的新李雅普诺夫函数,仍能实现收敛。
  • SCN 在远小于确定性三次牛顿法所需的三次正则化参数 M 下实现收敛,表明其具有更高的鲁棒性与效率。
  • 在逻辑回归上的实验结果表明,当初始点远离最优解时,SCN 在病态条件问题中优于确定性三次牛顿法。
  • 即使在批次大小为 1 时,该方法仍保持有效性,展示了在其他随机二阶方法因高方差或偏差而失效的场景下的实际可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。