Skip to main content
QUICK REVIEW

[论文解读] Inexact Newton Methods for Stochastic Nonconvex Optimization with Applications to Neural Network Training

Thomas O’Leary-Roseberry, Nick Alger|arXiv (Cornell University)|May 16, 2019
Stochastic Gradient Optimization Techniques参考文献 42被引用 12
一句话总结

本文提出了一种用于深度学习中非凸优化的随机不精确牛顿方法,通过使用采样 Hessian 矩阵和梯度近似,并结合 Krylov 求解器来高效求解牛顿系统。实验表明,这些方法收敛更快、泛化能力更强,并在 MNIST 和 CIFAR10 自编码器训练中优于 Adam 等一阶方法,尤其当 Hessian 特征值谱聚类存在时表现更优。

ABSTRACT

We study stochastic inexact Newton methods and consider their application in nonconvex settings. Building on the work of [R. Bollapragada, R. H. Byrd, and J. Nocedal, IMA Journal of Numerical Analysis, 39 (2018), pp. 545--578] we derive bounds for convergence rates in expected value for stochastic low rank Newton methods, and stochastic inexact Newton Krylov methods. These bounds quantify the errors incurred in subsampling the Hessian and gradient, as well as in approximating the Newton linear solve, and in choosing regularization and step length parameters. We deploy these methods in training convolutional autoencoders for the MNIST and CIFAR10 data sets. Numerical results demonstrate that, relative to first order methods, these stochastic inexact Newton methods often converge faster, are more cost-effective, and generalize better.

研究动机与目标

  • 开发适用于深度学习中大规模非凸问题的高效二阶优化方法。
  • 分析在采样和不精确求解条件下,随机不精确牛顿方法的收敛速率。
  • 评估这些方法在神经网络训练中的性能,包括收敛速度、泛化能力和鲁棒性。
  • 研究 Hessian 批大小和谱聚类对优化性能的影响。

提出的方法

  • 本文采用随机低秩 Hessian 近似以降低牛顿型方法的计算成本。
  • 使用不精确的 Krylov 子空间方法(GMRES、MINRES)求解牛顿系统,而无需显式构造 Hessian 矩阵。
  • 引入正则化和线搜索策略,以确保在非凸设置下的下降性和稳定性。
  • 通过伴随方法结合采样梯度和 Hessian-向量乘积,将每轮迭代的复杂度保持在 $O(dN_X)$。
  • 采用无鞍点牛顿(SFN)变体,利用负曲率方向来逃离鞍点。
  • 该方法在基于 TensorFlow 的 Python 库中实现,支持可扩展的二阶优化。

实验结果

研究问题

  • RQ1梯度和 Hessian 估计中的采样误差如何影响随机不精确牛顿方法的收敛性?
  • RQ2在非凸问题中,有限 Hessian-向量乘积下,不精确 Krylov 求解器能否有效近似牛顿步长?
  • RQ3Hessian 的谱聚类如何影响不精确牛顿方法在深度学习中的性能?
  • RQ4在图像重建任务中,随机不精确牛顿方法是否比 Adam 和 SGD 等一阶方法具有更好的泛化能力?
  • RQ5在实现快速收敛和良好泛化性能的前提下,Hessian 批大小与计算成本之间应如何达到最优平衡?

主要发现

  • 不精确牛顿 Krylov 方法(INGMRES、INMINRES)在 CIFAR10 上实现了最佳泛化性能,测试损失低于 Adam 和 SGD。
  • 对于固定步长,完全随机的 LRSFN 方法在 CIFAR10 上达到了最低的训练误差,尽管其过拟合程度高于基于 Krylov 的变体。
  • 在 MNIST 上,INCG 和 INGMRES 方法收敛更快且测试误差低于梯度下降和 Adam。
  • Hessian 批大小显著影响性能:信息过少导致过拟合,信息过多则增加计算负担。
  • 实验中观察到 Hessian 的谱聚类现象,这解释了基于 Krylov 的方法因能有效利用此类结构而表现更优。
  • LRSFN 在线搜索下表现欠佳,因其对步长选择敏感;而采用固定步长的半随机变体则展现出更高的稳定性和性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。