Skip to main content
QUICK REVIEW

[论文解读] Efficient Subsampled Gauss-Newton and Natural Gradient Methods for Training Neural Networks

Yi Ren, Donald Goldfarb|arXiv (Cornell University)|Jun 5, 2019
Neural Networks and Applications参考文献 21被引用 12
一句话总结

该论文提出了一种高效的子采样高斯-牛顿(SMW-GN)和自然梯度(SMW-NG)方法,用于使用Levenberg-Marquardt阻尼和通过自动微分的Sherman-Morrison-Woodbury公式训练深度神经网络。该方法实现了快速的二阶信息优化,计算成本与一阶方法相当,半随机变体可收敛至驻点,并在无需超参数调优的情况下,训练速度和泛化性能优于SGD、Hessian-free和KFAC方法。

ABSTRACT

We present practical Levenberg-Marquardt variants of Gauss-Newton and natural gradient methods for solving non-convex optimization problems that arise in training deep neural networks involving enormous numbers of variables and huge data sets. Our methods use subsampled Gauss-Newton or Fisher information matrices and either subsampled gradient estimates (fully stochastic) or full gradients (semi-stochastic), which, in the latter case, we prove convergent to a stationary point. By using the Sherman-Morrison-Woodbury formula with automatic differentiation (backpropagation) we show how our methods can be implemented to perform efficiently. Finally, numerical results are presented to demonstrate the effectiveness of our proposed methods.

研究动机与目标

  • 开发适用于深度神经网络的二阶优化方法,结合部分Hessian信息的同时保持计算效率。
  • 通过使用子采样高斯-牛顿和Fisher信息矩阵,解决大规模深度学习中完整Hessian矩阵求逆的高计算成本问题。
  • 设计结合二阶方法曲率感知优势与随机优化可扩展性的算法。
  • 证明使用全梯度与小批量Hessian近似的小批量变体的收敛性。
  • 在无需学习率调优的情况下,证明所提方法在训练速度、损失减少和泛化性能方面优于SGD、Hessian-free和KFAC方法。

提出的方法

  • 该方法在子采样高斯-牛顿或Fisher信息矩阵中添加Levenberg-Marquardt阻尼项以稳定优化过程。
  • 利用Sherman-Morrison-Woodbury公式,通过自动微分(反向传播)高效地求逆阻尼后的Hessian近似矩阵。
  • 通过利用高斯-牛顿和Fisher矩阵中的Kronecker分解结构,实现矩阵构造与求逆的O(n)时间复杂度。
  • 半随机变体结合全梯度与小批量Hessian近似,已被证明可收敛至驻点。
  • 完全随机版本仅使用子采样梯度与Hessian近似,实现快速自适应更新,无需参数调优。
  • 通过并行化涉及对角矩阵$ D_t $的项的计算,高效实现该算法,使二阶计算成本与梯度计算相当。

实验结果

研究问题

  • RQ1子采样高斯-牛顿与自然梯度方法是否能在计算成本与一阶方法相当的情况下,实现在深度学习中的快速收敛?
  • RQ2如何在不求逆完整Hessian矩阵的前提下,高效地将二阶曲率信息融入大规模神经网络训练?
  • RQ3对于使用全梯度与小批量Hessian近似的半随机变体,可建立何种收敛性保证?
  • RQ4在实际应用中,这些方法在训练速度、损失减少和泛化性能方面与SGD、Hessian-free和KFAC相比表现如何?
  • RQ5所提方法是否能消除对人工学习率调优的需求,同时保持或提升性能?

主要发现

  • SMW-GN方法在所有测试数据集上,无论在训练轮次还是时钟时间方面,均持续优于Hessian-free(HF)方法。
  • SMW-GN在学习率设置保守时,收敛速度显著快于SGD,且在无需任何超参数调优的情况下表现具有竞争力。
  • 在CIFAR-10数据集上,KFAC在宽层网络中显著变慢,而SMW-GN保持了稳定的性能。
  • 在MNIST数据集上,SMW-GN即使使用固定的0.1学习率,也能比SGD更快达到更低的训练损失,表现出强鲁棒性。
  • 经过仔细的学习率调优后,SGD可在MNIST上与二阶方法表现相当,但SMW-GN在无需调优的情况下实现了相似或更优的结果。
  • SMW-GN与SMW-NG的半随机变体被证明可收敛至驻点,为实际应用提供了理论保证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。