Skip to main content
QUICK REVIEW

[论文解读] Quasi-Newton's method in the class gradient defined high-curvature subspace

Mark Tuddenham, Adam Prügel‐Bennett|arXiv (Cornell University)|Nov 28, 2020
Iterative Methods for Nonlinear Equations参考文献 6被引用 5
一句话总结

本文提出了一种新颖的拟牛顿优化方法,该方法在深度学习中通过类别特定的logit梯度定义的高曲率子空间内应用牛顿型更新。尽管该方法旨在通过利用损失景观中的曲率来加速收敛,但其简单实现被证明会减慢训练过程,表明在高曲率方向上将二阶更新与随机优化相结合存在固有的挑战。

ABSTRACT

Classification problems using deep learning have been shown to have a high-curvature subspace in the loss landscape equal in dimension to the number of classes. Moreover, this subspace corresponds to the subspace spanned by the logit gradients for each class. An obvious strategy to speed up optimisation would be to use Newton's method in the high-curvature subspace and stochastic gradient descent in the co-space. We show that a naive implementation actually slows down convergence and we speculate why this might be.

研究动机与目标

  • 通过利用分类损失景观中的内在高曲率子空间,提升深度学习中的优化效率。
  • 研究在高曲率子空间中结合牛顿型更新与共轭空间中的随机梯度下降是否能加速收敛。
  • 识别在高曲率方向上简单应用二阶方法可能存在的陷阱。
  • 理解一种混合优化策略在类别定义的高曲率子空间中应用拟牛顿更新时的失效机制。

提出的方法

  • 将损失景观中的高曲率子空间识别为每类logit梯度的张成,该方向对应于分类任务中曲率最大的方向。
  • 提出一种混合优化策略:在高曲率子空间中应用拟牛顿更新,在正交补空间中使用随机梯度下降。
  • 利用Hessian矩阵的特征分解来定义曲率方向,其中特征值和特征向量分别表示曲率大小和方向。
  • 仅在类别定义的高曲率子空间内应用拟牛顿近似(例如类似BFGS的更新),以降低计算成本。
  • 采用基于投影的方法,将高曲率子空间与剩余参数空间之间的优化动力学解耦。
  • 实现一种简单版本的混合方法以测试其收敛行为,结果揭示了出人意料的性能下降。

实验结果

研究问题

  • RQ1在类别定义的高曲率子空间中应用拟牛顿更新是否能提升深度学习中的优化速度?
  • RQ2为何一种简单结合拟牛顿与随机梯度下降的混合方法无法加速收敛?
  • RQ3损失景观中的曲率,特别是类别特定子空间中的曲率,如何影响优化算法的收敛性?
  • RQ4是否能在不破坏训练稳定性的前提下,有效利用高维深度学习模型中的二阶信息?
  • RQ5在高曲率子空间中应用牛顿型更新导致观察到的收敛速度下降,其结构或动力学原因是什么?

主要发现

  • 一种简单混合优化策略——在高曲率子空间中应用拟牛顿更新,在共轭空间中使用SGD——相比标准SGD,导致收敛速度更慢。
  • 该失败归因于在高曲率方向上引入的二阶更新不稳定性,可能导致噪声放大或曲率估计错误。
  • 由类别特定logit梯度定义的高曲率子空间被证实是深度神经网络分类任务中损失景观的主导特征。
  • 研究结果表明,除非对损失曲面的几何结构进行仔细调整,否则二阶方法在此背景下并非天然有益。
  • 结果表明,曲率感知优化需要比简单的子空间划分和局部Hessian近似更复杂的处理机制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。