Skip to main content
QUICK REVIEW

[论文解读] Hessian based analysis of SGD for Deep Nets: Dynamics and Generalization

Xinyan Li, Qilong Gu|arXiv (Cornell University)|Jul 24, 2019
Stochastic Gradient Optimization Techniques参考文献 76被引用 6
一句话总结

本文通过Hessian分析研究了深度神经网络中随机梯度下降(SGD)的特性,利用二阶信息将优化动力学与泛化能力联系起来。提出了一种基于截断Hessian的高斯后验的尺度不变泛化界,表明曲率与从初始化的参数偏移共同决定了泛化性能,并在MNIST和CIFAR-10数据集上对不同标签噪声条件下的实验进行了验证。

ABSTRACT

While stochastic gradient descent (SGD) and variants have been surprisingly successful for training deep nets, several aspects of the optimization dynamics and generalization are still not well understood. In this paper, we present new empirical observations and theoretical results on both the optimization dynamics and generalization behavior of SGD for deep nets based on the Hessian of the training loss and associated quantities. We consider three specific research questions: (1) what is the relationship between the Hessian of the loss and the second moment of stochastic gradients (SGs)? (2) how can we characterize the stochastic optimization dynamics of SGD with fixed and adaptive step sizes and diagonal pre-conditioning based on the first and second moments of SGs? and (3) how can we characterize a scale-invariant generalization bound of deep nets based on the Hessian of the loss, which by itself is not scale invariant? We shed light on these three questions using theoretical results supported by extensive empirical observations, with experiments on synthetic data, MNIST, and CIFAR-10, with different batch sizes, and with different difficulty levels by synthetically adding random labels.

研究动机与目标

  • 理解深度网络中训练损失的Hessian与随机梯度(SGs)的二阶矩之间的关系。
  • 利用鞅差序列,理论表征固定步长与自适应步长SGD以及对角预条件下的随机优化动力学。
  • 构建一个在重参数化下保持不变的尺度不变泛化界,利用极小值处的Hessian。
  • 研究在不同数据难度(如随机标签)下,泛化误差与损失曲率及从初始化的参数偏移之间的关联。

提出的方法

  • 通过10,000次独立的SGD训练运行,对损失、梯度和Hessian动力学的完整分布进行经验表征。
  • 分析Hessian的主特征子空间与SGs的二阶矩之间的对齐性,以评估SGD对二阶信息的隐式利用。
  • 使用鞅差序列将SGD动力学建模为随机过程,推导大偏差界和收敛速率。
  • 提出一种基于各向异性高斯后验的PAC-Bayesian泛化界,其精度矩阵由截断Hessian导出。
  • 通过证明在对角参数重参数化下保持不变,建立后验与先验之间KL散度的尺度不变性。
  • 定义两个尺度不变量:基于截断Hessian的有效曲率,以及从初始化的参数偏移的加权Frobenius范数。

实验结果

研究问题

  • RQ1在深度网络中,损失的Hessian与随机梯度的二阶矩之间有何关系?
  • RQ2如何利用鞅差序列理论表征固定步长与自适应步长SGD的动力学?
  • RQ3尽管Hessian本身不具备尺度不变性,能否基于损失的Hessian构造出尺度不变的泛化界?
  • RQ4在标签噪声或问题难度增加时,泛化界中的曲率与参数偏移两个分量如何变化?

主要发现

  • Hessian的主特征子空间与SGs的二阶矩之间在训练迭代和不同数据集中均表现出持续对齐,表明SGD隐式利用了二阶信息。
  • 自适应步长或对角预条件可使SGD动力学转化为超鞅,在适当假设下实现理论收敛保证。
  • 所提出的泛化界具有尺度不变性:后验与先验之间的KL散度在对角重参数化下保持不变。
  • 在随机标签设置下,有效曲率与参数偏移的加权Frobenius范数均增加,与更高的泛化误差相关。
  • 在MNIST和CIFAR-10上的实验结果表明,随着标签噪声从0%增加到15%,泛化界预测值也随之升高,验证了其预测能力。
  • Hessian的对角元素随标签噪声增加而上升,表明局部曲率增强,这贡献于泛化界中的第一项。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。