Skip to main content
QUICK REVIEW

[论文解读] Dissecting Hessian: Understanding Common Structure of Hessian in Neural Networks

Yikai Wu, Xingyu Zhu|arXiv (Cornell University)|Oct 8, 2020
Sparse and Compressive Sensing Techniques参考文献 51被引用 12
一句话总结

本文提出了一项解耦猜想,将神经网络的层间Hessian矩阵近似为输入自相关矩阵与输出Hessian矩阵的Kronecker积,解释了在顶层特征空间中观察到的低秩结构。作者在过参数化的两层网络中证明了该结构,并在更深的模型中通过实验验证了其有效性,展示了不同网络之间特征空间的高重叠度以及重塑后的低秩特征向量,从而实现了更紧致的PAC-Bayes泛化界。

ABSTRACT

Hessian captures important properties of the deep neural network loss landscape. Previous works have observed low rank structure in the Hessians of neural networks. In this paper, we propose a decoupling conjecture that decomposes the layer-wise Hessians of a network as the Kronecker product of two smaller matrices. We can analyze the properties of these smaller matrices and prove the structure of top eigenspace random 2-layer networks. The decoupling conjecture has several other interesting implications - top eigenspaces for different models have surprisingly high overlap, and top eigenvectors form low rank matrices when they are reshaped into the same shape as the corresponding weight matrix. All of these can be verified empirically for deeper networks. Finally, we use the structure of layer-wise Hessian to get better explicit generalization bounds for neural networks.

研究动机与目标

  • 理解神经网络Hessian矩阵顶层特征空间中低秩结构的起源。
  • 解释为何不同模型的Hessian矩阵顶层特征空间即使在权重和初始化不同的情况下仍表现出高度重叠。
  • 开发一种高效计算和分析深层网络中层间Hessian矩阵顶层特征空间的方法。
  • 将Hessian结构的洞察应用于改进显式泛化界,特别是在PAC-Bayes框架中。
  • 在多样化架构和数据分布上验证解耦猜想的有效性。

提出的方法

  • 提出一项解耦猜想,将层间Hessian矩阵近似为输入自相关矩阵与输出Hessian矩阵的Kronecker积。
  • 分析输入自相关矩阵,表明当输入具有非零均值时,其近似为秩1矩阵,从而在完整Hessian矩阵中诱导出低秩结构。
  • 证明在随机数据上的过参数化两层网络中,输出Hessian矩阵近似为秩$c-1$,其中$c$为类别数。
  • 利用Kronecker结构推导出一种高效计算层间Hessian矩阵顶层特征空间的启发式方法,基于权重矩阵。
  • 通过实证验证该猜想及其在深层网络中的影响,包括特征空间重叠度和重塑后的低秩特征向量。
  • 将Hessian结构应用于改进PAC-Bayes界,通过引入基于Hessian的后验方差优化。

实验结果

研究问题

  • RQ1为何深度神经网络的Hessian矩阵在其顶层特征空间中表现出低秩结构?
  • RQ2是什么原因导致不同训练模型的Hessian矩阵顶层特征空间即使在正交权重下也表现出高度重叠?
  • RQ3输入分布(例如零均值与非零均值)如何影响层间Hessian矩阵的秩结构?
  • RQ4Hessian矩阵的Kronecker积分解能否用于推导更紧致的泛化界?
  • RQ5该解耦猜想在超过两层网络的更深层、更复杂架构中在多大程度上仍然成立?

主要发现

  • 当输入自相关矩阵近似为秩1时,层间Hessian矩阵的顶层特征空间与输出Hessian矩阵的顶层特征空间高度相似,这种情况在输入具有非零均值时发生。
  • 实证结果表明,不同模型(如LeNet5和ResNet18)的Hessian矩阵顶层特征空间具有高度重叠,重叠度在层的输出维度处达到峰值。
  • 当重塑为权重矩阵形状时,Hessian矩阵的顶层特征向量形成低秩矩阵,与Kronecker积结构一致。
  • 对于在随机数据上的过参数化两层网络,输出Hessian矩阵近似为秩$c-1$,其中$c$为类别数,其顶层特征空间可直接从权重矩阵计算得出。
  • 结合Hessian结构的迭代Hessian优化方法使PAC-Bayes界更紧致,在T-600上将界从0.161降低至0.1198,在T-1200上从0.179降低至0.1417。
  • 后验方差优化与Hessian特征向量对齐,表明在特征值较大的方向上方差更小,证实了在后验中尖锐方向受到更大惩罚。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。