Skip to main content
QUICK REVIEW

[论文解读] A Scale Invariant Flatness Measure for Deep Network Minima

Akshay Rangamani, Nam H. Nguyen|arXiv (Cornell University)|Feb 6, 2019
Stochastic Gradient Optimization Techniques参考文献 26被引用 20
一句话总结

本文通过利用具有正齐次激活函数(如ReLU)的神经网络中参数重缩放所诱导的商流形结构,提出了一种针对深度神经网络极小值的尺度不变平坦度度量。通过在该商流形上构建黎曼度量,该方法推导出一种对重缩放不变的基于海森矩阵的尖锐度度量,证实了在新度量下,大批次SGD的极小值确实比小批次的更平坦。

ABSTRACT

It has been empirically observed that the flatness of minima obtained from training deep networks seems to correlate with better generalization. However, for deep networks with positively homogeneous activations, most measures of sharpness/flatness are not invariant to rescaling of the network parameters, corresponding to the same function. This means that the measure of flatness/sharpness can be made as small or as large as possible through rescaling, rendering the quantitative measures meaningless. In this paper we show that for deep networks with positively homogenous activations, these rescalings constitute equivalence relations, and that these equivalence relations induce a quotient manifold structure in the parameter space. Using this manifold structure and an appropriate metric, we propose a Hessian-based measure for flatness that is invariant to rescaling. We use this new measure to confirm the proposition that Large-Batch SGD minima are indeed sharper than Small-Batch SGD minima.

研究动机与目标

  • 为解决标准基于海森矩阵的平坦度度量在具有正齐次激活函数的深度网络中,对保持相同函数的参数重缩放不具有不变性这一根本问题。
  • 将重缩放变换形式化为参数空间中的等价关系,从而实现对平坦度的几何处理。
  • 在参数空间上构建一个捕捉重缩放下函数等价性的商流形结构。
  • 在该商流形上构造一个黎曼度量,以基于海森矩阵定义一种尺度不变的尖锐度度量。
  • 通过实证验证,在新不变度量下,大批次SGD的极小值确实比小批次的更平坦。

提出的方法

  • 本文指出,在ReLU网络中,形如 $T_\alpha(\theta) = (\alpha\theta_1, \alpha^{-1}\theta_2)$ 的重缩放保持网络函数不变,构成参数空间上的等价关系。
  • 证明了这些重缩放下的等价类形成一个商流形 $\mathcal{M} = \overline{\mathcal{M}} / \sim$,其中 $\overline{\mathcal{M}}$ 是参数空间的闭包。
  • 从 $\overline{\mathcal{M}}$ 构造一个到若干施蒂费尔流形的光滑满射,以表征权值和偏置向量正交补空间,从而实现商结构的定义。
  • 利用参数向量的正交分解,在商流形上诱导出一个黎曼度量,从而实现对基于海森矩阵的平坦度度量的明确定义。
  • 最终的平坦度度量被定义为海森矩阵在商流形上投影的范数,确保对重缩放的不变性。
  • 该方法被应用于比较大批次与小批次SGD所找到的极小值,使用新度量评估其相对平坦度。

实验结果

研究问题

  • RQ1能否使基于海森矩阵的平坦度度量对保持网络函数的重缩放保持不变,适用于具有正齐次激活函数的深度网络?
  • RQ2此类网络的参数空间在由重缩放诱导的函数等价关系下是否具有良好的商流形结构?
  • RQ3所提出的尺度不变平坦度度量是否能够区分大批次与小批次SGD所找到的极小值?
  • RQ4新度量能否解决现有尖锐度度量中存在的模糊性问题——即仅通过简单重缩放即可任意改变度量值?
  • RQ5新度量是否证实了经验直觉:即大批次SGD收敛于比小批次更尖锐的极小值?

主要发现

  • 所提出的平坦度度量对保持网络函数的重缩放具有不变性,解决了先前基于海森矩阵度量的关键局限。
  • 具有正齐次激活函数的深度网络参数空间在由重缩放诱导的等价关系下,具有明确定义的商流形结构。
  • 新度量证实了大批次SGD所找到的极小值显著比小批次SGD更平坦,支持了平坦极小值泛化性假设。
  • 商流形的构造依赖于从参数空间到施蒂费尔流形的满射,证明了等价关系是闭的,且商流形为嵌入子流形。
  • 平坦度度量源于海森矩阵在商流形上的投影,确保了几何一致性与不变性。
  • 该方法为深度学习中现有尖锐度度量提供了一种数学上严谨且具有定量意义的替代方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。