Skip to main content
QUICK REVIEW

[论文解读] Normalized Flat Minima: Exploring Scale Invariant Definition of Flat Minima for Neural Networks using PAC-Bayesian Analysis

Yusuke Tsuzuku, Issei Sato|arXiv (Cornell University)|Jan 15, 2019
Gaussian Processes and Bayesian Inference参考文献 32被引用 14
一句话总结

本文提出归一化平坦极小值(normalized flat minima),一种基于PAC-Bayesian分析推导出的、与尺度无关的神经网络损失曲面平坦度度量。通过使用逐层缩放因子重新加权曲率与参数范数,该方法解决了先前平坦度定义中存在的尺度依赖性问题,在与泛化差距的相关性上达到91.1%,显著高于标准Hessian方法的70.8%。

ABSTRACT

The notion of flat minima has played a key role in the generalization studies of deep learning models. However, existing definitions of the flatness are known to be sensitive to the rescaling of parameters. The issue suggests that the previous definitions of the flatness might not be a good measure of generalization, because generalization is invariant to such rescalings. In this paper, from the PAC-Bayesian perspective, we scrutinize the discussion concerning the flat minima and introduce the notion of normalized flat minima, which is free from the known scale dependence issues. Additionally, we highlight the scale dependence of existing matrix-norm based generalization error bounds similar to the existing flat minima definitions. Our modified notion of the flatness does not suffer from the insufficiency, either, suggesting it might provide better hierarchy in the hypothesis class.

研究动机与目标

  • 解决现有平坦极小值定义的尺度依赖性问题,即在参数重标度下变化,尽管泛化性能保持不变。
  • 指出先前泛化界与平坦度度量均因隐含的均匀先验方差假设而存在相同的尺度敏感性。
  • 通过在PAC-Bayesian框架中引入逐层缩放,构建一种与尺度无关的平坦度度量。
  • 证明新度量能更有效地区分过拟合模型(如在随机标签上训练的模型)与泛化良好模型。
  • 为平坦极小值提供理论基础,以一种一致且不变的方式统一平坦度与参数尺度。

提出的方法

  • 构建一个显式考虑逐层参数缩放的PAC-Bayesian界,用尺度感知先验替代均匀先验。
  • 引入归一化锐度(normalized sharpness),定义为Hessian迹的平方根除以权重矩阵的Frobenius范数,确保在行/列缩放下保持不变。
  • 推导出一种矩阵归一化的锐度度量,对单个权重矩阵及其行/列的重标度保持不变。
  • 在PAC-Bayesian框架中使用高斯先验与后验,但修改KL散度项以整合尺度归一化。
  • 对权重矩阵实施行和列归一化,以在保持函数等价性的同时实现对参数重标度的不变性。
  • 在使用不同随机标签比例训练的Wide ResNets上,通过对比锐度度量与泛化差距,对方法进行实证验证。

实验结果

研究问题

  • RQ1能否定义一种在参数重标度下保持不变的平坦度度量,因为泛化性能本身对这类变换是不变的?
  • RQ2为何现有平坦度定义与泛化界在参数重标度后无法与泛化性能保持相关性?
  • RQ3如何扩展PAC-Bayesian框架以引入逐层缩放,从而改进泛化界?
  • RQ4所提出的归一化平坦度度量是否能比标准Hessian或范数基度量更有效地区分过拟合与泛化模型?
  • RQ5新度量是否能通过以与尺度无关的方式统一平坦度与参数尺度,从而改善假设类别的层次结构?

主要发现

  • 所提出的归一化锐度在CIFAR-10上使用随机标签时,与泛化差距的相关性达到91.1%,显著优于标准Hessian基锐度度量的70.8%。
  • 归一化平坦极小值定义在权重矩阵的行和列重标度下保持不变,解决了先前定义的关键局限性。
  • 该方法能成功区分在随机标签与真实标签上训练的模型,即使在标准平坦度度量失效的情况下亦成立。
  • 分析表明,现有基于矩阵范数的泛化界同样存在尺度依赖性,而新框架成功避免了这一问题。
  • 与Fisher-Rao范数不同,归一化锐度度量在如将权重矩阵拆分为两部分并分别重标度等重参数化变换下保持不变。
  • 实证结果证实,归一化锐度为泛化提供了更紧致且更可靠的代理指标,优于简单的参数计数或未归一化的曲率度量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。