Skip to main content
QUICK REVIEW

[论文解读] On the Maximum Hessian Eigenvalue and Generalization

Simran Kaur, Jérémy Cohen|arXiv (Cornell University)|Jun 21, 2022
Domain Adaptation and Few-Shot Learning被引用 6
一句话总结

本文研究了最大Hessian特征值($\lambda_{\text{max}}$)与神经网络泛化能力之间的关系,表明更小的$\lambda_{\text{max}}$值并不总是能提升泛化性能。通过在VGG网络上进行受控实验,发现增大学习率、批量归一化、dropout以及SAM等干预措施虽能降低$\lambda_{\text{max}}$,却无法提升甚至会损害测试准确率——尤其在大批次设置下;而批量归一化虽能提升泛化性能,却并未降低$\lambda_{\text{max}}$。这些发现挑战了将$\lambda_{\text{max}}$作为泛化性能可靠代理指标的观点。

ABSTRACT

The mechanisms by which certain training interventions, such as increasing learning rates and applying batch normalization, improve the generalization of deep networks remains a mystery. Prior works have speculated that "flatter" solutions generalize better than "sharper" solutions to unseen data, motivating several metrics for measuring flatness (particularly $λ_{max}$, the largest eigenvalue of the Hessian of the loss); and algorithms, such as Sharpness-Aware Minimization (SAM) [1], that directly optimize for flatness. Other works question the link between $λ_{max}$ and generalization. In this paper, we present findings that call $λ_{max}$'s influence on generalization further into question. We show that: (1) while larger learning rates reduce $λ_{max}$ for all batch sizes, generalization benefits sometimes vanish at larger batch sizes; (2) by scaling batch size and learning rate simultaneously, we can change $λ_{max}$ without affecting generalization; (3) while SAM produces smaller $λ_{max}$ for all batch sizes, generalization benefits (also) vanish with larger batch sizes; (4) for dropout, excessively high dropout probabilities can degrade generalization, even as they promote smaller $λ_{max}$; and (5) while batch-normalization does not consistently produce smaller $λ_{max}$, it nevertheless confers generalization benefits. While our experiments affirm the generalization benefits of large learning rates and SAM for minibatch SGD, the GD-SGD discrepancy demonstrates limits to $λ_{max}$'s ability to explain generalization in neural networks.

研究动机与目标

  • 探究最大Hessian特征值($\lambda_{\text{max}}$)是否能可靠预测或因果影响神经网络的泛化能力。
  • 测试$\lambda_{\text{max}}$作为平坦度度量在多种训练干预(包括学习率、批次大小、dropout、批量归一化和SAM)下的鲁棒性。
  • 确定泛化性能的提升是否可能在不降低$\lambda_{\text{max}}$的情况下发生,或$\lambda_{\text{max}}$是否可能降低但泛化性能未见改善。
  • 评估$\lambda_{\text{max}}$作为SAM和批量归一化等优化方法成功原因的科学解释是否成立。

提出的方法

  • 作者在CIFAR-10上使用小批量SGD训练VGG-11模型,通过控制学习率、批次大小、dropout率和批量归一化的设置进行实验。
  • 采用Cohen等人[24]提出的方法,基于连续训练迭代点之间的网格近似计算$\lambda_{\text{max}}$,以确保在稳定性边界区域的准确性。
  • 实验在小批次和大批次设置下进行,通过调节学习率评估其对$\lambda_{\text{max}}$和测试准确率的影响。
  • 研究对比了含与不含批量归一化、dropout和SAM的模型,通过多个随机种子测量$\lambda_{\text{max}}$和泛化性能。
  • 应用线性缩放规则,在同时增大批次大小和学习率时保持训练动态一致。
  • 每种设置下进行4次运行,通过统计比较确保$\lambda_{\text{max}}$和测试准确率测量结果的稳健性。

实验结果

研究问题

  • RQ1通过增大学习率降低$\lambda_{\text{max}}$是否能一致地提升泛化性能,特别是在大批次设置下?
  • RQ2当以保持比例的方式同时缩放学习率和批次大小时,$\lambda_{\text{max}}$是否能降低而泛化性能保持不变?
  • RQ3在大批次设置下,SAM的泛化优势是否仍能持续,即使$\lambda_{\text{max}}$已被降低?
  • RQ4过度的dropout是否会在降低$\lambda_{\text{max}}$的同时损害泛化性能?
  • RQ5批量归一化是否能在不降低$\lambda_{\text{max}}$的情况下提升泛化性能?

主要发现

  • 对于未使用批量归一化的VGG网络,增大学习率在所有批次大小下均降低$\lambda_{\text{max}}$,但在大批次设置下泛化优势完全消失。
  • 当以保持比例的方式同时缩放学习率和批次大小时,$\lambda_{\text{max}}$降低但泛化性能未发生变化,证实$\lambda_{\text{max}}$与泛化性能之间不存在因果关系。
  • SAM在所有批次大小下均降低$\lambda_{\text{max}}$,但其泛化优势在大批次设置下减弱并最终完全消失,即使获得了更平坦的解。
  • 过高的dropout概率会降低测试准确率,尽管同时降低了$\lambda_{\text{max}}$,表明更小的$\lambda_{\text{max}}$并不保证更好的泛化性能。
  • 批量归一化在大学习率下,特别是在大批次设置中,能提升泛化性能,但并未显著降低$\lambda_{\text{max}}$,表明泛化性能的提升可不依赖于更平坦的解。
  • 在固定学习率和批次大小下,含与不含批量归一化的模型具有相近的$\lambda_{\text{max}}$值,但测试准确率存在显著差异,凸显$\lambda_{\text{max}}$无法解释泛化性能的差异。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。