Skip to main content
QUICK REVIEW

[论文解读] Why neural networks find simple solutions: the many regularizers of geometric complexity

Benoît Dherin, Michael Munn|arXiv (Cornell University)|Sep 27, 2022
Machine Learning in Materials Science被引用 10
一句话总结

本文提出了几何复杂度(Geometric Complexity, GC),一种基于离散Dirichlet能量的计算上可行的模型函数可变性度量,用于统一解释多种深度学习训练启发式方法(如权重范数正则化、谱范数控制、平坦度正则化及噪声注入)如何隐式降低模型复杂度。关键贡献在于证明GC能够捕捉到双下降行为,并通过模型函数对输入的一阶导数,建立隐式与显式正则化器之间的统一框架。

ABSTRACT

In many contexts, simpler models are preferable to more complex models and the control of this model complexity is the goal for many methods in machine learning such as regularization, hyperparameter tuning and architecture design. In deep learning, it has been difficult to understand the underlying mechanisms of complexity control, since many traditional measures are not naturally suitable for deep neural networks. Here we develop the notion of geometric complexity, which is a measure of the variability of the model function, computed using a discrete Dirichlet energy. Using a combination of theoretical arguments and empirical results, we show that many common training heuristics such as parameter norm regularization, spectral norm regularization, flatness regularization, implicit gradient regularization, noise regularization and the choice of parameter initialization all act to control geometric complexity, providing a unifying framework in which to characterize the behavior of deep learning models.

研究动机与目标

  • 解决深度神经网络缺乏能反映泛化行为的合适且计算上可行的复杂度度量的问题。
  • 基于学习函数的几何特性,将显式与隐式正则化技术统一于单一理论框架之下。
  • 证明几何复杂度能够捕捉到模型规模增大时测试误差中的双下降现象。
  • 表明常见的训练启发式方法(如初始化、学习率、批量大小、权重衰减)均通过控制几何复杂度发挥作用。
  • 提供一种比传统度量(如参数数量或基于范数的复杂度)更具信息量的模型性能代理指标。

提出的方法

  • 提出几何复杂度(GC)作为基于网络输出对输入的一阶导数的离散Dirichlet能量计算出的模型函数可变性度量。
  • 利用调和函数理论与Lipschitz光滑性,为GC作为模型复杂度代理的理论基础提供支持。
  • 通过实证评估GC在多种训练启发式方法中的表现,包括权重范数正则化、谱范数控制、标签噪声以及学习率/批量大小的选择。
  • 应用转移定理,将低GC区域与平坦极小值及低损失梯度联系起来,表明其与基于尖锐度的度量一致。
  • 使用SGD(无动量)训练模型,以隔离每种启发式方法对GC的影响,避免优化动力学带来的干扰。
  • 通过补充实验使用其他优化器(Adam、带动量的SGD)及额外训练技术(学习率调度、数据增强)验证结果。

实验结果

研究问题

  • RQ1如何为深度神经网络定义一种统一的复杂度度量,使其既能反映泛化性能,又具备计算可行性?
  • RQ2常见的训练启发式方法(如权重衰减、批量归一化、标签噪声)在多大程度上能降低几何复杂度?
  • RQ3几何复杂度能否解释过参数化模型中观察到的双下降泛化曲线?
  • RQ4几何复杂度与尖锐度、有效维度等其他复杂度度量之间有何关系?
  • RQ5初始化方案与训练超参数在何种方式下影响学习函数的几何复杂度?

主要发现

  • 几何复杂度(GC)是基于模型函数一阶导数的计算高效度量,使其适用于大规模深度学习模型。
  • 多种标准训练启发式方法(包括权重范数正则化、谱范数控制、标签噪声)显著降低了几何复杂度。
  • 初始化方案的选择(如He、Xavier)对初始几何复杂度有可测量的影响,部分方案可导致更低的初始GC。
  • 大学习率与小批量大小被证明可降低几何复杂度,与隐式梯度正则化一致。
  • 几何复杂度能够捕捉到模型规模增大时测试误差的双下降行为,且GC在插值阈值处达到峰值。
  • 转移定理建立了低GC与平坦极小值之间的直接联系,表明低GC区域对应于低损失梯度与高平坦度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。