[论文解读] Penalizing Gradient Norm for Efficiently Improving Generalization in Deep Learning
该论文提出了一种新颖的优化方法,通过惩罚损失函数的梯度范数来提升深度学习的泛化性能,采用一阶近似以避免昂贵的Hessian矩阵计算。该方法在CIFAR和ImageNet基准测试中均优于标准SGD和Sharpness-Aware Minimization(SAM),实现了SOTA性能,提升幅度最高达70%。
How to train deep neural networks (DNNs) to generalize well is a central concern in deep learning, especially for severely overparameterized networks nowadays. In this paper, we propose an effective method to improve the model generalization by additionally penalizing the gradient norm of loss function during optimization. We demonstrate that confining the gradient norm of loss function could help lead the optimizers towards finding flat minima. We leverage the first-order approximation to efficiently implement the corresponding gradient to fit well in the gradient descent framework. In our experiments, we confirm that when using our methods, generalization performance of various models could be improved on different datasets. Also, we show that the recent sharpness-aware minimization method (Foret et al., 2021) is a special, but not the best, case of our method, where the best case of our method could give new state-of-art performance on these tasks. Code is available at {https://github.com/zhaoyang-0204/gnp}.
研究动机与目标
- 通过显式引导优化过程趋向更平坦的极小值,解决过参数化深度神经网络中泛化性能差的挑战。
- 通过引入高效的的一阶近似,克服直接通过Hessian矩阵计算来最小化梯度范数的计算不可行性。
- 证明惩罚梯度范数可导致更平坦的极小值,而平坦极小值已知比尖锐极小值泛化性能更优。
- 表明最近提出的SAM方法是所提框架的特例,且在最优超参数调优下,所提方法可实现更优性能。
- 提供实用的超参数选择指南,以在真实训练场景中最大化泛化性能提升。
提出的方法
- 提出一种新的训练目标,通过在损失函数关于网络参数的梯度的L2范数上添加惩罚项。
- 使用一阶近似计算梯度范数的梯度,避免使用二阶导数,从而可在标准SGD框架中高效实现。
- 将优化问题表述为与SAM类似的极小化-极大化问题,但具有更通用和灵活的惩罚结构。
- 引入两个超参数:α(控制惩罚项的大小)和r(控制极小化-极大化公式中扰动的半径)。
- 通过反向传播计算一阶近似下的梯度范数惩罚,在标准深度学习框架中实现该方法。
- 通过仔细选择超参数避免过度惩罚导致梯度范数过早归零,从而实现稳定训练。
实验结果
研究问题
- RQ1惩罚损失函数的梯度范数是否能导致更平坦的极小值,并提升深度神经网络的泛化性能?
- RQ2如何在不计算Hessian矩阵的情况下高效实现梯度范数惩罚?
- RQ3Sharpness-Aware Minimization(SAM)方法是否为所提通用框架的特例?
- RQ4在不同架构和数据集上,哪些超参数设置(α和r)能实现最优泛化性能?
- RQ5所提方法是否在CIFAR-10、CIFAR-100和ImageNet等多样化基准上始终优于标准SGD和SAM?
主要发现
- 所提方法在CIFAR-10和CIFAR-100上实现了SOTA性能,相较于SAM的性能提升最高达70%。
- 在ImageNet上,与标准训练相比,该方法将VGG16-BN的top-1错误率降低0.37%,ResNet50降低0.29%,ResNet101降低0.45%,并进一步优于SAM。
- 在CIFAR-10上的WideResNet-28-10中,最优超参数(α=0.8,r∈{0.05,0.1})实现了最高性能,而更大的α值(如α=2.0)会导致梯度范数过早坍缩,降低测试准确率。
- 在某些设置下,该方法相比SAM具有更好的训练稳定性,尤其在超参数被仔细调优时。
- 梯度范数惩罚能有效促使优化器收敛至更平坦的极小值,这与更好的泛化性能密切相关。
- 该方法在多种架构(包括卷积网络和视觉Transformer)上均具有广泛适用性,并在小规模(CIFAR)和大规模(ImageNet)数据集上均表现良好。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。