[论文解读] On the Overlooked Pitfalls of Weight Decay and How to Mitigate Them: A Gradient-Norm Perspective
本文指出,自适应优化器(如Adam)中的权重衰减可能导致训练结束时梯度范数过大,从而损害收敛性和泛化性能。为缓解此问题,提出了一种基于梯度范数感知的调度器——计划权重衰减(SWD),该调度器在梯度范数增大时动态降低权重衰减强度,显著提升了泛化性能,通常可达到或超越SGD的性能表现。
Weight decay is a simple yet powerful regularization technique that has been very widely used in training of deep neural networks (DNNs). While weight decay has attracted much attention, previous studies fail to discover some overlooked pitfalls on large gradient norms resulted by weight decay. In this paper, we discover that, weight decay can unfortunately lead to large gradient norms at the final phase (or the terminated solution) of training, which often indicates bad convergence and poor generalization. To mitigate the gradient-norm-centered pitfalls, we present the first practical scheduler for weight decay, called the Scheduled Weight Decay (SWD) method that can dynamically adjust the weight decay strength according to the gradient norm and significantly penalize large gradient norms during training. Our experiments also support that SWD indeed mitigates large gradient norms and often significantly outperforms the conventional constant weight decay strategy for Adaptive Moment Estimation (Adam).
研究动机与目标
- 识别自适应优化中权重衰减被忽视的潜在问题,特别是其在训练结束时导致大梯度范数的倾向。
- 分析大梯度范数如何对自适应优化器(如Adam)的收敛性和泛化性能产生负面影响。
- 提出一种新颖的、基于梯度范数感知的权重衰减调度器,可在训练过程中动态调整其强度。
- 通过实证验证,SWD在Adam中相比恒定权重衰减策略能显著提升泛化性能和收敛性。
- 证明SWD可缩小CNN中Adam与SGD之间的泛化性能差距。
提出的方法
- 本文提出计划权重衰减(SWD),一种基于梯度范数运行平均值动态调整衰减强度的权重衰减调度器。
- SWD采用基于梯度范数的机制,在梯度范数增加时降低权重衰减强度,形成负反馈系统。
- 该方法通过将权重衰减项解耦并按平方梯度范数移动平均的倒数进行缩放,集成到Adam中。
- 核心更新规则通过引入与 $ \frac{1}{\sqrt{\bar{v}_t} + \epsilon} $ 成比例的学习率调整,对Adam的参数更新进行修改,其中 $ \bar{v}_t $ 为未中心化二阶矩估计的均值。
- 该调度器旨在惩罚大梯度范数,与理论见解一致:低梯度范数与更平坦的极小值相关,有助于更好的泛化性能。
- SWD兼容其他优化器,且无需重新训练,可作为即插即用的改进方案集成到现有训练流程中。
实验结果
研究问题
- RQ1Adam中的权重衰减是否会导致训练结束时出现大梯度范数?如果是,原因是什么?
- RQ2训练终止时的大梯度范数如何影响模型的收敛性和泛化性能?
- RQ3与恒定权重衰减相比,基于梯度范数感知的动态调度器能否提升Adam中的泛化性能?
- RQ4SWD在CNN中能在多大程度上缩小Adam与SGD之间的泛化性能差距?
- RQ5SWD对学习率和初始权重衰减等超参数的选择是否具有鲁棒性?
主要发现
- SWD显著降低了训练结束时的大梯度范数,尤其在Adam中,从而提升了收敛性和泛化性能。
- 在CIFAR-10上使用VGG16时,AdamS(带SWD的Adam)测试误差为4.52%,优于AdamW(4.90%)和Adam(5.49%)。
- 在ResNet18上,AdamS的测试误差为4.52%,而AdamW为4.90%,Adam为5.49%,表现出一致的优越性。
- 在使用余弦学习率调度和学习率 warm restart 的设置下,AdamS在所有模型中均保持低于AdamW和Adam的测试误差和训练损失。
- AdamS对超参数选择更具鲁棒性,在广泛的权重衰减值范围内均保持优异性能。
- 在某些任务中(如语言建模),SWD未能优于$L_2$正则化,表明其在特定任务中存在局限性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。