[论文解读] Stable Weight Decay Regularization
本文提出稳定权重衰减(SWD),一种动态权重衰减方法,解决了基于动量的优化器(如SGD)和自适应方法(如Adam)中的不稳定性问题。通过重新表述权重衰减以保持一致的梯度流动,SWD在无需额外超参数的情况下,优于标准L2正则化和解耦权重衰减,并在实验中超越了复杂的Adam变体。
Weight decay is a popular regularization technique for training of deep neural networks. Modern deep learning libraries mainly use L2 regularization as the default implementation of weight decay. \citet{loshchilov2018decoupled} demonstrated that L2 regularization is not identical to weight decay for adaptive gradient methods, such as Adaptive Momentum Estimation (Adam), and proposed Adam with Decoupled Weight Decay (AdamW). However, we found that the popular implementations of weight decay, including L2 regularization and decoupled weight decay, in modern deep learning libraries usually damage performance. First, the L2 regularization is unstable weight decay for all optimizers that use Momentum, such as stochastic gradient descent (SGD). Second, decoupled weight decay is highly unstable for all adaptive gradient methods. We further propose the Stable Weight Decay (SWD) method to fix the unstable weight decay problem from a dynamical perspective. The proposed SWD method makes significant improvements over L2 regularization and decoupled weight decay in our experiments. Simply fixing weight decay in Adam by SWD, with no extra hyperparameter, can outperform complex Adam variants, which have more hyperparameters.
研究动机与目标
- 解决现有权重衰减实现方法在深度学习优化器中的不稳定性问题,特别是针对基于动量和自适应方法的优化器。
- 指出标准L2正则化和解耦权重衰减在自适应优化下无法保持一致的权重衰减动态。
- 提出一种稳定且动态一致的权重衰减机制,确保在各种优化器中实现可靠的正则化。
- 证明SWD在不引入额外超参数的情况下,可提升泛化能力和训练稳定性。
- 确立SWD作为现有权重衰减实现的即插即用替代方案,其性能始终优于复杂的自适应优化器。
提出的方法
- 从动力系统角度重新表述权重衰减,以确保在各类优化器中保持一致的衰减行为。
- 推导出一种修改后的更新规则,将权重衰减与梯度更新解耦,同时在动量和自适应方法中保持稳定性。
- 提出一种新的权重衰减更新方式,确保无论自适应学习率如何缩放,衰减率始终保持恒定。
- 确保新公式避免了标准实现中动量与权重衰减相互作用导致的不稳定性。
- 通过不同优化器下梯度流动动力学的理论分析验证该方法。
- 在深度学习库中实现SWD作为现有权重衰减的即插即用替代方案,无需超参数调优。
实验结果
研究问题
- RQ1为何标准权重衰减实现方法在SGD带动量和Adam等优化器中无法提供稳定正则化?
- RQ2在自适应优化下,L2正则化与解耦权重衰减的权重衰减动力学行为有何不同?
- RQ3能否推导出一种统一的权重衰减公式,以确保在所有优化器中实现稳定且一致的衰减动态?
- RQ4与现有方法相比,稳定权重衰减对模型泛化能力和收敛速度有何影响?
- RQ5SWD是否在无需额外调优的情况下,仍能超越依赖多个超参数的复杂Adam变体?
主要发现
- 标准L2正则化对所有使用动量的优化器(如SGD)均不稳定,原因在于衰减动态不一致。
- 解耦权重衰减在自适应梯度方法(如Adam)中极不稳定,导致性能下降。
- 所提出的稳定权重衰减(SWD)方法通过确保所有优化器中一致的衰减行为,解决了上述不稳定性问题。
- SWD在多个基准测试中均优于L2和解耦权重衰减。
- 仅将Adam的权重衰减替换为SWD,无需调整任何超参数,其性能已超越依赖更多超参数的复杂Adam变体。
- SWD提供了一种稳定、可靠且即插即用的正则化方法,可有效提升泛化能力和训练稳定性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。