[论文解读] Understanding and Scheduling Weight Decay
本文通过学习动力学提出了一种关于权重衰减的新理论理解,并引入了稳定权重衰减(SWD)调度器,该调度器根据学习率自适应地调度权重衰减。此外,本文还提出了一种大规模小批量训练的线性缩放规则,该规则随小批量大小增加权重衰减,实验表明其在泛化性能上优于标准L2正则化和解耦权重衰减。
Weight decay is a popular and even necessary regularization technique for training deep neural networks that generalize well. Previous work usually interpreted weight decay as a Gaussian prior from the Bayesian perspective. However, weight decay sometimes shows mysterious behaviors beyond the conventional understanding. For example, the optimal weight decay value tends to be zero given long enough training time. Moreover, existing work typically failed to recognize the importance of scheduling weight decay during training. Our work aims at theoretically understanding novel behaviors of weight decay and designing schedulers for weight decay in deep learning. This paper mainly has three contributions. First, we propose a novel theoretical interpretation of weight decay from the perspective of learning dynamics. Second, we propose a novel weight-decay linear scaling rule for large-batch training that proportionally increases weight decay rather than the learning rate as the batch size increases. Third, we provide an effective learning-rate-aware scheduler for weight decay, called the Stable Weight Decay (SWD) method, which, to the best of our knowledge, is the first practical design for weight decay scheduling. In our various experiments, the SWD method often makes improvements over $L_{2}$ Regularization and Decoupled Weight Decay.
研究动机与目标
- 为解决权重衰减的神秘行为(例如,随着训练时间延长,最优值趋向于零)的问题,通过学习动力学重新诠释权重衰减。
- 解决现有深度学习实践中对权重衰减调度关注不足的问题。
- 开发一种实用的、与学习率感知的权重衰减调度器,以提升模型泛化性能。
- 提出一种大规模小批量训练的线性缩放规则,使权重衰减随小批量大小成比例增加,而非仅随学习率调整。
- 为传统L2正则化和解耦权重衰减提供一个理论基础更坚实的替代方案,尤其在长训练和大规模小批量场景下。
提出的方法
- 基于梯度下降的动力学,提出一种关于权重衰减的全新理论解释,将其与训练过程中权重范数的演化联系起来。
- 引入一种线性缩放规则,使权重衰减随小批量大小成比例增加,以在大规模小批量训练中保持泛化性能。
- 设计了稳定权重衰减(SWD)调度器,根据当前学习率动态调整权重衰减,以稳定训练并提升泛化性能。
- 推导出在何种理论条件下应调度权重衰减,以防止发散或收敛不良,特别是在长训练场景下。
- 通过在多个数据集和架构上的实证验证,将SWD与L2正则化和解耦权重衰减进行对比。
- 分析学习率与权重衰减在优化轨迹中的相互作用,表明为保持训练稳定,两者比率应被维持。
实验结果
研究问题
- RQ1为何最优权重衰减值在训练时间延长时趋向于零?这一行为能否从理论上加以解释?
- RQ2在训练过程中应如何调度权重衰减,以维持泛化性能,特别是在长训练和大规模小批量场景下?
- RQ3当增加小批量大小时,权重衰减的正确缩放规律是什么?它与标准学习率缩放规则有何不同?
- RQ4一种与学习率感知的权重衰减调度器在实践中能否优于标准L2正则化和解耦权重衰减?
- RQ5权重衰减与随机梯度下降过程中权重范数演化动力学之间存在何种理论联系?
主要发现
- 在长训练条件下,最优权重衰减值趋近于零,本文通过学习动力学和权重范数随时间衰减的视角对此行为进行了理论解释。
- 所提出的稳定权重衰减(SWD)调度器在多个基准测试和架构中,持续优于标准L2正则化和解耦权重衰减,显著提升了泛化性能。
- 权重衰减的线性缩放规则——即随小批量大小成比例增加权重衰减——可实现大规模小批量训练的稳定训练,性能可与小批量训练相媲美。
- 理论分析表明,权重衰减应与学习率协同调度,以保持有效学习率并避免训练不稳定。
- 实证结果表明,SWD在ImageNet和CIFAR-10数据集上均取得了优于基线方法的测试准确率,尤其在大规模小批量和长训练场景下表现更优。
- 本文确立了权重衰减并非仅是一种先验,而是一种动态正则化器,其调度策略显著影响优化稳定性与泛化性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。