Skip to main content
QUICK REVIEW

[论文解读] Why Do We Need Weight Decay in Modern Deep Learning?

Francesco D’Angelo, Maksym Andriushchenko|arXiv (Cornell University)|Oct 6, 2023
Topic Modeling被引用 5
一句话总结

该论文揭示,在现代深度学习中,权重衰减主要通过改变优化动力学而非作为直接正则化项发挥作用。它通过在随机优化中平衡偏差-方差,稳定训练过程,提升过参数化模型的泛化能力,并防止在 bfloat16 混合精度训练中的损失发散——尽管其在显式正则化中的作用有限,但其在高效且稳定的大型语言模型训练中至关重要。

ABSTRACT

Weight decay is a broadly used technique for training state-of-the-art deep networks from image classification to large language models. Despite its widespread usage and being extensively studied in the classical literature, its role remains poorly understood for deep learning. In this work, we highlight that the role of weight decay in modern deep learning is different from its regularization effect studied in classical learning theory. For deep networks on vision tasks trained with multipass SGD, we show how weight decay modifies the optimization dynamics enhancing the ever-present implicit regularization of SGD via the loss stabilization mechanism. In contrast, for large language models trained with nearly one-epoch training, we describe how weight decay balances the bias-variance tradeoff in stochastic optimization leading to lower training loss and improved training stability. Overall, we present a unifying perspective from ResNets on vision tasks to LLMs: weight decay is never useful as an explicit regularizer but instead changes the training dynamics in a desirable way. The code is available at https://github.com/tml-epfl/why-weight-decay

研究动机与目标

  • 澄清权重衰减在现代深度学习(尤其是过参数化模型和大型语言模型 LLM)中的真实作用。
  • 探究尽管在现代设置中其作为显式正则化器的影响有限,为何权重衰减仍不可或缺。
  • 解释权重衰减如何在 bfloat16 混合精度场景中稳定训练,这是扩展 LLM 训练的关键要求。
  • 区分权重衰减在隐式正则化、优化动力学和数值稳定性方面的影响。

提出的方法

  • 分析过参数化的 ResNets,表明权重衰减通过损失稳定性和 Hessian 迹正则化增强隐式正则化。
  • 研究使用近似单遍 SGD 训练的 LLM,证明权重衰减在随机优化中平衡偏差-方差权衡并降低训练损失的作用。
  • 通过在视觉和语言模型中进行实证消融研究,分离权重衰减对训练动力学和损失稳定性的独立影响。
  • 利用 bfloat16 训练实验表明,权重衰减可防止由数值精度限制引起的后期训练损失发散,而非梯度爆炸所致。
  • 将权重衰减与学习率调度和权重平均进行比较,评估其对收敛性和泛化的影响。
  • 提出一种统一视角,将权重衰减视为动态优化器调节器而非正则化器,该观点在视觉和语言任务中均得到验证。
(a)
(a)

实验结果

研究问题

  • RQ1为何在现代深度学习中,尽管权重衰减作为显式正则化器的作用有限,仍被广泛使用?
  • RQ2在过参数化深度网络中,权重衰减如何在正则化之外影响优化动力学?
  • RQ3权重衰减在大型语言模型的 bfloat16 混合精度训练中以何种方式提升训练稳定性?
  • RQ4在现代 LLM 中,权重衰减主要影响泛化还是训练损失最小化?
  • RQ5权重衰减是否可被理解为一种在随机优化中平衡偏差-方差权衡的机制?

主要发现

  • 在 bfloat16 混合精度训练中,权重衰减通过防止因数值精度有限导致的后期损失发散,稳定了训练损失,即使在 float32 训练中保持稳定的情况下亦如此。
  • 对于过参数化的 ResNets,权重衰减通过 Hessian 迹正则化稳定损失轨迹,增强隐式正则化,从而改善泛化性能。
  • 在使用近似单遍 SGD 训练的大规模语言模型中,权重衰减通过更好地平衡随机优化中的偏差-方差权衡来降低训练损失,而非通过显式正则化。
  • 在 bfloat16 中,权重衰减使更高学习率(如 0.001)下的稳定训练成为可能,而降低学习率则效果较差且更慢,表明权重衰减是更高效的解决方案。
  • 在现代深度学习中,权重衰减并非主要正则化器;其广泛使用源于其能够以改善收敛性和稳定性的方式塑造优化动力学。
  • 实证结果表明,使用恒定学习率的权重衰减在性能上几乎与结合学习率衰减和权重平均的方法相当,表明其作用更侧重于动态控制而非超参数调优。
(b)
(b)

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。