[论文解读] Parameter Re-Initialization through Cyclical Batch Size Schedules
本文提出循环批量大小(CBS)调度策略,通过在交替使用大、小批量大小时受控地注入噪声,实现权重重新初始化,从而提升神经网络训练效果。该方法在语言建模中将困惑度降低最高达7.91点,训练迭代次数减少最高达61%,同时以极低的额外成本实现高效模型集成与对抗训练。
Optimal parameter initialization remains a crucial problem for neural network training. A poor weight initialization may take longer to train and/or converge to sub-optimal solutions. Here, we propose a method of weight re-initialization by repeated annealing and injection of noise in the training process. We implement this through a cyclical batch size schedule motivated by a Bayesian perspective of neural network training. We evaluate our methods through extensive experiments on tasks in language modeling, natural language inference, and image classification. We demonstrate the ability of our method to improve language modeling performance by up to 7.91 perplexity and reduce training iterations by up to $61\%$, in addition to its flexibility in enabling snapshot ensembling and use with adversarial training.
研究动机与目标
- 为解决深度神经网络中次优权重初始化带来的收敛性差与泛化能力弱的问题。
- 探索自适应初始化策略,利用批量大小作为控制参数,在训练过程中动态调节噪声水平。
- 在语言建模、自然语言处理和图像分类等多种任务中,提升训练效率与模型性能。
- 实现与高级技术(如快照集成与对抗训练)的灵活结合,且无需额外训练成本。
- 提供一种受贝叶斯启发的动态重新初始化框架,以增强泛化能力并逃离不良局部极小值。
提出的方法
- 该方法利用循环批量大小调度来调节随机梯度下降(SGD)中的噪声水平,通过受控的温度变化模拟贝叶斯自适应先验。
- SGD中的噪声由学习率与批量大小的比值决定;通过循环调整批量大小,可在不改变学习率的情况下动态改变噪声尺度。
- 该方法基于随机微分方程的Euler-Maruyama离散化形式,其中批量大小作为温度控制旋钮以调节探索程度。
- 在LSTM、ResNet和WResNet等架构上,针对语言建模与图像分类等任务,评估了多种循环调度策略(如CBS-10-3、CBS-15-2)。
- 通过在周期峰值保存模型,该方法实现了快照集成,以零额外训练成本获得集成性能。
- 该方法与对抗正则化结合,进一步提升了鲁棒性与准确性,尤其在图像分类任务中表现显著。
实验结果
研究问题
- RQ1与固定批量大小基线相比,循环批量大小调度是否能提升神经网络训练的泛化性能?
- RQ2CBS调度在保持或提升模型准确率的前提下,最多能将训练迭代次数减少多少?
- RQ3在权重初始化较差或次优的情况下,CBS的表现如何?
- RQ4CBS能否有效与快照集成和对抗训练结合,以进一步提升模型性能?
- RQ5将CBS解释为自适应先验优化的贝叶斯框架,是否能在损失和泛化能力上带来可测量的改进?
主要发现
- 在图像分类任务中,CBS调度最多可将训练迭代次数减少61%,显著缩短运行时间。
- 在语言建模中,CBS相比基线模型将性能提升最高达7.91个困惑度点。
- 在自然语言蕴含与图像分类任务中,CBS带来了微小但一致的准确率提升。
- 利用不同CBS周期中保存的模型进行快照集成,在ImageNet上将图像分类准确率提升至76.401%,高于基线训练的75.336%。
- 将CBS与对抗训练结合,在ImageNet上额外获得0.26%的准确率增益。
- 即使在初始权重较差的情况下,CBS仍优于基线初始化策略,展现出对次优初始化的强鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。