[论文解读] kDecay: Just adding k-decay items on Learning-Rate Schedule to improve Neural Networks
本文提出 k-decay,一种通过使用学习率(LR)函数的 k 阶导数来修改学习率(LR)调度的简单而有效的方法。通过添加一个 k-decay 项,使学习率的变化率——尤其是在训练后期——得到提升,从而在不增加额外计算成本的情况下提高模型精度,在 CIFAR-100 上实现最高 2.07% 的精度提升,在 ImageNet 上实现 1.25% 的精度提升。
Recent work has shown that optimizing the Learning Rate (LR) schedule can be a very accurate and efficient way to train deep neural networks. We observe that the rate of change (ROC) of LR has correlation with the training process, but how to use this relationship to control the training to achieve the purpose of improving accuracy? We propose a new method, k-decay, just add an extra item to the commonly used and easy LR schedule(exp, cosine and polynomial), is effectively improves the performance of these schedule, also better than the state-of-the-art algorithms of LR shcedule such as SGDR, CLR and AutoLRS. In the k-decay, by adjusting the hyper-parameter \(k\), to generate different LR schedule, when k increases, the performance is improved. We evaluate the k-decay method on CIFAR And ImageNet datasets with different neural networks (ResNet, Wide ResNet). Our experiments show that this method can improve on most of them. The accuracy has been improved by 1.08\% on the CIFAR-10 dataset and by 2.07 \% on the CIFAR-100 dataset. On the ImageNet, accuracy is improved by 1.25\%. Our method is not only a general method to be applied other LR Shcedule, but also has no additional computational cost.
研究动机与目标
- 通过超越标准衰减方法,重新思考学习率(LR)调度,以提升深度神经网络的性能。
- 研究学习率的变化率(ROC)与训练动态及模型精度之间的相关性。
- 开发一种通用且低成本的方法,以增强现有学习率调度,同时不增加超参数的复杂度。
- 证明通过高阶导数控制学习率的变化率,可在不同数据集和网络架构上实现一致的性能提升。
提出的方法
- 该方法通过修改基础学习率调度函数 η(t) 的 k 阶导数,引入 k-decay 项,向 η^(k)(t) 增加一个增量 Δf^(k)(t)。
- 通过求解修改后的 k 阶导数方程,推导出新的学习率调度函数 η'(t) = η_o(k,t),其依赖于超参数 k。
- 该方法被作为附加项应用于标准学习率调度(如多项式、余弦、指数衰减),在不改变其核心结构的前提下提升性能。
- 超参数 k 控制学习率的变化率:增大 k 可提升训练后期学习率的变化速度,从而在接近训练结束时加速收敛。
- 该方法在微积分基础上具有数学严谨性,k-decay 项通过解析积分修改后的 k 阶导数推导得出。
- 该方法计算高效,无需额外的前向或反向传播,可适用于任何现有学习率调度。
实验结果
研究问题
- RQ1学习率的变化率(ROC)与模型训练性能之间有何关联,特别是在训练后期?
- RQ2通过高阶导数提升学习率的变化率,是否能在不同数据集和网络架构上实现一致的精度提升?
- RQ3超参数 k 如何影响 k-decay 方法的性能?其在不同模型上的最优取值范围是什么?
- RQ4k-decay 能否在不增加计算成本的前提下,推广至多种现有学习率调度(如多项式、余弦、指数)?
- RQ5与 SOTA 自适应学习率调度方法(如 SGDR、CLR 和 AutoLRS)相比,k-decay 在精度和训练稳定性方面是否表现更优?
主要发现
- 在 ImageNet 上使用 ResNet-50 时,k-decay 将 top-1 精度提升 1.25%,分别优于 SGDR、AutoLRS 和 CLR 1.03%、0.96% 和 0.95%。
- 在 CIFAR-100 上,k-decay 相较于基础多项式调度实现 2.07% 的精度提升,当 k=2.0 时,top-1 错误率为 23.11%。
- 在 CIFAR-10 上,该方法相较基础多项式调度实现 1.08% 的精度提升,表明其在不同数据集上均具有一致的增益。
- 测试错误率随 k 值增加而降低,直至达到一个阈值 k_v,之后性能开始下降,表明模型对 k 值存在特定敏感性。
- 深层网络(如 ResNet-101)的 k_v 阈值较低(k_v=3),而浅层网络(如 ResNet-47,k_v≈7)的 k_v 阈值较高,表明深层网络对高 k 值更敏感。
- 损失曲线显示,较高的 k 值虽在早期训练阶段导致收敛变慢,但因学习率衰减更陡峭,最终实现更快的收敛,带来更低的最终损失和更好的泛化性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。