[论文解读] A Simple Dynamic Learning Rate Tuning Algorithm For Automated Training of DNNs
该论文提出AALR,一种无超参数的自适应学习率算法,通过将当前训练损失与迄今为止观察到的最佳损失进行比较,在DNN训练过程中动态调整学习率,从而实现无需人工干预的通用优化,适用于各类模型和数据集。该方法在无需超参数调优或计算开销增加的前提下,实现了自然训练和对抗性训练中的最先进性能。
Training neural networks on image datasets generally require extensive experimentation to find the optimal learning rate regime. Especially, for the cases of adversarial training or for training a newly synthesized model, one would not know the best learning rate regime beforehand. We propose an automated algorithm for determining the learning rate trajectory, that works across datasets and models for both natural and adversarial training, without requiring any dataset/model specific tuning. It is a stand-alone, parameterless, adaptive approach with no computational overhead. We theoretically discuss the algorithm's convergence behavior. We empirically validate our algorithm extensively. Our results show that our proposed approach \\emph{consistently} achieves top-level accuracy compared to SOTA baselines in the literature in natural as well as adversarial training.
研究动机与目标
- 为解决深度神经网络训练中手动、耗时的超参数调优(尤其是学习率选择)挑战,特别是在新型或对抗性训练场景中。
- 开发一种自动化、通用的学习率调度方法,适用于多样化的模型和数据集,且无需针对特定数据集或模型进行调优。
- 通过基于实时损失监控的动态学习率调整,提升自然训练和对抗性训练中的泛化性能。
- 消除对网格搜索、随机搜索或复杂自适应优化器(如Adam)的依赖,同时保持或超越其性能。
提出的方法
- 该算法在每一步监控训练损失,并与迄今为止观察到的最佳损失进行比较。
- 如果当前损失低于最佳损失,则增加学习率,以在损失曲面中进一步探索。
- 如果当前损失未低于最佳损失,则降低学习率,以避免发散并稳定训练过程。
- 学习率的调整不依赖任何超参数或预设调度策略,因此实现无超参数化且独立运行。
- 该方法设计为计算轻量化,在标准训练之外不引入额外开销。
- 其灵感来源于:增加学习率有助于逃离尖锐极小值,并探索损失曲面中更平坦的区域。
实验结果
研究问题
- RQ1一种简单、无超参数的学习率自适应策略,是否能在自然训练和对抗性训练中均超越现有的自适应优化器(如Adam和RMSProp)?
- RQ2仅基于损失比较的动态学习率调整,是否相比固定或预设调度策略能提升泛化性能?
- RQ3此类方法是否能在无需任务特定调优的前提下,实现对多样化模型和数据集的最先进性能?
- RQ4在对抗性训练中,该算法表现如何?对抗性训练中通常最优学习率区间未知且高度敏感。
- RQ5学习率自适应对深度学习训练中的收敛速度和稳定性有何影响?
主要发现
- 在FGSM白盒攻击下,AALR在CIFAR-10数据集上实现了最先进对抗测试准确率,400轮训练后达到69.85%(WRN-28-10),显著优于SGDR(67.4%)和CLR(68.93%)。
- 在自然训练中,AALR始终与最先进基线模型持平或超越,例如在Cutout数据增强下,WRN-28-10模型达到96.44%,优于基线的96.92%。
- 在对抗性训练中,AALR表现出更稳定的收敛性,并能更快检测到收敛,而Adam在两个自然训练案例中出现灾难性失败。
- 对于SimpleNet-V1模型,AALR在CIFAR-10上对FGSM攻击的对抗准确率达到65.02%,证明其在轻量化模型上的有效性。
- 在所有对抗性训练场景中,AALR均优于Adam,例如在WRN-34-10上,Adam在FGSM攻击下准确率跌至16.13%,表明其在动态损失条件下的泛化能力差。
- 该算法在多种模型(ResNet、VGG、WideResNet、SimpleNet)和数据集(CIFAR-10、CIFAR-100)上均表现出鲁棒性,证实其通用性与可靠性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。