Skip to main content
QUICK REVIEW

[论文解读] Stochastic Gradient Descent with Hyperbolic-Tangent Decay on Classification

Bo Yang Hsueh, Wei Li|arXiv (Cornell University)|Jun 5, 2018
Advanced Neural Network Applications参考文献 23被引用 4
一句话总结

本文提出了一种新型随机梯度下降(SGD)学习率调度器——双曲正切衰减(HTD),该调度器利用双曲正切函数动态调整训练过程中的学习率。HTD在多个基准测试中(包括ResNet、Wide ResNet、DenseNet和LSTM)的表现优于阶梯衰减和余弦调度器,且所需调参数量少于阶梯衰减,灵活性高于余弦调度,其中HTD(-6,3)被确定为一种稳健的默认配置。

ABSTRACT

Learning rate scheduler has been a critical issue in the deep neural network training. Several schedulers and methods have been proposed, including step decay scheduler, adaptive method, cosine scheduler and cyclical scheduler. This paper proposes a new scheduling method, named hyperbolic-tangent decay (HTD). We run experiments on several benchmarks such as: ResNet, Wide ResNet and DenseNet for CIFAR-10 and CIFAR-100 datasets, LSTM for PAMAP2 dataset, ResNet on ImageNet and Fashion-MNIST datasets. In our experiments, HTD outperforms step decay and cosine scheduler in nearly all cases, while requiring less hyperparameters than step decay, and more flexible than cosine scheduler. Code is available at https://github.com/BIGBALLON/HTD.

研究动机与目标

  • 解决现有SGD学习率调度器在深度学习中面临的超参数敏感性和次优性能问题。
  • 开发一种学习率调度器,结合阶梯衰减的性能优势与自适应方法的灵活性,同时减少可调参数数量。
  • 在多种网络架构和数据集上评估基于双曲正切函数的新调度器的有效性。
  • 识别一种在不同训练场景中具有良好泛化能力的稳健默认配置。

提出的方法

  • 所提出的HTD调度器使用双曲正切函数建模训练轮次中的学习率衰减,定义为 $\alpha_t = \frac{L - U}{2} \cdot \tanh\left(\frac{t}{R}\right) + \frac{L + U}{2}$,其中 $L$ 和 $U$ 分别为学习率的下限和上限,$R$ 控制衰减比率。
  • 学习率在训练初期接近 $U$,并随着训练推进渐近趋近于 $L$,实现平滑且渐进的衰减。
  • 该调度器设计为比余弦衰减更具灵活性(余弦衰减仅允许调节最小和最大学习率),同时比阶梯衰减更少参数化(阶梯衰减需设定多个阶段边界)。
  • 通过标准深度学习基准进行评估:CIFAR-10、CIFAR-100、ImageNet、PAMAP2 和 Fashion-MNIST,模型包括 ResNet、Wide ResNet、DenseNet 和 BLSTM。
  • 通过在不同数据集和训练轮次中调整 $L$、$U$ 和 $R$,分析超参数敏感性,以评估其鲁棒性和泛化能力。

实验结果

研究问题

  • RQ1基于双曲正切函数的学习率调度器是否能在最终模型准确率方面优于已有的阶梯衰减和余弦衰减调度器?
  • RQ2HTD是否在保持或提升性能的同时,所需超参数少于阶梯衰减?
  • RQ3HTD的灵活性与余弦调度相比如何,特别是在可调参数数量和最终准确率方面?
  • RQ4在不同数据集和模型架构下,HTD超参数(如 $L$、$U$、$R$)的最优配置是什么?
  • RQ5HTD的性能是否显著受训练时长影响?是否存在一个单一配置可在不同训练计划中实现良好泛化?

主要发现

  • 在所有评估实验中,HTD(-6,3) 均优于阶梯衰减:在ResNet-18上,ImageNet的top-1错误率降低0.58%;在ResNet-34上,降低0.48%。
  • 在CIFAR-100上,HTD(-6,3) 在 DenseNet-BC-100-12 和 DenseNet-BC-250-24 上分别比余弦调度器提升0.42%的准确率。
  • 在CIFAR-100的WRN-28-10上,HTD(-6,3) 比余弦调度器提升0.81%。
  • 在PAMAP2上,HTD(-6,3) 相较于阶梯衰减降低0.16%的错误率,较余弦调度器降低0.22%。
  • 在Fashion-MNIST上,HTD(-6,3) 相较于阶梯衰减提升0.15%的性能,较余弦调度器提升0.06%。
  • 最优比率 $R$ 因数据集而异:CIFAR-10在200轮训练中 $R=5$,在400轮中 $R=2$;而CIFAR-100在两种设置下均以 $R=10$ 为最优,表明对数据集具有敏感性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。