Skip to main content
QUICK REVIEW

[论文解读] Dynamic learning rate using Mutual Information

Shrihari Vasudevan|arXiv (Cornell University)|May 18, 2018
Stochastic Gradient Optimization Techniques参考文献 13被引用 6
一句话总结

本文提出使用网络输出与真实标签之间的互信息(MI)来在深度神经网络训练过程中动态调整学习率。通过跟踪MI的变化及其相对于参考度量(输入-输出MI)的相对值,该方法实现了基于MI的自适应学习率调度,相比固定学习率策略,在更短的训练时间内实现了相当或更优的性能。

ABSTRACT

This paper demonstrates dynamic hyper-parameter setting, for deep neural network training, using Mutual Information (MI). The specific hyper-parameter studied in this paper is the learning rate. MI between the output layer and true outcomes is used to dynamically set the learning rate of the network through the training cycle; the idea is also extended to layer-wise setting of learning rate. Two approaches are demonstrated - tracking relative change in mutual information and, additionally tracking its value relative to a reference measure. The paper does not attempt to recommend a specific learning rate policy. Experiments demonstrate that mutual information may be effectively used to dynamically set learning rate and achieve competitive to better outcomes in competitive to better time.

研究动机与目标

  • 探究互信息(MI)是否可作为深度神经网络动态超参数调优的可靠度量。
  • 探索利用隐藏层激活与真实标签之间的MI来指导自适应学习率调度的可行性。
  • 评估基于MI的学习率自适应是否能在准确率和训练时间方面优于或匹配固定学习率策略。
  • 将该方法扩展至基于MI作为每层最优性度量的逐层学习率自适应。
  • 展示该方法在处理其他超参数(如批量大小)动态变化时的鲁棒性。

提出的方法

  • 该方法在每个训练周期内,基于随机采样的训练数据子集,使用KSG估计器计算最终层激活与真实标签之间的互信息(IHYLL)。
  • 基于连续周期间IHYLL的相对变化定义动态学习率策略,根据变化的大小和方向调整学习率,实现上升或下降。
  • 扩展策略结合了IHYLL的相对变化及其相对于输入-输出MI(IXY)的归一化值,提供一种基于参考的进度度量。
  • 学习率通过分段规则更新,根据阈值和缩放因子(γ1, γ2, γ3)增加或减少学习率,且针对不同数据集进行独立调优。
  • 该方法通过计算每层的MI并应用独立的学习率调整,支持网络级和逐层动态学习率调度。
  • 通过使用每周期固定样本量(1000)优化MI估计,基于收敛曲线显示该样本量下估计值稳定。

实验结果

研究问题

  • RQ1网络输出与真实标签之间的互信息能否作为深度学习中动态学习率调整的可靠信号?
  • RQ2同时跟踪MI的变化量和其相对值是否能相比静态或基于梯度的学习率策略,提升训练效率与模型性能?
  • RQ3基于MI的学习率调度是否能有效响应其他超参数(如批量大小)的变化,而无需人工重新调优?
  • RQ4基于MI的逐层学习率自适应在深度网络中是否可行且有益于改善训练动态?
  • RQ5基于MI的动态学习率与标准固定学习率策略相比,在准确率和训练时间方面表现如何?

主要发现

  • 基于MI的动态学习率策略在MNIST和CIFAR-10数据集上均实现了与固定学习率策略相当或更优的测试准确率。
  • 采用该动态学习率策略的训练达到相当或更优性能所需时间更短,表明训练效率得到提升。
  • 该方法在训练过程中成功适应了批量大小的增加,自动调整学习率以维持性能,无需人工干预。
  • 引入参考度量(IXY)使该方法能够检测网络相对于信息容量的性能不足,从而实现纠正性学习率调整。
  • 逐层基于MI的学习率调度在合理时间内取得了具有竞争力的结果,证明了使用MI实现逐层优化的可行性。
  • KSG估计器在1000个样本量下提供了稳定的MI估计,使大规模训练中每周期的MI计算成为可能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。