Skip to main content
QUICK REVIEW

[论文解读] Wide-minima Density Hypothesis and the Explore-Exploit Learning Rate Schedule

Nikhil Iyer, V Thejas|arXiv (Cornell University)|Mar 9, 2020
Multimodal Machine Learning Applications参考文献 45被引用 14
一句话总结

本文提出了广域极小值密度假说,解释了在深度学习损失曲面中,广域极小值比窄极小值更稀少,从而提出一种新型的探索-利用学习率调度方法(Knee调度),通过延长高学习率的探索阶段,提高找到广域极小值的概率。该方法在多个视觉与自然语言处理基准上实现了最先进性能,或在保持原始准确率的同时将训练时间减少高达57%。

ABSTRACT

Several papers argue that wide minima generalize better than narrow minima. In this paper, through detailed experiments that not only corroborate the generalization properties of wide minima, we also provide empirical evidence for a new hypothesis that the density of wide minima is likely lower than the density of narrow minima. Further, motivated by this hypothesis, we design a novel explore-exploit learning rate schedule. On a variety of image and natural language datasets, compared to their original hand-tuned learning rate baselines, we show that our explore-exploit schedule can result in either up to 0.84% higher absolute accuracy using the original training budget or up to 57% reduced training time while achieving the original reported accuracy. For example, we achieve state-of-the-art (SOTA) accuracy for IWSLT'14 (DE-EN) dataset by just modifying the learning rate schedule of a high performing model.

研究动机与目标

  • 探究为何高初始学习率能提升深度神经网络的泛化性能。
  • 检验损失曲面中广域极小值的密度是否显著低于窄极小值。
  • 设计一种系统化的学习率调度策略,明确考虑为找到广域极小值而需进行充分探索的需求。
  • 评估所提出的探索-利用调度策略在准确率与训练效率方面是否优于人工调优的基线方法。

提出的方法

  • 提出广域极小值密度假说:广域极小值在损失曲面中的密度低于窄极小值,因此若缺乏充分探索,将更难被找到。
  • 设计Knee调度:一种两阶段学习率调度策略,初始阶段以恒定高学习率进行探索,随后在利用阶段线性衰减至零。
  • 通过曲率分析估算极小值宽度,实证验证更高测试准确率与更宽极小值之间的相关性。
  • 在多个数据集(CIFAR-10、ImageNet、IWSLT’14、WMT’14)与模型(ResNet、BERT、Transformer)上,改变探索阶段的持续时间,研究其对泛化性能的影响。
  • 在保持总训练预算不变或减少的前提下,通过超参数搜索优化探索阶段的持续时间。
  • 在多种优化器(SGD、Adam、RAdam、LAMB)上进行评估,报告测试准确率、BLEU分数与训练时间。

实验结果

研究问题

  • RQ1延长初始高学习率阶段是否能提升深度网络的泛化性能?
  • RQ2损失曲面中广域极小值的密度是否显著低于窄极小值,从而解释其更难被找到?
  • RQ3一种明确区分探索与利用阶段的系统化学习率调度策略,是否能优于人工调优的调度方案?
  • RQ4与余弦衰减等现有调度策略相比,Knee调度在准确率与训练效率方面表现如何?
  • RQ5Knee调度对初始学习率与探索阶段持续时间的敏感性如何?

主要发现

  • 在IWSLT’14(DE-EN)翻译数据集上,Knee调度仅通过修改高性能模型的学习率调度策略,即实现了最先进测试准确率。
  • 在CIFAR-10上使用ResNet-18时,将探索阶段从5个周期延长至40个周期,测试准确率由95.07%提升至95.34%,最优性能出现在100个探索周期时。
  • 在WMT’14(EN-DE)上对BERT LARGE进行预训练时,Knee调度在33%更短的训练时间内达到了与基线相同的准确率。
  • 在ImageNet上使用ResNet-50时,Knee调度将训练时间减少了44%,同时保持了原始准确率。
  • 在WMT’14(EN-DE)上,Knee调度将训练时间减少了57%,同时实现了与基线相同的测试BLEU分数。
  • 初始学习率越高,最优探索持续时间越短,与假设一致:更大的步长能更快逃离窄极小值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。