Skip to main content
QUICK REVIEW

[论文解读] Learning Rate Annealing Can Provably Help Generalization, Even for Convex Problems

Preetum Nakkiran|arXiv (Cornell University)|May 15, 2020
Stochastic Gradient Optimization Techniques参考文献 16被引用 10
一句话总结

本文证明了学习率退火——即先使用较大的初始学习率,随后减小为较小的学习率——即使在凸问题(如二维线性回归)中也能可证明地提升泛化性能。通过利用训练损失与测试损失曲率之间的不匹配以及早停策略,退火的梯度下降法所能达到的最小值,其测试损失显著低于使用小而恒定学习率的梯度流方法。

ABSTRACT

Learning rate schedule can significantly affect generalization performance in modern neural networks, but the reasons for this are not yet understood. Li-Wei-Ma (2019) recently proved this behavior can exist in a simplified non-convex neural-network setting. In this note, we show that this phenomenon can exist even for convex learning problems -- in particular, linear regression in 2 dimensions. We give a toy convex problem where learning rate annealing (large initial learning rate, followed by small learning rate) can lead gradient descent to minima with provably better generalization than using a small learning rate throughout. In our case, this occurs due to a combination of the mismatch between the test and train loss landscapes, and early-stopping.

研究动机与目标

  • 证明学习率退火可在凸优化问题中提升泛化性能,挑战‘非凸性是此类效应必要条件’的假设。
  • 分析学习率调度、早停策略与经验(训练)损失与总体(测试)损失曲率之间差异之间的相互作用。
  • 提供一个理论基础坚实且极简的实例,表明退火策略在训练损失相同的情况下,其泛化性能优于恒定的小学习率,即使训练损失完全一致。
  • 澄清学习率调度带来的泛化优势并非仅源于非凸性或隐式偏差,而可源自优化动力学与估计误差。

提出的方法

  • 构建一个二维线性回归问题,其中真实参数向量与数据分布均匀采样两个正交特征。
  • 基于经验协方差矩阵与真实协方差矩阵,分别定义训练损失与测试(总体)损失函数,从而在两者之间产生曲率不匹配。
  • 比较两种优化策略:(A) 使用小而恒定学习率的梯度流;(B) 使用大步长的梯度下降,随后切换为梯度流。
  • 利用大初始学习率在曲率最高方向(第一维坐标)引发振荡,从而在离散阶段阻止该方向的完全优化。
  • 基于特征值比与衰减率,对总体损失的界进行分析,从而研究参数轨迹与最终测试损失。
  • 证明在特定数据采样条件下(如以3/4的概率采样两个相同样本),退火方法的测试损失仅为恒定小学习率方法的一半。

实验结果

研究问题

  • RQ1在全局最小值唯一的凸问题中,学习率退火是否能改善泛化性能?
  • RQ2在凸设置下,学习率调度带来泛化性能提升的内在机制是什么?
  • RQ3训练与测试损失曲率之间的不匹配如何与早停策略相互作用,从而影响泛化性能?
  • RQ4退火的优势是否源于非凸性?还是其可在强凸问题中出现?
  • RQ5即使达到相同的训练损失,梯度流与采用大初始步长的梯度下降是否可能产生不同的泛化结果?

主要发现

  • 在二维线性回归问题中,当训练损失相同时,学习率退火可使测试损失降低至恒定小学习率梯度流方法的一半。
  • 在训练数据采样中以3/4的概率,退火方法的测试损失为恒定小学习率方法的两倍低。
  • 该改进源于大初始学习率阻止了在训练损失曲率高但真实分布中曲率低的方向上的优化。
  • 关键机制在于训练与测试损失曲率之间的不匹配,以及早停策略的结合,从而打破了在给定训练损失下最小值的唯一性。
  • 该结果即使在强凸问题中依然成立,表明非凸性并非学习率调度影响泛化性能的必要条件。
  • 理论分析确认,采用大步长的梯度下降随后切换为梯度流,可逃离梯度流本身会收敛到的泛化性能较差的极小值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。