[论文解读] Step-size Adaptation Using Exponentiated Gradient Updates
本文提出了一种元优化框架,通过使用未归一化的指数梯度更新(EGU)自适应地调整全局学习率和每个坐标的学习率增益,实现在深度学习中自动发现学习率调度。该方法在无需人工学习率调度的情况下达到最先进性能,在CIFAR-10和ImageNet数据集上使用ResNet50和MobileNetV1模型时,性能与基线模型相当或更优。
Optimizers like Adam and AdaGrad have been very successful in training large-scale neural networks. Yet, the performance of these methods is heavily dependent on a carefully tuned learning rate schedule. We show that in many large-scale applications, augmenting a given optimizer with an adaptive tuning method of the step-size greatly improves the performance. More precisely, we maintain a global step-size scale for the update as well as a gain factor for each coordinate. We adjust the global scale based on the alignment of the average gradient and the current gradient vectors. A similar approach is used for updating the local gain factors. This type of step-size scale tuning has been done before with gradient descent updates. In this paper, we update the step-size scale and the gain variables with exponentiated gradient updates instead. Experimentally, we show that our approach can achieve compelling accuracy on standard models without using any specially tuned learning rate schedule. We also show the effectiveness of our approach for quickly adapting to distribution shifts in the data during training.
研究动机与目标
- 解决深度学习优化器对人工调优学习率调度的严重依赖问题。
- 在严谨且可推广的框架下统一现有学习率自适应方法。
- 通过自适应增益和尺度参数,实现有效学习率调度的自动发现。
- 提高训练过程中对数据分布变化的鲁棒性。
- 证明与多种基础优化器(包括Adam、AdaGrad和SGD Momentum)的兼容性。
提出的方法
- 提出一种元优化框架,将全局学习率尺度和每个坐标的学习率增益因子作为可学习超参数进行维护。
- 使用未归一化的指数梯度更新(EGU)来更新全局尺度和局部增益,该方法强制非负性并支持乘法式、稀疏更新。
- EGU更新规则为:θ^{t+1} = θ^t ⊙ exp(−η ∇_θ f(θ^t)),确保稳定且非负的参数更新。
- 该框架可接受任意来自基础优化器(如Adam、AdaGrad、SGD Momentum)的预处理梯度,具有模块化和广泛适用性。
- 使用梯度的指数移动平均(EMA)来计算尺度和增益更新的对齐信号。
- 该方法与内部优化器无关,可作为即插即用的元算法应用。
实验结果
研究问题
- RQ1是否存在一种统一且基于原理的学习率自适应方法,能在大规模深度学习中超越人工学习率调度?
- RQ2基于EGU的全局尺度与每个坐标增益的调节能在自动发现有效学习率调度方面有多高效?
- RQ3所提出的方法是否能在不重新训练的情况下提升泛化能力并适应数据分布变化?
- RQ4该方法在不同架构(如MobileNetV1、ResNet50)和数据集(CIFAR-10、ImageNet)上的表现如何?
- RQ5与启发式或基于梯度的调优方法相比,基于EGU的更新机制在收敛性和稳定性方面是否具有优势?
主要发现
- 在CIFAR-10数据集上使用MobileNetV1时,Funneled Momentum在无学习率调度的情况下达到89.61%的top-1准确率,与采用人工调度的基线模型(89.51%)相当。
- 在ImageNet数据集上使用ResNet50时,Funneled Momentum在无调度情况下达到72.39%的top-1准确率,优于AdaGrad-EMA(70.70%),并显著超过标准Momentum无调度训练的结果(53.80%)。
- 该方法在所有层中自动恢复出类似衰减的学习率调度,且各层具有不同的衰减速率,如图4所示。
- 每个坐标的增益值在初始约5k步内动态上升,随后衰减,表明对相关特征的自适应探索。
- 该方法对分布变化具有鲁棒性,如训练过程中快速适应所证明。
- 代码已公开发布于 https://users.soe.ucsc.edu/~eamid/funnel.html,以支持可复现性和进一步研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。