[论文解读] Meta-LR-Schedule-Net: Learned LR Schedules that Scale and Generalize.
该论文提出 Meta-LR-Schedule-Net,一种元学习器,通过可微分的显式映射公式,自适应地从训练动态中学习最优学习率(LR)调度策略。该方法在不同设置下具有泛化能力,包括不同的批量大小、网络架构以及 ImageNet 等数据集,并在数据受损情况下尤其优于手工设计的调度策略,通过利用过往训练历史实现更好的泛化性能。
The learning rate (LR) is one of the most important hyper-parameters in stochastic gradient descent (SGD) for deep neural networks (DNNs) training and generalization. However, current hand-designed LR schedules need to manually pre-specify schedule as well as its extra hyper-parameters, which limits its ability to adapt non-convex optimization problems due to the significant variation of training dynamic. To address this issue, we propose a model capable of adaptively learning LR schedule from data. We specifically design a meta-learner with explicit mapping formulation to parameterize LR schedules, which can adjust LR adaptively to comply with current training dynamic by leveraging the information from past training histories. Image and text classification benchmark experiments substantiate the capability of our method for achieving proper LR schedules compared with baseline methods. Moreover, we transfer the learned LR schedule to other various tasks, like different training batch sizes, epochs, datasets, network architectures, especially large scale ImageNet dataset, showing its stronger generalization capability than related methods. Finally, guided by a small set of clean validation set, we show our method can achieve better generalization error when training data is biased with corrupted noise than baseline methods.
研究动机与目标
- 解决手工设计的学习率(LR)调度策略在非凸优化中缺乏对动态训练过程适应能力的局限性。
- 开发一种数据驱动的方法,自动学习最优 LR 调度策略,减少对手动超参数调优的依赖。
- 通过利用少量干净的验证集学习鲁棒的 LR 调度策略,提升在数据损坏情况下的模型泛化能力。
- 实现学习到的 LR 调度策略在不同训练配置(包括批量大小、训练轮数、数据集和网络架构)之间的可迁移性。
- 在图像和文本分类基准测试中,特别是在大规模 ImageNet 上,展示优于基线方法的性能。
提出的方法
- 设计一种元学习器,通过依赖过往训练历史的显式映射公式,参数化 LR 调度策略。
- 模型学习一个可微函数,将历史梯度和损失值映射到每个训练步骤的自适应 LR 值。
- 采用两阶段优化框架端到端训练元学习器,其中外层优化基于验证性能来优化 LR 调度策略。
- 该方法利用少量干净的验证集指导学习可泛化的 LR 调度策略,即使在训练数据存在噪声时也能有效工作。
- 该架构被训练以在不同批量大小、网络深度以及 ImageNet 等数据集等多样化训练设置中实现泛化。
- 该方法实现了学习到的 LR 调度策略在新任务上的零样本迁移,无需重新训练。
实验结果
研究问题
- RQ1学习到的 LR 调度策略能否在 DNN 优化过程中有效适应变化的训练动态?
- RQ2元学习得到的 LR 调度策略在不同批量大小、网络架构和数据集之间泛化能力如何?
- RQ3当训练数据包含损坏或偏差样本时,该方法是否能提升泛化性能?
- RQ4所提出的方法在测试准确率和鲁棒性方面是否优于手工设计的调度策略?
- RQ5少量干净的验证集在多大程度上能指导有效且可迁移的 LR 调度策略的学习?
主要发现
- 即使在训练数据被噪声污染的情况下,Meta-LR-Schedule-Net 在 ImageNet 上的泛化误差仍优于基线方法。
- 学习到的 LR 调度策略在不同训练配置(包括不同批量大小、训练轮数和网络架构)下均表现出良好的泛化能力。
- 该方法在图像和文本分类基准测试中均优于标准的手工设计调度策略,展现出更强的自适应能力。
- 通过利用少量干净的验证集进行学习,该模型在 ImageNet 上实现了更高的测试准确率,表明对数据偏差具有强鲁棒性。
- 元学习器成功捕捉了复杂的训练动态,并据此相应调整学习率,从而实现更快收敛和更优的最终性能。
- 该方法实现了 LR 调度策略在新任务上的零样本迁移,显著减少了对超参数调优的需求。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。