[论文解读] A Generalizable Approach to Learning Optimizers
该论文提出了一种可泛化的学习型超参数优化器(LHOPTs),通过使用LSTM控制器、无量纲特征、相对动作以及一种新颖的奖励函数,学习更新优化器的超参数(如初始学习率)。该方法在ImageNet上实现了2倍的加速,在大规模语言建模任务上实现了2.5倍的加速,跨越了计算量相差超过5个数量级的不同任务,优于调优后的Adam和基线优化器。
A core issue with learning to optimize neural networks has been the lack of generalization to real world problems. To address this, we describe a system designed from a generalization-first perspective, learning to update optimizer hyperparameters instead of model parameters directly using novel features, actions, and a reward function. This system outperforms Adam at all neural network tasks including on modalities not seen during training. We achieve 2x speedups on ImageNet, and a 2.5x speedup on a language modeling task using over 5 orders of magnitude more compute than the training tasks.
研究动机与目标
- 为解决现有学习型优化器在训练分布外的真实任务中缺乏泛化能力的问题。
- 开发一种以泛化为核心优先级的框架,通过学习超参数更新而非模型参数更新,而非专注于特定任务的性能。
- 将策略更新频率与内部优化步数解耦,以提升方法的广泛适用性。
- 设计适用于多样化神经网络架构和模态的特征、动作和奖励函数,以增强鲁棒性和可迁移性。
- 证明学习型优化器能够泛化到计算量相差数个数量级的真实世界问题,且在模型规模上具有显著差异。
提出的方法
- 系统使用LSTM控制器以用户定义的频率更新优化器超参数,该频率独立于内部优化步骤。
- 采用从训练统计量(如梯度范数、损失趋势)中提取的无量纲、归一化特征,以提升在不同任务上的鲁棒性。
- 动作被定义为对超参数的相对变化(例如乘法缩放),以确保对绝对值的不变性。
- 设计了一种新颖的奖励函数,以优化最终模型性能为目标,而非中间指标,从而促进泛化。
- 通过在包括MNIST、CIFAR-10和小型语言建模任务在内的多样化小规模任务上进行强化学习来训练策略。
- 在小规模任务上学习到的超参数调度被直接迁移至大规模模型,无需微调,实现了零样本泛化。
实验结果
研究问题
- RQ1学习型优化器能否泛化到远大于其训练分布规模和类型的任务?
- RQ2与参数更新相比,学习超参数更新是否能提升泛化能力与计算效率?
- RQ3所提出的奖励函数在促进跨多样化神经网络架构和模态的可迁移性方面效果如何?
- RQ4无量纲特征与相对动作在增强对分布偏移的鲁棒性方面有多大的作用?
- RQ5在小规模任务上学习到的单一超参数调度是否能在大规模、已充分调优的模型上实现显著加速?
主要发现
- 与调优后的AdamW相比,LHOPTs在ImageNet训练中实现了2倍的加速,且在目标任务上无需任何超参数调优。
- 在大规模语言建模任务中,LHOPTs实现了2.5倍的加速,尽管其训练任务的平均计算量仅为170 GPU秒。
- 该方法在计算量跨度超过5个数量级的任务间实现了泛化,从小型任务到需高达300 GPU天的模型均适用。
- LHOPTs在语音识别和神经协同过滤任务中均优于MLPerf基线和调优后的Adam,而这些任务在训练阶段均未出现过。
- 计算开销极低——在Transformer上低于20%,在ResNets上低于2%,得益于高效的特征计算和固定大小的策略网络。
- 即使仅在28×28图像上进行训练且未接触注意力机制,该方法仍能实现泛化,表明任务多样性的重要性可能低于以往认为的那样。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。