[论文解读] VeLO: Training Versatile Learned Optimizers by Scaling Up
VeLO 是一种多功能、无需超参数调优的元学习优化器,基于在 4,000 多个 TPU 月的计算资源上对多样化任务进行大规模元学习训练而成。它在 14% 的任务上相比调优后的 Adam 优化器最快可实现 16 倍的加速,且在视觉、语言和决策 Transformer 等真实世界模型上展现出良好的泛化能力,证明了大规模元学习优化的可行性。
While deep learning models have replaced hand-designed features across many domains, these models are still trained with hand-designed optimizers. In this work, we leverage the same scaling approach behind the success of deep learning to learn versatile optimizers. We train an optimizer for deep learning which is itself a small neural network that ingests gradients and outputs parameter updates. Meta-trained with approximately four thousand TPU-months of compute on a wide variety of optimization tasks, our optimizer not only exhibits compelling performance, but optimizes in interesting and unexpected ways. It requires no hyperparameter tuning, instead automatically adapting to the specifics of the problem being optimized. We open source our learned optimizer, meta-training code, the associated train and test data, and an extensive optimizer benchmark suite with baselines at velo-code.github.io.
研究动机与目标
- 开发一种通用、多功能的元学习优化器,以消除手动调优超参数的需求。
- 将元学习优化器的元训练规模远远扩展至先前工作的范围之外,利用海量计算资源和多样化任务分布。
- 在未见过的任务和真实世界模型(包括视觉、语言和图网络)上评估泛化性能。
- 通过内省分析和基准测试,理解元学习优化器的行为与机制。
- 为未来在深度学习中实现可扩展、自适应优化的研究奠定基础。
提出的方法
- VeLO 是一个神经网络,接收梯度输入并输出参数更新,通过在大规模、多样化优化任务分布上进行元学习进行训练。
- 该优化器使用约 4,000 个 TPU 月的计算资源,在包括视觉、自然语言处理和强化学习模型在内的广泛深度学习任务上进行元训练。
- 元训练采用基于课程的策略,使用异步、批量梯度更新,通过使用较大的外梯度批次以缓解长时序任务中的梯度滞后问题。
- 所学习的优化器架构设计为每步计算开销极低,从而实现高效的推理,并可扩展至更大规模模型。
- 通过 VeLOdrome 基准套件(包含 83 个标准任务)和多个领域的真实世界模型训练进行评估。
- 该系统已开源,完整包含元训练代码、数据和全面的基准套件,获取地址为 velo-code.github.io。
实验结果
研究问题
- RQ1一个元学习优化器是否能在无需超参数调优的情况下,泛化到广泛多样的深度学习任务?
- RQ2扩大元训练的计算资源和任务多样性,对元学习优化器的性能和鲁棒性有何影响?
- RQ3大规模元学习优化器发展出何种机制以自适应地优化多样化训练动态?
- RQ4与手写调优的优化器(如 Adam 和 NAdamW)相比,无超参数优化器在多样化基准测试中的表现如何?
- RQ5当外推至元训练分布之外的任务时,元学习优化器的失败模式和稳定性问题是什么?
主要发现
- 在 VeLOdrome 基准测试的 83 项任务中,VeLO 在 50% 的任务上相比调优后的 Adam 优化器实现了超过 4 倍的加速。
- 在超过 14% 的任务上,VeLO 相比调优后的 Adam 优化器最快可实现 16 倍以上的加速,展现出强大的泛化能力和自适应能力。
- VeLO 在性能和效率上均优于先前的元学习优化器,包括 RNN-MLP 和 STAR 优化器。
- 该优化器在真实世界模型(包括 ResNets、NERF、检测模型、Transformer 和图网络)上表现出色,且无需针对任务进行调优。
- VeLO 在无需任何超参数调整的情况下,实现了在多样化架构和数据集上的竞争力表现。
- 尽管性能出色,VeLO 在分布外任务上偶尔会出现发散现象,凸显了对更优稳定性机制的迫切需求。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。