Skip to main content
QUICK REVIEW

[论文解读] Ranger21: a synergistic deep learning optimizer

Less Wright, Nestor Demeure|arXiv (Cornell University)|Jun 25, 2021
Advanced Neural Network Applications参考文献 22被引用 4
一句话总结

Ranger21 是一种协同式深度学习优化器,将 AdamW 与八种互补的优化技术(如自适应梯度裁剪、权重衰减重加权和 Lookahead)相结合,实现了更快的收敛速度、更平滑的训练曲线,并可在不使用批量归一化的情况下成功训练 ImageNet2012 上的 ResNet50 模型,而 AdamW 则完全无法收敛。

ABSTRACT

As optimizers are critical to the performances of neural networks, every year a large number of papers innovating on the subject are published. However, while most of these publications provide incremental improvements to existing algorithms, they tend to be presented as new optimizers rather than composable algorithms. Thus, many worthwhile improvements are rarely seen out of their initial publication. Taking advantage of this untapped potential, we introduce Ranger21, a new optimizer which combines AdamW with eight components, carefully selected after reviewing and testing ideas from the literature. We found that the resulting optimizer provides significantly improved validation accuracy and training speed, smoother training curves, and is even able to train a ResNet50 on ImageNet2012 without Batch Normalization layers. A problem on which AdamW stays systematically stuck in a bad initial state.

研究动机与目标

  • 为解决深度学习优化器研究中的碎片化问题,即增量改进常被呈现为独立优化器而非可组合组件。
  • 探究将多个独立验证的优化技术组合是否能产生超越单个组件的协同性能增益。
  • 证明单一统一优化器可超越如 AdamW 等成熟基线模型,在包括此前被认为难以训练的架构在内的挑战性基准上表现更优。
  • 提供一个公开可用、模块化的优化器,使实践者无需重新实现即可受益于最先进优化技术。
  • 探索元优化与模块化设计在今后自适应优化器构建中的潜力。

提出的方法

  • Ranger21 以 AdamW 为核心优化引擎,通过梯度和平方梯度的指数移动平均维持自适应学习率。
  • 集成自适应梯度裁剪,通过动态限制大梯度来稳定训练,防止在高方差小批量数据中发散。
  • 应用权重衰减重加权,将权重衰减与学习率解耦,提升泛化能力和训练稳定性。
  • 引入 Lookahead 优化器,通过慢速移动平均更新规则改进收敛性。
  • 采用 Rectified Adam (RAdam) 技术,校正早期训练阶段自适应学习率的方差。
  • 应用梯度归一化和改进的学习率调度策略,进一步稳定优化动态并提升泛化性能。

实验结果

研究问题

  • RQ1是否可将多个可组合的优化改进整合到单一优化器中,从而在性能上实现超越各独立组件的协同增益?
  • RQ2由经验证实的技术构建的统一优化器是否能在 ImageNet2012 等标准基准上超越 AdamW?
  • RQ3Ranger21 是否能在不使用批量归一化层的情况下成功训练 ResNet50,而 AdamW 无法收敛?
  • RQ4在训练速度、验证准确率和训练曲线平滑性方面,Ranger21 与 AdamW 相比表现如何?
  • RQ5可组合、模块化的优化组件在不同架构和数据集上的泛化能力有多大?

主要发现

  • Ranger21 在 ImageNet2012 上达到的最终验证准确率显著高于 AdamW,展现出更优的泛化能力。
  • 与 AdamW 相比,Ranger21 训练达到关键验证准确率水平的速度快至多 3 倍,表明性能有显著提升。
  • Ranger21 生成了更平滑的训练曲线,损失振荡减少,表明优化动态更稳定。
  • 与 AdamW 在无归一化 ResNet50 上完全无法收敛(损失恒定在 ~0.1)不同,Ranger21 在 60 个周期内成功训练模型并实现损失持续下降。
  • 该优化器在多个随机种子下表现一致,证实其鲁棒性,而非依赖于偶然的初始化。
  • Ranger21 已公开提供,包含即用的 PyTorch 和 Flax 实现,支持立即采用和社区反馈。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。