Skip to main content
QUICK REVIEW

[论文解读] A Large Batch Optimizer Reality Check: Traditional, Generic Optimizers Suffice Across Batch Sizes

Zachary Nado, Justin Gilmer|arXiv (Cornell University)|Feb 12, 2021
Advanced Neural Network Applications参考文献 22被引用 8
一句话总结

本论文表明,传统的优化器如Nesterov动量和Adam在ResNet-50和BERT基准测试中,无需使用层间归一化,即可与专门设计的大批量优化器LARS和LAMB的性能相匹配或超越。关键发现是,当进行充分调优时,标准优化器在大批次设置下可实现相当或更优的准确率,从而质疑了在大规模训练中采用复杂更新规则的必要性。

ABSTRACT

Recently the LARS and LAMB optimizers have been proposed for training neural networks faster using large batch sizes. LARS and LAMB add layer-wise normalization to the update rules of Heavy-ball momentum and Adam, respectively, and have become popular in prominent benchmarks and deep learning libraries. However, without fair comparisons to standard optimizers, it remains an open question whether LARS and LAMB have any benefit over traditional, generic algorithms. In this work we demonstrate that standard optimization algorithms such as Nesterov momentum and Adam can match or exceed the results of LARS and LAMB at large batch sizes. Our results establish new, stronger baselines for future comparisons at these batch sizes and shed light on the difficulties of comparing optimizers for neural network training more generally.

研究动机与目标

  • 评估LARS和LAMB在大批次设置下是否确实优于标准优化器。
  • 通过使用调优充分的标准优化器,建立更强、更公平的大批次神经网络训练基线。
  • 探究LARS和LAMB的性能提升是源于更优的优化,还是间接的正则化效应。
  • 强调超参数调优在优化器比较中的关键作用,并指出偏差基准测试的风险。
  • 倡导未来优化器研究中采用更严格、标准化的评估协议。

提出的方法

  • 在ImageNet上微调ResNet-50,使用Nesterov动量和Adam在大批次(最高达32,768)设置下进行训练,并进行了广泛的超参数调优。
  • 采用与LARS和LAMB基准研究中相同的学习率调度和正则化技术,以确保公平比较。
  • 与原始LARS和LAMB研究保持完全一致的数据预处理、模型架构和训练协议。
  • 通过消融研究,将优化器选择的影响与其他训练流水线组件的影响分离开来。
  • 在训练损失和验证损失上同时评估性能,以区分优化速度与正则化效应的影响。
  • 在BERT预训练任务上进行实验,以检验结果在计算机视觉之外的泛化能力。

实验结果

研究问题

  • RQ1LARS和LAMB在大批次设置下是否确实为标准优化器(如Adam和Nesterov动量)提供了可测量的性能优势?
  • RQ2LARS和LAMB的性能提升在多大程度上源于更优的优化,而非隐式的正则化效应?
  • RQ3当投入同等的超参数调优工作量时,标准优化器能否实现与LARS和LAMB相当或更优的结果?
  • RQ4优化器比较对学习率调度和训练流水线配置差异的敏感程度如何?
  • RQ5这些发现对深度学习中新型优化器的基准测试与评估有何启示?

主要发现

  • 在批量大小为32,768时,Nesterov动量在ResNet-50上的验证准确率与LARS相当或更优,尽管LARS是专为大批次训练设计的。
  • 在批量大小高达65,536时,Adam在BERT预训练任务上的表现与LAMB相当或更优,这与“Adam无法扩展到16,384以上”的说法相矛盾。
  • LARS和LAMB的性能提升并非源于更优的优化,而更可能源于隐式正则化效应,因为标准优化器在训练准确率上表现更优,但验证性能相近。
  • 本研究发现,学习率调度的影响甚至超过优化器选择本身,且调优不均衡会导致对新优化器优越性的误导性结论。
  • 当经过充分调优时,Adam和Nesterov动量等标准优化器依然具有竞争力,甚至经常优于LARS和LAMB,从而质疑了复杂、专用更新规则的必要性。
  • 结果强调了建立标准化、具有竞争力的基准的重要性,即所有优化器应在相同的调优和流水线条件下进行评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。