Skip to main content
QUICK REVIEW

[论文解读] Large-Batch Training for LSTM and Beyond

Yang You, Jonathan Hseu|arXiv (Cornell University)|Jan 24, 2019
Advanced Neural Network Applications参考文献 27被引用 12
一句话总结

本文提出线性周期渐进预热(LEGW),一种自动超参数调优方法,可在理论上合理的平方根学习率调度方案下,实现LSTM与CNN模型的有效大批次训练。LEGW在LSTM任务上实现了平均5.3倍的加速,且在不进行手动调优的情况下,将批次大小扩展至32K时仍保持准确率,优于以往的线性缩放方法。

ABSTRACT

Large-batch training approaches have enabled researchers to utilize large-scale distributed processing and greatly accelerate deep-neural net (DNN) training. For example, by scaling the batch size from 256 to 32K, researchers have been able to reduce the training time of ResNet50 on ImageNet from 29 hours to 2.2 minutes (Ying et al., 2018). In this paper, we propose a new approach called linear-epoch gradual-warmup (LEGW) for better large-batch training. With LEGW, we are able to conduct large-batch training for both CNNs and RNNs with the Sqrt Scaling scheme. LEGW enables Sqrt Scaling scheme to be useful in practice and as a result we achieve much better results than the Linear Scaling learning rate scheme. For LSTM applications, we are able to scale the batch size by a factor of 64 without losing accuracy and without tuning the hyper-parameters. For CNN applications, LEGW is able to achieve the same accuracy even as we scale the batch size to 32K. LEGW works better than previous large-batch auto-tuning techniques. LEGW achieves a 5.3X average speedup over the baselines for four LSTM-based applications on the same hardware. We also provide some theoretical explanations for LEGW.

研究动机与目标

  • 解决尽管LSTM等RNN模型被广泛使用,但缺乏有效的大型批次训练技术的问题。
  • 克服在CNN中将批次大小扩展至8K以上时,对大量超参数调优的依赖。
  • 弥合理论上的平方根缩放与实际大批次训练之间的差距,后者至今成效有限。
  • 开发一种自动化、鲁棒的方法,在多种架构上保持模型准确率的同时最大化训练速度。
  • 在RNN与CNN工作负载上均证明LEGW的有效性,实现一致的性能提升。

提出的方法

  • 提出线性周期渐进预热(LEGW),一种随批次大小平方根缩放学习率的预热策略。
  • 应用平方根缩放以维持梯度方差的稳定性,该方法在理论上已有先前研究支持。
  • 采用线性递增的预热调度方案,预热周期固定,且与批次大小的倒数成正比。
  • 将LEGW与现有优化器(如CNN中的LARS和RNN中的标准SGD)集成,以确保兼容性与性能。
  • 基于批次大小自动确定学习率与预热时长,消除手动调优的需要。
  • 在多个基准测试中验证该方法:GNMT(LSTM)、PTB(LSTM)以及使用ResNet50的ImageNet(CNN)。

实验结果

研究问题

  • RQ1平方根缩放能否在RNN与CNN的大批次训练中有效应用于实际场景?
  • RQ2LEGW是否能在将批次大小扩展至8K以上时,消除对人工超参数调优的需求?
  • RQ3与线性缩放及其他自动调优方法相比,LEGW在准确率与速度方面表现如何?
  • RQ4LEGW能否在LSTM与CNN模型中将批次大小扩展至32K时仍保持模型准确率?
  • RQ5LEGW在大批次下稳定训练的理论基础是什么?

主要发现

  • 在GNMT(LSTM)中,LEGW在将批次大小从256提升至4096时,保持BLEU得分为22.2,且无需任何超参数调优。
  • 在PTB(LSTM)中,LEGW在批次大小为8192(提升32倍)时保持性能,无准确率下降且无需调优。
  • 在使用ResNet50的ImageNet上,LEGW在批次大小为32,768时达到93.18%的top-5准确率,与基准标准一致,且无需调优。
  • 在相同TPU-v2硬件上,LEGW在四个基于LSTM的应用中相较基线实现了平均5.3倍的加速。
  • LEGW优于以往的自动调优技术与线性缩放方案,在极端批次大小下仍保持更高准确率。
  • 该方法在多种模型上实现了稳定性能,展示了在RNN与CNN场景下的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。