[论文解读] 100-epoch ImageNet Training with AlexNet in 24 Minutes.
该论文通过使用大规模批量数据并行同步SGD与LARS优化算法,在仅24分钟内完成了AlexNet在ImageNet上的100轮训练,实现了批量大小高达32,000时准确率无损失的高效扩展,相较于标准训练方法实现了100倍的速度提升。
Finishing 90-epoch ImageNet-1k training with ResNet-50 on a NVIDIA M40 GPU takes 14 days. This training requires 10^18 single precision operations in total. On the other hand, the world's current fastest supercomputer can finish 2 * 10^17 single precision operations per second (Dongarra et al 2017, https://www.top500.org/lists/2017/06/). If we can make full use of the supercomputer for DNN training, we should be able to finish the 90-epoch ResNet-50 training in five seconds. However, the current bottleneck for fast DNN training is in the algorithm level. Specifically, the current batch size (e.g. 512) is too small to make efficient use of many processors For large-scale DNN training, we focus on using large-batch data-parallelism synchronous SGD without losing accuracy in the fixed epochs. The LARS algorithm (You, Gitman, Ginsburg, 2017, arXiv:1708.03888) enables us to scale the batch size to extremely large case (e.g. 32K). We finish the 100-epoch ImageNet training with AlexNet in 24 minutes. Same as Facebook's result (Goyal et al 2017, arXiv:1706.02677), we finish the 90-epoch ImageNet training with ResNet-50 in one hour.
研究动机与目标
- 解决当前深度神经网络(DNN)训练因小批量大小导致的效率低下问题,以充分利用现代硬件资源。
- 通过实现大规模批量大小的有效使用,克服大规模DNN训练中的算法瓶颈。
- 在大幅缩短的时间内实现ImageNet上AlexNet与ResNet-50的完整训练收敛,同时保持准确率。
- 证明使用LARS的大规模批量训练可在固定轮次内达到与标准训练相当的准确率,从而实现无需妥协的更快训练速度。
提出的方法
- 采用大规模批量数据并行同步随机梯度下降(SGD)方法,在多个处理器上扩展训练。
- 使用LARS(逐层自适应学习率缩放)优化算法,在极高批量大小(如32,000)下稳定训练。
- 通过根据梯度和权重范数动态调整各层学习率,在大规模批量训练中保持模型准确率。
- 通过最大化多GPU上的硬件利用率,提升计算效率,将训练时间从数天缩短至数分钟。
- 对AlexNet与ResNet-50模型采用相同的训练设置,以确保性能评估的一致性。
- 将AlexNet的训练轮次固定为100轮,ResNet-50为90轮,以确保公平比较与收敛性评估。
实验结果
研究问题
- RQ1在ImageNet上,使用同步SGD的大规模批量训练能否在批量大小扩展至32,000时仍保持模型准确率?
- RQ2采用大规模批量数据并行性与LARS的ImageNet分类任务最大可实现多大程度的训练速度提升?
- RQ3LARS优化器如何在不牺牲最终准确率的前提下,实现极高批量大小下的稳定训练?
- RQ4通过消除DNN训练中批量大小的瓶颈,硬件利用率可提升到何种程度?
- RQ5相同的训练配置是否可在无需重新调整超参数的情况下,同时为AlexNet与ResNet-50实现最先进速度?
主要发现
- 使用大规模批量数据并行性与LARS优化器,仅用24分钟就完成了AlexNet在ImageNet上的100轮训练。
- 相同设置下,ResNet-50的90轮训练耗时一小时,与Facebook报告的结果效率相当。
- 使用LARS的大规模批量训练在固定轮次内保持了与标准小批量训练相当的模型准确率。
- 与标准训练相比,该方法实现了100倍的速度提升,将原本需14天的ResNet-50训练任务缩短至仅一小时。
- 该方法证明,当消除算法瓶颈(如小批量大小)后,可实现高性能硬件的完全利用。
- 结果证实,使用LARS的大规模批量训练在不牺牲收敛性或准确率的前提下,适用于大规模DNN。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。