Skip to main content
QUICK REVIEW

[论文解读] Beyond Human-Level Accuracy: Computational Challenges in Deep Learning

Joel Hestness, Newsha Ardalani|arXiv (Cornell University)|Sep 3, 2019
Advanced Neural Network Applications参考文献 32被引用 7
一句话总结

本文预测,要实现深度学习的人类水平准确率,需要将数据集规模扩大33–971倍,模型规模扩大6.6–456倍,且循环神经网络(RNNs)由于其高内存占用和中等计算强度,带来了独特的计算挑战。作者主张采用具备显著更大片上缓存和内存容量的硬件加速器,以解决RNN训练的瓶颈问题,这与当前针对卷积网络优化的加速器设计形成对比。

ABSTRACT

Deep learning (DL) research yields accuracy and product improvements from both model architecture changes and scale: larger data sets and models, and more computation. For hardware design, it is difficult to predict DL model changes. However, recent prior work shows that as dataset sizes grow, DL model accuracy and model size grow predictably. This paper leverages the prior work to project the dataset and model size growth required to advance DL accuracy beyond human-level, to frontier targets defined by machine learning experts. Datasets will need to grow $33$--$971 imes$, while models will need to grow $6.6$--$456 imes$ to achieve target accuracies. We further characterize and project the computational requirements to train these applications at scale. Our characterization reveals an important segmentation of DL training challenges for recurrent neural networks (RNNs) that contrasts with prior studies of deep convolutional networks. RNNs will have comparatively moderate operational intensities and very large memory footprint requirements. In contrast to emerging accelerator designs, large-scale RNN training characteristics suggest designs with significantly larger memory capacity and on-chip caches.

研究动机与目标

  • 预测在关键领域实现深度学习人类水平准确率所需的数据集和模型规模增长。
  • 描述大规模深度学习模型训练的计算与内存需求,特别是RNNs的需求。
  • 识别RNNs与卷积神经网络(CNNs)在训练挑战上的关键差异。
  • 倡导优先考虑内存容量和片上缓存的硬件设计,以实现可扩展的RNN训练。
  • 反驳当前加速器设计趋势中过度强调计算与内存比而忽视内存容量和缓存大小的做法。

提出的方法

  • 基于Hestness等人(2017)的先前幂律缩放规律,根据准确率目标预测数据集和模型规模的增长。
  • 从五个领域(语言建模、机器翻译、语音识别和图像分类)的机器学习专家处收集前沿准确率目标。
  • 利用计算图建模和操作强度指标分析计算需求,比较CNNs与RNNs的性能。
  • 通过语言建模的案例研究,量化在不同并行策略下内存占用和FLOP利用率。
  • 评估模型蒸馏、低精度计算和稀疏计算等算法优化技术,以降低内存需求。
  • 提出硬件设计的转变,包括增大片上缓存和提升内存容量,以更好地支持RNN训练工作负载。

实验结果

研究问题

  • RQ1在关键领域实现深度学习人类水平准确率,需要多大规模的数据集和模型增长?
  • RQ2RNNs在大规模训练中的计算与内存特性与卷积神经网络(CNNs)有何不同?
  • RQ3为何当前加速器设计不适用于大规模RNN训练?需要哪些硬件改进?
  • RQ4模型蒸馏或低精度计算等算法优化能在多大程度上减少RNN的内存占用?
  • RQ5数据并行和模型并行等并行技术如何影响RNN训练中的内存与计算效率?

主要发现

  • 实现深度学习的人类水平准确率,需要将数据集规模扩大33–971倍,模型参数规模扩大6.6–456倍,相较于当前最先进模型。
  • RNNs表现出中等操作强度,其内存占用比当前加速器内存容量(16–32 GB)高出8–100倍。
  • 当前硬件加速器因内存容量和片上缓存过小,尽管针对高计算与内存比进行了优化,但对RNN训练极为不适用。
  • 模型蒸馏和低精度计算等算法优化可将内存需求降低1.5–10倍,但在训练过程中存在局限性。
  • 数据并行和模型并行技术可降低每个加速器的内存使用,但RNNs仍面临高通信开销和因输入重流导致的FLOP利用率低下问题。
  • 具备显著更大片上缓存和内存容量的硬件设计,对于高效扩展RNN训练至关重要,这与当前加速器设计趋势相悖。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。