Skip to main content
QUICK REVIEW

[论文解读] Single Stream Parallelization of Recurrent Neural Networks for Low Power and Fast Inference

Wonyong Sung, Jin-Hwan Park|arXiv (Cornell University)|Mar 30, 2018
Neural Networks and Applications参考文献 3被引用 5
一句话总结

本文提出了一种基于QRNN和SRU架构的单流时域并行化方法,用于循环神经网络(RNNs)以减少DRAM访问次数,并在移动和嵌入式系统上加速推理。通过同时处理多个时间步,该方法在时间步之间复用权重,显著降低内存带宽使用量,在128步并行化下,ARM CPU上的推理速度最高提升了1,434.6%。

ABSTRACT

As neural network algorithms show high performance in many applications, their efficient inference on mobile and embedded systems are of great interests. When a single stream recurrent neural network (RNN) is executed for a personal user in embedded systems, it demands a large amount of DRAM accesses because the network size is usually much bigger than the cache size and the weights of an RNN are used only once at each time step. We overcome this problem by parallelizing the algorithm and executing it multiple time steps at a time. This approach also reduces the power consumption by lowering the number of DRAM accesses. QRNN (Quasi Recurrent Neural Networks) and SRU (Simple Recurrent Unit) based recurrent neural networks are used for implementation. The experiments for SRU showed about 300% and 930% of speed-up when the numbers of multi time steps are 4 and 16, respectively, in an ARM CPU based system.

研究动机与目标

  • 解决移动和嵌入式系统中RNN推理存在的高DRAM带宽瓶颈问题,这些系统片上内存不足。
  • 克服由于顺序递归依赖关系导致单流RNN并行度受限的挑战。
  • 通过减少内存访问开销,实现在低功耗、单用户系统(如智能手机)上的高效推理。
  • 证明即使存在反馈结构,QRNN和SRU等简单RNN变体也能实现有效的时域并行化。
  • 通过算法级并行化在多个时间步之间复用权重,实现高速、低功耗推理。

提出的方法

  • 对单流RNN推理应用多时间步并行化,同时处理多个时间步以复用权重。
  • 利用QRNN和SRU模型的简单反馈结构,使递归部分可被隔离并实现并行化。
  • 设计一种单流并行算法,仅一次加载权重并在多个时间步中重复使用,从而降低DRAM访问频率。
  • 在Intel和ARM CPU平台上实现该方法,以评估不同内存子系统下的性能表现。
  • 选用SRU和QRNN模型作为测试平台,因其计算简单且相比LSTM具有更低的递归复杂度。
  • 测量从1步到128步并行化不同级别下的速度提升和执行时间,以量化性能增益。

实验结果

研究问题

  • RQ1尽管存在顺序递归依赖关系,是否可以通过并行处理多个时间步来加速单流RNN推理?
  • RQ2在嵌入式系统中,多时间步并行化在多大程度上减少了RNN的DRAM访问频率?
  • RQ3与传统RNN(如LSTM)相比,QRNN和SRU架构为何能实现更高效的时域并行化?
  • RQ4在ARM与Intel CPU平台上,随着并行化程度的提高,可实现的性能提升(速度提升)如何?
  • RQ5减少DRAM访问的收益是否随模型大小和系统内存带宽的增加而扩大?

主要发现

  • 在ARM CPU上,大型QRNN模型实现128步并行化后,相比单步推理,速度提升了1,434.6%。
  • 在ARM上,小型QRNN模型实现128步并行化后,速度提升达1,108.9%,表明在低带宽系统中具有出色的可扩展性。
  • 在Intel CPU上,大型SRU模型在128步并行化下实现了1,325.0%的速度提升,表明在高带宽平台上的高效率。
  • ARM系统上的速度提升始终高于Intel CPU,这是由于在内存带宽较低的系统中,减少DRAM访问的影响更为显著。
  • 更大的RNN模型相比更小的模型获得了更高的相对速度提升,因为权重加载的固定开销被更充分地分摊。
  • 该方法在Intel CPU上实现了超过500%的速度提升,在ARM CPU上超过1,250%,证实其在低功耗、高性能推理中的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。