Skip to main content
QUICK REVIEW

[论文解读] Accelerating Feedforward Computation via Parallel Nonlinear Equation Solving

Yang Song, Chenlin Meng|arXiv (Cornell University)|Feb 10, 2020
Model Reduction and Neural Networks参考文献 30被引用 5
一句话总结

本文提出了一种新颖的方法,通过将前向传播计算重新表述为使用可并行化的雅可比(Jacobi)和高斯-赛德尔(Gauss-Seidel)定点迭代法求解非线性方程组,从而加速神经网络和自回归模型中的前向传播计算。该方法在自回归采样中实现了最高达26倍的加速,在RNN训练中实现了超过2倍的加速,通过在保持精确输出的同时实现顺序操作的并行执行,仅引入极小的误差容限。

ABSTRACT

Feedforward computation, such as evaluating a neural network or sampling from an autoregressive model, is ubiquitous in machine learning. The sequential nature of feedforward computation, however, requires a strict order of execution and cannot be easily accelerated with parallel computing. To enable parallelization, we frame the task of feedforward computation as solving a system of nonlinear equations. We then propose to find the solution using a Jacobi or Gauss-Seidel fixed-point iteration method, as well as hybrid methods of both. Crucially, Jacobi updates operate independently on each equation and can be executed in parallel. Our method is guaranteed to give exactly the same values as the original feedforward computation with a reduced (or equal) number of parallelizable iterations, and hence reduced time given sufficient parallel computing power. Experimentally, we demonstrate the effectiveness of our approach in accelerating (i) backpropagation of RNNs, (ii) evaluation of DenseNets, and (iii) autoregressive sampling of MADE and PixelCNN++, with speedup factors between 2.1 and 26 under various settings.

研究动机与目标

  • 解决神经网络和自回归模型中前向传播计算固有的顺序瓶颈,该瓶颈限制了并行加速的潜力。
  • 通过利用非线性方程的数值求解器,实现对传统上顺序执行的前向传播过程的并行化。
  • 开发一种通用方法,适用于多种机器学习工作负载,包括RNN训练、DenseNet推理和自回归采样。
  • 在标准硬件上对真实世界模型展示实际的加速效果,而不仅限于理论上的并行性。
  • 通过迭代求解器中的提前停止策略,探索近似误差与计算时间之间的权衡。

提出的方法

  • 将前向传播计算重新表述为求解一个三角形非线性方程组,其中每个层或步骤对应一个方程。
  • 应用雅可比定点迭代法,该方法独立更新所有变量,从而实现方程间的完全并行化。
  • 将高斯-赛德尔迭代法作为基线,该方法按顺序处理方程,与标准前向传播计算完全一致。
  • 开发结合雅可比与高斯-赛德尔迭代的混合方法,以在并行性与收敛质量之间取得平衡。
  • 利用迭代求解器会逐步产生更精确的近似解这一事实,允许通过提前停止来在精度与速度之间进行权衡。
  • 采用数值延拓和松弛技术以提高非线性系统中的收敛性与稳定性。

实验结果

研究问题

  • RQ1是否可以通过将前向传播计算重新表述为非线性方程求解,利用并行化实现神经网络和自回归模型中前向传播的加速?
  • RQ2雅可比类迭代法(其本身具有内在并行性)在多大程度上能匹配标准顺序前向传播计算的精度?
  • RQ3混合雅可比-高斯-赛德尔方法在速度和精度方面相较于纯雅可比或纯高斯-赛德尔方法有何改进?
  • RQ4在真实世界模型(如RNN、DenseNet和自回归模型)上,该方法可实现的实际加速收益是多少?
  • RQ5在何种情况下,由于结构依赖性或实现开销,该方法会失效或表现不佳?

主要发现

  • 在单个GPU上,该方法在CIFAR-10数据集上的MADE模型祖先采样中实现了26倍的加速。
  • 在PixelCNN++采样中,该方法在MNIST上实现了6.5倍的加速,在CIFAR-10上实现了2.1倍的加速。
  • 在RNN训练中,该方法将训练时间减少了两倍以上,展示了在反向传播中的显著加速效果。
  • 在DenseNet推理中,雅可比方法实现了估计的2.1倍加速,由于实现限制,该结果通过仿真验证。
  • 混合雅可比-高斯-赛德尔方法在缓存有效时,优于纯雅可比方法和带缓存的前向传播采样。
  • 当模型在顺序阶段之间的依赖关系较弱且可容忍微小数值误差时,该方法效果最佳。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。