[论文解读] On the Performance of Network Parallel Training in Artificial Neural Networks
该论文提出了一种基于Cannon算法的内存高效网络并行训练(NPT)方法,用于人工神经网络的分布式矩阵乘法,通过最小化数据复制并避免使用专用硬件,实现了显著的加速效果——特别是超线性加速。该方法在神经网络复杂度增加时仍能高效扩展,单层、两层及大型两层网络的最佳进程数分别为16、32和64。
Artificial Neural Networks (ANNs) have received increasing attention in recent years with applications that span a wide range of disciplines including vital domains such as medicine, network security and autonomous transportation. However, neural network architectures are becoming increasingly complex and with an increasing need to obtain real-time results from such models, it has become pivotal to use parallelization as a mechanism for speeding up network training and deployment. In this work we propose an implementation of Network Parallel Training through Cannon's Algorithm for matrix multiplication. We show that increasing the number of processes speeds up training until the point where process communication costs become prohibitive; this point varies by network complexity. We also show through empirical efficiency calculations that the speedup obtained is superlinear.
研究动机与目标
- 为满足实时应用中对日益复杂的人工神经网络(ANN)更快训练的需求。
- 克服先前并行训练方法的局限性,这些方法需要完整复制数据或依赖专用硬件。
- 开发一种基于Cannon算法的内存高效、可扩展的NPT方法,用于分布式矩阵乘法。
- 在HPC集群上评估不同网络复杂度和进程数下的性能表现。
- 探究在网络并行化的ANN训练中是否能够实现超线性加速。
提出的方法
- 采用Cannon算法实现网络并行训练(NPT),将矩阵乘法分布在多个进程中,无需复制输入数据。
- 通过按单元划分权重矩阵至各进程,利用Cannon算法实现通信优化的矩阵乘法。
- 使用MPI进行进程间通信,并通过屏障同步来测量实际运行时间。
- 采用随机梯度下降(SGD)结合小批量处理和动量优化进行训练,激活函数使用ReLU和Leaky ReLU。
- 通过实际运行时间、加速比和效率等指标,评估不同网络架构和进程数下的性能表现。
- 使用具有受控输入-输出关系的合成线性数据,以隔离数据复杂度对性能特征的影响。
实验结果
研究问题
- RQ1Cannon算法能否在不需在各进程中完整复制输入数据的前提下,实现高效且内存感知的网络并行训练?
- RQ2进程数量如何影响不同深度和宽度网络的训练时间和效率?
- RQ3所提出的NPT方法是否实现了超线性加速?若实现,其条件是什么?
- RQ4网络复杂度(如层数和单元数)如何影响实现最小训练时间的最优进程数?
- RQ5当进程数超过最优值后,通信开销对性能有何影响?
主要发现
- 所提出的NPT方法实现了超线性加速,在某些进程范围内效率超过1.00,表明其性能提升超越了线性扩展。
- 对于单层网络,最优进程数为16,超过该值后通信开销增加,导致训练时间上升。
- 对于两层网络,最优进程数增至32,表明最优进程数随网络深度线性增长。
- 大型两层网络(256个单元)的运行时间相对于小型两层网络呈二次增长,最优性能出现在64个进程时。
- 在32个进程以上时,两层网络的性能优于单层网络,表明网络架构复杂度以非平凡方式影响扩展行为。
- 该方法通过避免完整复制输入数据,展现出高内存效率,适用于无需专用硬件的HPC和云环境。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。