Skip to main content
QUICK REVIEW

[论文解读] Efficient Communications in Training Large Scale Neural Networks

Linnan Wang, Wei Wu|arXiv (Cornell University)|Nov 14, 2016
Stochastic Gradient Optimization Techniques参考文献 18被引用 5
一句话总结

本文提出线性流水线(Linear Pipelining, LP),一种用于大规模神经网络训练的新型集合通信技术,可降低批量同步并行随机梯度下降(BSP-SGD)中的通信开销。LP 实现的带宽比双向交换(Bidirectional Exchange)快至 2 倍,且通信开销不随 GPU 数量变化,显著提升了可扩展性并减少了瓶颈,同时保持了收敛特性。

ABSTRACT

We consider the problem of how to reduce the cost of communication that is required for the parallel training of a neural network. The state-of-the-art method, Bulk Synchronous Parallel Stochastic Gradient Descent (BSP-SGD), requires many collective communication operations, like broadcasts of parameters or reductions for sub-gradient aggregations, which for large messages quickly dominates overall execution time and limits parallel scalability. To address this problem, we develop a new technique for collective operations, referred to as Linear Pipelining (LP). It is tuned to the message sizes that arise in BSP-SGD, and works effectively on multi-GPU systems. Theoretically, the cost of LP is invariant to $P$, where $P$ is the number of GPUs, while the cost of more conventional Minimum Spanning Tree (MST) scales like $O(\log P)$. LP also demonstrate up to 2x faster bandwidth than Bidirectional Exchange (BE) techniques that are widely adopted by current MPI implementations. We apply these collectives to BSP-SGD, showing that the proposed implementations reduce communication bottlenecks in practice while preserving the attractive convergence properties of BSP-SGD.

研究动机与目标

  • 解决使用 BSP-SGD 进行大规模神经网络并行训练时日益增长的通信开销问题。
  • 克服传统集合操作(如广播和规约)在 GPU 数量增加时可扩展性差的局限性。
  • 设计一种针对 BSP-SGD 中典型消息大小量身定制的通信技术,以提升带宽效率并降低延迟。
  • 实现与 GPU 数量(P)无关的通信开销,与现有方法 O(log P) 的增长方式形成对比。
  • 在显著降低通信瓶颈的同时,保持 BSP-SGD 的收敛特性。

提出的方法

  • 提出线性流水线(LP),一种专为 BSP-SGD 中遇到的消息大小优化的新型集合通信技术。
  • 通过在 GPU 间线性地重叠数据传输,结构化通信操作以最小化空闲时间并最大化带宽利用率。
  • 实现与 GPU 数量(P)无关的通信开销,与最小生成树(MST)方法 O(log P) 的增长方式形成对比。
  • 在有效带宽方面优于双向交换(BE)技术——后者广泛应用于 MPI 实现——最高可提升 2 倍。
  • 将 LP 集成到 BSP-SGD 框架中,以替代标准的集合操作(如参数广播和梯度规约)。
  • 通过保持与标准 BSP-SGD 相同的同步和收敛行为,确保与现有训练框架的向后兼容性。

实验结果

研究问题

  • RQ1能否设计一种通信技术,使通信开销在训练所用 GPU 数量变化时保持恒定?
  • RQ2在线性流水线与 MPI 中广泛部署的双向交换方法相比,其带宽效率如何?
  • RQ3LP 在不损害收敛性的情况下,能在多大程度上减少大规模神经网络训练中的通信瓶颈?
  • RQ4LP 是否在提升可扩展性和运行时性能的同时,保持了 BSP-SGD 的收敛特性?
  • RQ5LP 是否能有效应用于具有不同消息大小的实际神经网络训练工作负载?

主要发现

  • 线性流水线实现的通信开销与 GPU 数量(P)无关,而 MST 方法的开销随 P 增大呈 O(log P) 增长。
  • LP 在带宽效率方面相比标准 MPI 实现中使用的双向交换技术,最高可提升 2 倍。
  • 将 LP 集成到 BSP-SGD 中可显著降低实际通信瓶颈,从而在多 GPU 系统上实现更快的训练速度。
  • 所提出的方法保持了标准 BSP-SGD 的收敛特性,确保了训练稳定性和模型准确性。
  • LP 通过最小化通信开销,显著提升了并行可扩展性,尤其适用于频繁参数同步的大规模模型。
  • 该技术对神经网络训练中典型的通信消息大小具有显著优势,因此特别适合实际深度学习工作负载。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。