Skip to main content
QUICK REVIEW

[论文解读] On Scale-out Deep Learning Training for Cloud and HPC

Srinivas Sridharan, Karthikeyan Vaidyanathan|arXiv (Cornell University)|Jan 24, 2018
Stochastic Gradient Optimization Techniques参考文献 12被引用 19
一句话总结

本文介绍了英特尔® 机器学习扩展库(MLSL),这是一个为云和高性能计算(HPC)系统中大规模分布式深度学习训练而优化的高性能通信库。通过支持异步通信进度、消息优先级和低精度集合操作,MLSL 在 256 个节点上对 ResNet-50 实现了 90% 的扩展效率,相较于标准 MPI,第一层通信延迟降低了 1.8 倍至 2.2 倍。

ABSTRACT

The exponential growth in use of large deep neural networks has accelerated the need for training these deep neural networks in hours or even minutes. This can only be achieved through scalable and efficient distributed training, since a single node/card cannot satisfy the compute, memory, and I/O requirements of today's state-of-the-art deep neural networks. However, scaling synchronous Stochastic Gradient Descent (SGD) is still a challenging problem and requires continued research/development. This entails innovations spanning algorithms, frameworks, communication libraries, and system design. In this paper, we describe the philosophy, design, and implementation of Intel Machine Learning Scalability Library (MLSL) and present proof-points demonstrating scaling DL training on 100s to 1000s of nodes across Cloud and HPC systems.

研究动机与目标

  • 解决在云和 HPC 环境中将深度学习训练扩展至数百至数千个节点的挑战。
  • 克服现有通信库(如 MPI)在深度学习工作负载中缺乏优化的局限性,例如通信延迟优先级和计算-通信重叠支持。
  • 通过智能工作负载划分和系统级优化,最大化计算与通信比,实现高效的超大批量训练。
  • 为深度学习框架提供统一的软件接口,以标准化并加速可扩展训练解决方案的部署。

提出的方法

  • 引入混合并行机制,通过将节点分组组织,结合数据并行与模型并行,实现基于层特征的灵活工作负载划分。
  • 通过优化小批量大小并利用计算-通信重叠,最大化计算与通信比,尤其在数据并行中表现显著。
  • 在 MLSL 中实现消息优先级机制,优先加速延迟敏感型通信(如第一层梯度),即使这些操作在时间上早于较大的后续层操作。
  • 通过专用核心实现通信操作的异步进度处理,提升训练流水线中计算与通信的重叠程度。
  • 支持低精度数据类型(如 bfloat16)用于集合操作,减少通信量并提升扩展效率。
  • 通过统一 API 将 MLSL 集成至主流深度学习框架(Caffe、TensorFlow、nGraph),抽象底层并行策略,实现在不同技术栈中的一致优化。

实验结果

研究问题

  • RQ1在数千个节点的大规模分布式深度学习训练中,如何最小化通信开销?
  • RQ2为实现数据并行深度学习工作负载的高扩展效率,需要哪些系统级优化?
  • RQ3优先处理延迟敏感型通信(如第一层梯度)对整体训练性能有何影响?
  • RQ4混合并行与计算-通信重叠在多大程度上可使扩展性能超越传统数据并行或模型并行?
  • RQ5统一通信库(如 MLSL)能否在多种深度学习框架中实现一致的性能提升?

主要发现

  • 使用英特尔® 至强金牌 6148 处理器和 Omnipath 互连网络,MLSL 在 256 个节点上对 ResNet-50 训练实现了 90% 的扩展效率。
  • 消息优先级机制使第一层通信暴露时间相比标准 MPI 减少了 1.8 倍至 2.2 倍,显著提升了延迟敏感型性能。
  • 该方案成功扩展至 9,600 个至强-Phi 节点,用于科学模式分类任务,证明其在极端规模 HPC 工作负载中的可行性。
  • 在巴塞罗那超级计算中心,ResNet-50 在 256 个节点上仅用 40 分钟完成训练,达到 75.8% 的 top-1 验证准确率。
  • 在 64 个节点上,TensorFlow 与 MLSL 的集成实现了超过 93% 的扩展效率,优于原生 Horovod-MPI 实现。
  • MLSL 中使用低精度通信和持久集合操作可减轻带宽压力,提升通信效率,且不损失模型精度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。