Skip to main content
QUICK REVIEW

[论文解读] Characterizing and Modeling Distributed Training with Transient Cloud GPU Servers

Shijian Li, Robert J. Walls|arXiv (Cornell University)|Apr 7, 2020
Advanced Neural Network Applications参考文献 37被引用 4
一句话总结

该论文提出了一套大规模的实验研究与建模框架CM-DARE,用于表征和预测在瞬态云GPU服务器上的分布式训练性能。基于在3种GPU类型和6个区域中对20个CNN模型的测量结果,研究证明基于回归的模型能够以低于3.4%的平均绝对百分比误差(MAPE)预测训练速度和容错开销,从而实现对性能瓶颈(如过载的参数服务器)的检测。

ABSTRACT

Cloud GPU servers have become the de facto way for deep learning practitioners to train complex models on large-scale datasets. However, it is challenging to determine the appropriate cluster configuration---e.g., server type and number---for different training workloads while balancing the trade-offs in training time, cost, and model accuracy. Adding to the complexity is the potential to reduce the monetary cost by using cheaper, but revocable, transient GPU servers. In this work, we analyze distributed training performance under diverse cluster configurations using CM-DARE, a cloud-based measurement and training framework. Our empirical datasets include measurements from three GPU types, six geographic regions, twenty convolutional neural networks, and thousands of Google Cloud servers. We also demonstrate the feasibility of predicting training speed and overhead using regression-based models. Finally, we discuss potential use cases of our performance modeling such as detecting and mitigating performance bottlenecks.

研究动机与目标

  • 为了理解在价格更低但可能被意外撤销的瞬态云GPU服务器上进行分布式训练的性能特征。
  • 为了识别在异构且瞬态的集群配置中影响训练速度和容错开销的关键因素。
  • 为了开发准确、基于数据的性能模型,以预测真实云环境中训练吞吐量和开销。
  • 为了支持实际应用场景,例如在训练过程中检测并缓解性能瓶颈。
  • 为了构建并开源CM-DARE,一个用于测量和训练的框架,可增强容错能力,并支持对瞬态环境敏感的分布式训练。

提出的方法

  • 构建了CM-DARE,一个基于云的测量与训练框架,通过在TensorFlow和Tensor2Tensor中扩展支持瞬态环境的优化机制,以提升容错能力和监控能力。
  • 在20个卷积神经网络、3种GPU类型(T4、V100、P100)以及6个Google Cloud区域中开展了大规模实验,以收集训练速度、实例撤销时间及开销指标。
  • 开发了基于回归的模型,用于预测训练速度和容错开销,所用特征包括集群规模、GPU类型和模型复杂度。
  • 在CM-DARE中实现了动态瓶颈检测机制,通过30秒的预热期和6.7%的速度差异阈值来标记性能偏差。
  • 使用平均绝对百分比误差(MAPE)评估模型精度,训练速度预测的MAPE最低可达3.4%。
  • 设计并集成了对瞬态环境敏感的检查点与恢复机制,以减少服务器被撤销时的数据丢失和重启开销。

实验结果

研究问题

  • RQ1集群异构性(不同GPU类型)在瞬态云服务器上对分布式训练性能有何影响?
  • RQ2基于回归的模型在多大程度上能够准确预测瞬态云GPU集群中的训练速度和容错开销?
  • RQ3在瞬态服务器上的分布式训练中,关键性能瓶颈是什么?如何实现实时检测?
  • RQ4在异构集群中,增加参数服务器数量对训练速度和可扩展性有何影响?
  • RQ5准确的性能模型是否能够实现对云环境深度学习工作负载中训练低效问题的主动缓解?

主要发现

  • 在异构集群中,训练速度近似等于各台服务器速度之和,表明在理想条件下具备接近线性的可扩展性。
  • 基于回归的模型在预测训练速度时,平均绝对百分比误差(MAPE)最低可达3.4%,证明其在真实部署中具有高精度。
  • 通过模型检查点产生的容错开销可被高度准确地预测,并可整合进训练时间预测中,以提升成本与时间估算的准确性。
  • 过载的参数服务器显著限制了可扩展性;在大规模集群中,将参数服务器数量从1个增加到2个,可使训练速度最高提升70.6%。
  • CM-DARE通过对比预测与实测的训练速度,成功实现实时检测性能瓶颈,从而支持早期干预。
  • 该框架与数据集已公开,支持可复现性及未来在瞬态分布式训练优化方面的研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。