Skip to main content
QUICK REVIEW

[论文解读] Communication Scheduling as a First-Class Citizen in Distributed Machine Learning Systems.

Sayed Hadi Hashemi, Sangeetha Abdu Jyothi|arXiv (Cornell University)|Mar 8, 2018
Advanced Graph Neural Networks被引用 5
一句话总结

本文提出了一种用于分布式机器学习的通信调度系统,可在无需修改模型或开发者输入的前提下,实现图模型中通信与计算的近乎最优重叠。该系统基于TensorFlow构建,在训练吞吐量方面最高提升20%,在推理吞吐量方面最高提升82%,同时将慢启动者(straggler)效应降低至2.8倍。

ABSTRACT

State-of-the-art machine learning systems rely on graph-based models, with the distributed training of these models being the norm in AI-powered production pipelines. The performance of these communication-heavy systems depends on the effective overlap of communication and computation. While the overlap challenge has been addressed in systems with simpler model representations, it remains an open problem in graph-based models. In this work, we develop a system for communication scheduling which realizes near-optimal overlap of communication and computation in graph-based models. Our system is implemented over TensorFlow and requires no changes in the model or developer inputs. Our system improves the throughput by up to 82% in inference and 20% in training, while also reducing straggler effect by up to 2.8x. A part of our implementation is already merged with TensorFlow codebase; the rest is publicly available.

研究动机与目标

  • 为解决图模型分布式训练中有效通信-计算重叠的开放挑战。
  • 在使用复杂模型表示的系统中,实现通信与计算的近乎最优重叠。
  • 设计一种可无缝集成到TensorFlow等现有框架中的解决方案,无需修改模型或开发者输入。
  • 降低分布式训练中的慢启动者效应,提升系统效率与资源利用率。

提出的方法

  • 该系统将通信调度作为分布式机器学习系统中的首要抽象,将通信模式本身视为可优化的首要实体。
  • 通过静态分析计算图,识别通信与计算依赖关系,从而实现精确的调度决策。
  • 调度器通过根据数据可用性和资源约束重新排序操作,动态实现通信与计算的重叠。
  • 利用现有的TensorFlow基础设施,无需修改模型定义或训练代码。
  • 该系统采用一种新型调度算法,优先调度通信任务,以最小化计算空闲时间。
  • 与TensorFlow的执行引擎集成,在图级别插入调度逻辑,确保透明化部署。

实验结果

研究问题

  • RQ1如何在图模型机器学习中有效重叠通信与计算,以提升系统吞吐量?
  • RQ2何种调度策略可在不修改模型代码或开发者工作流的前提下,实现近乎最优的重叠?
  • RQ3通信调度在多大程度上可降低分布式训练中的慢启动者效应?
  • RQ4该系统在不同模型架构与集群配置下的可扩展性如何?
  • RQ5该方法在训练与推理工作负载中可实现多大的性能提升?

主要发现

  • 与基线系统相比,该系统将推理吞吐量最高提升82%。
  • 通过更优的通信-计算重叠,训练吞吐量最高提升20%。
  • 慢启动者效应降低至2.8倍,表明负载均衡与资源利用率得到改善。
  • 部分实现已合并至官方TensorFlow代码库,证实其具备生产就绪能力。
  • 该系统无需修改模型定义或开发者输入,可实现无缝集成。
  • 该方法在多种图模型架构与分布式训练场景中均表现有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。