[论文解读] HeterPS: Distributed Deep Learning With Reinforcement Learning Based Scheduling in Heterogeneous Environments
HeterPS 是一种分布式深度学习框架,采用基于强化学习(RL)的调度机制,以优化跨异构计算资源(CPU、GPU)的大规模深度神经网络(DNN)训练。通过动态分配层至合适的硬件并管理数据与资源配置,HeterPS 实现了比现有最先进方法高 14.5 倍的吞吐量和 312.3% 的更低成本。
Deep neural networks (DNNs) exploit many layers and a large number of parameters to achieve excellent performance. The training process of DNN models generally handles large-scale input data with many sparse features, which incurs high Input/Output (IO) cost, while some layers are compute-intensive. The training process generally exploits distributed computing resources to reduce training time. In addition, heterogeneous computing resources, e.g., CPUs, GPUs of multiple types, are available for the distributed training process. Thus, the scheduling of multiple layers to diverse computing resources is critical for the training process. To efficiently train a DNN model using the heterogeneous computing resources, we propose a distributed framework, i.e., Paddle-Heterogeneous Parameter Server (Paddle-HeterPS), composed of a distributed architecture and a Reinforcement Learning (RL)-based scheduling method. The advantages of Paddle-HeterPS are three-fold compared with existing frameworks. First, Paddle-HeterPS enables efficient training process of diverse workloads with heterogeneous computing resources. Second, Paddle-HeterPS exploits an RL-based method to efficiently schedule the workload of each layer to appropriate computing resources to minimize the cost while satisfying throughput constraints. Third, Paddle-HeterPS manages data storage and data communication among distributed computing resources. We carry out extensive experiments to show that Paddle-HeterPS significantly outperforms state-of-the-art approaches in terms of throughput (14.5 times higher) and monetary cost (312.3% smaller). The codes of the framework are publicly available at: https://github.com/PaddlePaddle/Paddle.
研究动机与目标
- 为解决在具有多样化 CPU 和 GPU 资源的异构计算环境中高效训练大规模深度神经网络(DNN)的挑战。
- 在满足严格吞吐量约束的前提下,最小化分布式 DNN 训练的成本。
- 设计一种可扩展、弹性化的框架,利用强化学习智能调度 DNN 层在异构资源上的分配。
- 高效管理跨分布式计算节点的数据存储与通信,以减少 I/O 和通信开销。
- 实现成本效益高、吞吐量高的分布式训练,性能优于如 TensorFlow 等现有框架。
提出的方法
- HeterPS 采用参数服务器架构,以支持在异构资源上进行分布式训练与数据管理。
- 其使用基于强化学习(RL)的调度器,根据层的特征和资源能力,将每个 DNN 层分配至最合适的计算资源(CPU 或 GPU)。
- RL 代理通过基于 LSTM 的策略网络进行训练,从性能分析数据和吞吐量约束中学习最优调度决策。
- 一个资源配置模块可动态扩展计算资源数量,以满足吞吐量需求,同时最小化成本。
- 该框架集成数据管理技术,以优化数据存储与通信,减少数据密集型层中的 I/O 瓶颈。
- 通过统一的强化学习框架,联合优化调度与资源配置,以在性能与成本之间取得平衡。

实验结果
研究问题
- RQ1如何在异构计算资源(CPU 和 GPU)上高效调度 DNN 训练,以在满足吞吐量约束的前提下最小化成本?
- RQ2在异构环境中调度 DNN 层时,强化学习是否能优于启发式、贪心或贝叶斯优化方法?
- RQ3动态资源调配对分布式 DNN 训练中成本与吞吐量有何影响?
- RQ4基于 RL 的调度器在资源类型数量和模型复杂度增加时,其可扩展性如何?
- RQ5与现有最先进框架(如 TensorFlow)相比,HeterPS 在多大程度上可降低货币成本并提升吞吐量?
主要发现
- 在混合 CPU-GPU 集群上训练 CTRDNN 模型时,HeterPS 的吞吐量最高可达 TensorFlow 的 14.5 倍。
- 与现有最先进调度方法相比,该框架的成本最高可降低 312.3%,展现出显著的成本效率。
- 即使在严格的吞吐量约束下,基于 RL 的调度器在成本与吞吐量方面也优于贪心、启发式和贝叶斯优化方法。
- RL-LSTM 模型的调度时间可忽略不计——仅占总训练时间的 0.2% 至 1.8%,适用于实际部署。
- 训练好的 RL 模型在不同模型(MATCHNET、CTR-DNN、2EMB、NCE)上泛化能力良好,每次调度决策的推理时间低于 0.002 秒。
- 该框架的资源配置方法相比基线方法,资源利用率最高可提升 57.9%,尤其在动态工作负载下表现更优。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。