Skip to main content
QUICK REVIEW

[论文解读] TopoOpt: Co-optimizing Network Topology and Parallelization Strategy for Distributed Training Jobs

Weiyang Wang, Moein Khazraee|arXiv (Cornell University)|Feb 1, 2022
Ferroelectric and Negative Capacitance Devices被引用 16
一句话总结

TopoOpt 通过可重构光背板协同优化分布式 DNN 训练的网络拓扑与并行化策略,实现针对工作负载需求的动态、高效拓扑。通过交替优化与受群论启发的算法 TotientPerms,联合优化计算、通信与拓扑,相比类似成本的 Fat-tree 网络,将训练迭代时间缩短至最高 3.4 倍。

ABSTRACT

We propose TopoOpt, a novel direct-connect fabric for deep neural network (DNN) training workloads. TopoOpt co-optimizes the distributed training process across three dimensions: computation, communication, and network topology. We demonstrate the mutability of AllReduce traffic, and leverage this property to construct efficient network topologies for DNN training jobs. TopoOpt then uses an alternating optimization technique and a group theory-inspired algorithm called TotientPerms to find the best network topology and routing plan, together with a parallelization strategy. We build a fully functional 12-node direct-connect prototype with remote direct memory access (RDMA) forwarding at 100 Gbps. Large-scale simulations on real distributed training models show that, compared to similar-cost Fat-Tree interconnects, TopoOpt reduces DNN training time by up to 3.4x.

研究动机与目标

  • 解决 Fat-tree 互连在分布式 DNN 训练中日益凸显的瓶颈问题,其对可预测、重复的 AllReduce 及模型并行流量模式适应性差。
  • 克服传统数据中心网络假设不可预测、短时流量的局限,该假设无法反映真实的 DNN 训练工作负载特征。
  • 通过联合选择每项训练任务的最佳并行化策略与物理拓扑,协同优化计算、通信与网络拓扑三个维度。
  • 设计一种利用可重构光开关与主机级 RDMA 转发的系统,为每项任务创建专用、高效的拓扑,提升性能与成本效率。
  • 证明拓扑感知优化相比传统互连方式可显著降低训练迭代时间与成本。

提出的方法

  • 提出一种交替优化框架,先在固定拓扑下迭代优化并行化策略,再根据生成的流量需求更新拓扑。
  • 提出 TotientPerms 算法,受群论启发,生成既高效适用于 AllReduce 又适合模型并行传输的排列,降低跳数并改善负载均衡。
  • 采用直连光背板与可重构跳线面板,为每项 DNN 训练任务创建专用、低延迟的网络分区,支持动态拓扑重构。
  • 通过 NIC 网络分区(NPAR)实现主机级 RDMA 转发,支持非本地流量转发的同时保持 RDMA 语义,克服标准 RDMA 的关键限制。
  • 将 TotientPerms 集成至 NCCL,支持在多个环形 AllReduce 子拓扑间实现负载均衡的参数同步。
  • 构建一个包含 12 个节点、100 Gbps RDMA NIC 与 Telescent 光学跳线面板的原型系统,在真实环境中验证系统性能。

实验结果

研究问题

  • RQ1与传统 Fat-tree 互连相比,协同优化网络拓扑与并行化策略是否能显著减少 DNN 训练时间?
  • RQ2如何利用 AllReduce 流量的可变性,设计能同时优化 AllReduce 与模型并行通信的拓扑?
  • RQ3哪些算法技术能高效探索 DNN 训练任务中计算、通信与拓扑配置的联合大规模搜索空间?
  • RQ4可重构光互连能否通过动态适配任务特定流量模式,实现成本效益高、高性能的 DNN 训练?
  • RQ5在主机中继架构中,如何确保 RDMA 转发在非本地数据包必须被转发时仍能可靠运行?

主要发现

  • TopoOpt 相比类似成本的 Fat-tree 互连,将 DNN 训练迭代时间缩短至最高 3.4 倍,展现出显著性能提升。
  • 系统平均成本仅为理想全分叉带宽 Fat-tree 的 3.2 倍,表现出极强的成本效率。
  • 在六种真实 DNN 模型(DLRM、CANDLE、BERT、NCF、ResNet50 与 VGG)上的大规模仿真结果表明,各类架构均实现一致的性能提升。
  • TotientPerms 支持高效 AllReduce 排列,同时降低模型并行传输的跳数,提升整体通信效率。
  • 将 TotientPerms 集成至 NCCL 后,可在多个环形 AllReduce 子拓扑间实现负载均衡的参数同步,增强可扩展性。
  • 配备 100 Gbps RDMA 与光可重构的 12 节点原型系统成功验证了该方案在实际场景中的可行性与性能表现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。