[论文解读] Efficient Training of Large Language Models on Distributed Infrastructures: A Survey
本综述全面分析了大规模语言模型(LLMs)分布式训练系统的基础设施、并行策略及优化技术,涵盖可扩展性、效率与可靠性。综述整合了AI加速器、高带宽网络、内存与通信优化以及容错技术的最新进展,突出展示了实时迁移与模块冗余在故障恢复中的作用,同时倡导光电集成作为未来大规模LLM训练的关键使能技术。
Large Language Models (LLMs) like GPT and LLaMA are revolutionizing the AI industry with their sophisticated capabilities. Training these models requires vast GPU clusters and significant computing time, posing major challenges in terms of scalability, efficiency, and reliability. This survey explores recent advancements in training systems for LLMs, including innovations in training infrastructure with AI accelerators, networking, storage, and scheduling. Additionally, the survey covers parallelism strategies, as well as optimizations for computation, communication, and memory in distributed LLM training. It also includes approaches of maintaining system reliability over extended training periods. By examining current innovations and future directions, this survey aims to provide valuable insights towards improving LLM training systems and tackling ongoing challenges. Furthermore, traditional digital circuit-based computing systems face significant constraints in meeting the computational demands of LLMs, highlighting the need for innovative solutions such as optical computing and optical networks.
研究动机与目标
- 应对训练超大规模LLM(如GPT和LLaMA)所面临的日益严峻挑战,这些模型在数万个GPU上需耗时数周至数月。
- 识别分布式LLM训练中的关键瓶颈,包括计算效率低下、通信开销大、内存压力高以及系统不可靠性。
- 系统性地回顾训练基础设施的最新进展,包括AI加速器、高性能网络和面向LLM工作负载的存储系统。
- 分析数据并行、张量并行与流水线并行等并行策略及其对系统效率与可扩展性的影响。
- 探索计算、通信、内存与容错优化技术,以提升模型FLOPs利用率与训练鲁棒性。
提出的方法
- 综述并分类近期在分布式LLM训练基础设施方面的创新,包括GPU集群、光互连技术与可扩展存储系统。
- 考察并行方案(数据并行、张量并行、流水线并行)及其在通信、内存与负载均衡方面的权衡。
- 研究计算优化技术,如内核融合、混合精度训练与硬件感知算子调度,以提升MFU。
- 分析内存优化技术,如激活检查点、显存卸载与参数量化,以减轻GPU内存压力。
- 回顾通信优化策略,包括梯度压缩、All-Reduce优化与拓扑感知通信调度。
- 评估容错机制,如实时迁移与模块冗余(例如Parcae、Oobleck、Bamboo、SlipStream、SWARM),以实现无需重新加载检查点的快速故障恢复。

实验结果
研究问题
- RQ1如何在数万个GPU上实现高可扩展性,同时保持模型精度?
- RQ2在大规模LLM训练中,哪些策略最有效?这些策略如何优化计算、通信与内存,以最大化模型FLOPs利用率(MFU)?
- RQ3在硬件、网络与软件故障频发的背景下,如何在长达数周至数月的训练周期中维持系统可靠性?
- RQ4新兴技术如光计算与光子互连在突破传统数字电路系统局限方面可能发挥何种作用?
- RQ5与传统基于检查点的恢复方式相比,实时迁移与模块冗余如何实现更快的故障恢复?
主要发现
- 在16,384块H100 GPU上训练LLaMA-3约需54天,凸显了极端计算需求与高效分布式系统的重要性。
- 模型FLOPs利用率(MFU)是衡量效率的关键指标,计算、通信与内存的优化对提升MFU至关重要。
- 如Parcae与Oobleck所采用的实时迁移技术,可通过动态重构训练流水线并利用现有模型副本实现快速恢复。
- Bamboo与SlipStream等模块冗余方法可在故障发生时将计算重定向至冗余模块,从而实现不间断训练。
- SWARM结合冗余计算与实例迁移,支持异构且不可靠的集群,显著提升了真实部署中的容错能力。
- 光计算与光子互连技术(如TopoOpt与TPUv4)在提升通信效率方面展现出巨大潜力,有望突破摩尔定律限制,支持未来规模的LLM训练。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。