Skip to main content
QUICK REVIEW

[论文解读] Distributed Deep Learning in Open Collaborations

M.G. Diskin, Alexey Bukhtiyarov|arXiv (Cornell University)|Jun 18, 2021
Scientific Computing and Data Management参考文献 116被引用 4
一句话总结

本文提出 DeDLOC,一种新颖的算法框架,用于在开放、基于志愿者的协作中使用异构且不可靠的硬件进行分布式深度学习。通过动态适应不同的计算与网络条件,DeDLOC 实现了与传统设置相当的高效训练——通过14名志愿者使用混合GPU和TPU资源,在22天内成功微调了一个大型语言模型(sahajBERT-XL),成本仅为传统方式的一小部分。

ABSTRACT

Modern deep learning applications require increasingly more compute to train state-of-the-art models. To address this demand, large corporations and institutions use dedicated High-Performance Computing clusters, whose construction and maintenance are both environmentally costly and well beyond the budget of most organizations. As a result, some research directions become the exclusive domain of a few large industrial and even fewer academic actors. To alleviate this disparity, smaller groups may pool their computational resources and run collaborative experiments that benefit all participants. This paradigm, known as grid- or volunteer computing, has seen successful applications in numerous scientific areas. However, using this approach for machine learning is difficult due to high latency, asymmetric bandwidth, and several challenges unique to volunteer computing. In this work, we carefully analyze these constraints and propose a novel algorithmic framework designed specifically for collaborative training. We demonstrate the effectiveness of our approach for SwAV and ALBERT pretraining in realistic conditions and achieve performance comparable to traditional setups at a fraction of the cost. Finally, we provide a detailed report of successful collaborative language model pretraining with 40 participants.

研究动机与目标

  • 为应对训练最先进深度学习模型日益增长的计算成本,这些成本使得只有大型机构和企业能够负担。
  • 克服在志愿者计算环境中训练所面临的挑战——如带宽波动、延迟高以及连接不可靠——这些环境通常不适合标准的分布式训练方法。
  • 在无需专用基础设施的前提下,实现使用未充分利用的异构设备(如消费级GPU、TPU、工作站)进行大规模模型的协作式、去中心化训练。
  • 通过最大化利用现有闲置计算资源,降低大规模模型训练的环境与财务成本。
  • 通过真实世界部署,证明开放、社区驱动的大规模语言模型预训练在可行性和效率上的潜力。

提出的方法

  • DeDLOC 根据实时硬件与网络状况动态调整其训练策略,结合了参数服务器、All-Reduce 和去中心化SGD 的元素。
  • 该框架采用混合通信策略,根据设备能力与网络延迟选择最优同步模式(如 All-Reduce、参数服务器或中间模式)。
  • 通过将精度格式对齐,支持在异构加速器(如GPU上的float16、TPU上的bfloat16)上进行混合精度训练,防止训练发散。
  • 系统采用去中心化、容错的训练流水线,可处理参与者动态加入与退出,并能自动从断连中恢复。
  • 通过模型检查点与梯度聚合技术,确保在不稳定环境中保持训练的稳定性和吞吐量。
  • 该架构设计轻量化且模块化,可与现有深度学习框架(如 Hugging Face Transformers)无缝集成。

实验结果

研究问题

  • RQ1在高度异构且不可靠的硬件环境下,开放、基于志愿者的协作中能否有效扩展分布式深度学习?
  • RQ2在带宽波动、延迟高且参与者频繁更替的环境中,如何保持训练效率?
  • RQ3哪些算法策略能够动态适应混合精度与混合架构硬件(如GPU和TPU),以确保收敛性与性能?
  • RQ4协作式训练在多大程度上可以降低大规模语言模型预训练的成本与环境影响?
  • RQ5一个独立贡献者的社区能否在无集中式基础设施的情况下成功训练大规模语言模型(如 sahajBERT-XL)?

主要发现

  • DeDLOC 框架在22天内使用14名志愿者成功训练了 sahajBERT-XL,其性能在下游任务中优于基线模型和原始的 sahajBERT。
  • 协作式训练设置实现了与高端GPU集群相当的结果,但成本显著降低,且硬件利用率更高。
  • 尽管在混合精度支持上存在差异(GPU上为float16,TPU上为bfloat16),该框架通过在TPU上将计算对齐至float32,同时在GPU上保持float16,成功防止了训练发散。
  • TPUv3-8 实例的表现优于任何单个GPU节点,证明了该框架在异构加速器利用方面的有效性。
  • 即使在参与者动态可用和网络条件波动的情况下,系统仍保持了稳定的训练吞吐量与收敛性。
  • 通过利用现有闲置硬件,显著减少了对大规模冷却系统与高能效数据中心的需求,从而降低了环境影响。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。