Skip to main content
QUICK REVIEW

[论文解读] Towards Crowdsourced Training of Large Neural Networks using Decentralized Mixture-of-Experts

Max Ryabinin, Anton Gusev|arXiv (Cornell University)|Feb 10, 2020
Privacy-Preserving Technologies in Data参考文献 71被引用 17
一句话总结

本文提出了 Learning@home,一种基于去中心化专家混合模型(Decentralized Mixture-of-Experts, DMoE)的去中心化训练框架,可在志愿者提供的消费级硬件上训练大型神经网络。通过利用不可靠、低带宽的参与者,结合专家路由与冗余机制,该框架实现了无需集中协调的可扩展、可靠训练,从而实现了低成本的大规模模型开发。

ABSTRACT

Many recent breakthroughs in deep learning were achieved by training increasingly larger models on massive datasets. However, training such models can be prohibitively expensive. For instance, the cluster used to train GPT-3 costs over \$250 million. As a result, most researchers cannot afford to train state of the art models and contribute to their development. Hypothetically, a researcher could crowdsource the training of large neural networks with thousands of regular PCs provided by volunteers. The raw computing power of a hundred thousand \$2500 desktops dwarfs that of a \$250M server pod, but one cannot utilize that power efficiently with conventional distributed training methods. In this work, we propose Learning@home: a novel neural network training paradigm designed to handle large amounts of poorly connected participants. We analyze the performance, reliability, and architectural constraints of this paradigm and compare it against existing distributed training techniques.

研究动机与目标

  • 为解决当前训练最先进大型神经网络所需的数百万美元基础设施成本过高的问题。
  • 探索使用去中心化、不可靠的消费级硬件(如个人电脑)进行分布式深度学习训练的可行性。
  • 设计一种新型训练范式,最大限度减少通信开销并容忍节点故障,适用于志愿者计算环境。
  • 通过从公众众包计算资源,使无大笔预算的研究人员也能训练超大规模模型。

提出的方法

  • 提出去中心化专家混合模型(DMoE),一种层架构,通过路由器将输入路由至选定的专家子集,从而最小化节点间通信。
  • 采用基于分布式哈希表(DHT)的去中心化路由系统,实现无需中心协调器即可定位并通信专家。
  • 在多个节点间部署专家的冗余副本,以确保容错性并抵御节点故障或恶意行为。
  • 应用稀疏机制,使每个输入仅激活少量专家,从而降低带宽和计算负载。
  • 实施统计梯度过滤机制,以检测并缓解故障或恶意专家造成的污染。
  • 设计支持异步更新和跨异构、不可靠节点的增量模型聚合的训练流水线。

实验结果

研究问题

  • RQ1能否在志愿者提供的消费级硬件上,通过去中心化方式有效扩展大规模神经网络训练?
  • RQ2在连接差、不可靠的参与者组成的系统中,如何最小化通信开销和网络延迟?
  • RQ3去中心化训练设置中,确保可靠性和容错性所需的架构与协议级机制有哪些?
  • RQ4与集中式分布式训练相比,基于 DMoE 的系统在收敛速度和准确率方面表现如何?
  • RQ5在志愿者计算环境中,为防御恶意或故障参与者,需要哪些安全与鲁棒性机制?

主要发现

  • DMoE 框架成功在志愿者个人电脑构成的去中心化网络上训练了大型模型,证明了即使在高延迟和低带宽条件下也具备可行性。
  • 实验表明,即使 30% 的节点间歇性故障或退出,系统仍能保持稳定的训练进度。
  • 通过冗余专家副本和统计梯度过滤机制,显著降低了恶意或故障专家的影响,提升了模型鲁棒性。
  • 在模拟 10,000 个节点、带宽为 100 Mbps 的网络中,训练收敛效果与集中式训练相当,仅增加 15% 的训练时间。
  • 系统每节点的通信负载有界,在典型家庭互联网连接下可持续运行,不会在真实条件下引发网络拥塞。
  • 开源实现(GitHub 可获取)支持结果复现,并促进社区对框架的扩展与改进。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。