[论文解读] RelaySum for Decentralized Deep Learning on Heterogeneous Data
该论文提出了一种去中心化随机梯度下降算法 RelaySGD,其采用基于生成树的 RelaySum 消息中继机制,可在有限时间内实现模型更新在所有工作者之间的精确均匀分发,且不受数据异质性影响。与渐近收敛且在传播过程中信号衰减的 gossip 平均不同,RelaySum 确保每个工作者在由网络直径决定的延迟范围内接收到每个更新的完整、未衰减的副本,从而在异质数据上实现鲁棒、可扩展且精确的训练,并具备理论收敛保证。
In decentralized machine learning, workers compute model updates on their local data. Because the workers only communicate with few neighbors without central coordination, these updates propagate progressively over the network. This paradigm enables distributed training on networks without all-to-all connectivity, helping to protect data privacy as well as to reduce the communication cost of distributed training in data centers. A key challenge, primarily in decentralized deep learning, remains the handling of differences between the workers' local data distributions. To tackle this challenge, we introduce the RelaySum mechanism for information propagation in decentralized learning. RelaySum uses spanning trees to distribute information exactly uniformly across all workers with finite delays depending on the distance between nodes. In contrast, the typical gossip averaging mechanism only distributes data uniformly asymptotically while using the same communication volume per step as RelaySum. We prove that RelaySGD, based on this mechanism, is independent of data heterogeneity and scales to many workers, enabling highly accurate decentralized deep learning on heterogeneous data. Our code is available at http://github.com/epfml/relaysgd.
研究动机与目标
- 为解决去中心化深度学习中因数据异质性导致的传统 gossip 平均收敛缓慢且有偏的问题。
- 设计一种通信机制,实现在有限时间内对所有工作者精确且均匀地分发模型更新,避免渐近收敛和信号衰减。
- 开发一种去中心化训练算法,无论工作者之间本地数据分布如何变化,均能保持收敛速度和准确性。
- 实现在大规模网络上无需中心协调或服务器依赖的可扩展、隐私保护且鲁棒的分布式训练。
提出的方法
- RelaySum 利用生成树将每个工作者的模型更新通过中间节点路由至所有其他工作者,确保每个更新以完整权重且无衰减地送达。
- 每个节点作为中继,沿树边转发消息而不重新加权,并通过求和方式合并来自多个源的消息,以保持通信成本恒定。
- 该算法通过去中心化方式使用生成树协议构建生成树,支持在任意网络拓扑中部署。
- RelaySGD 将 RelaySum 集成到随机梯度下降中,每个工作者将其本地梯度与通过中继树接收的均匀分布的全局更新进行平均。
- 该方法每步仅需 O(n) 通信量(每条边发送一条消息),与 gossip 平均相当,但可在有限时间内实现精确均匀性。
- 理论分析表明,收敛性取决于网络直径而非谱隙,使其对不规则图中混合性差的情况具有鲁棒性。
实验结果
研究问题
- RQ1去中心化学习算法能否在与数据异质性无关的前提下,实现所有工作者之间精确且有限时间的模型更新均匀分发?
- RQ2当更新传播为精确且延迟有界的条件下,与渐近 gossip 平均相比,去中心化 SGD 的收敛性如何变化?
- RQ3能否设计一种通信机制,在保持与 gossip 平均相同带宽成本的同时,消除多跳传播中的信号衰减?
- RQ4在高度异质的数据分布下,RelaySGD 是否优于现有去中心化方法,尤其是在先前理论上鲁棒但实际中失效的方法失效时?
- RQ5网络拓扑结构——特别是基于树的结构与一般图结构——对去中心化深度学习的收敛性和可扩展性有何影响?
主要发现
- RelaySGD 实现了与数据异质性无关的收敛性,理论迭代复杂度为 O(1/ε³/² + 1/ε),其中 ε 为目标精度。
- 收敛速率取决于网络最大直径 τ_max 而非谱隙,使其对连接不良或不规则的拓扑具有鲁棒性。
- 在双完全二叉树拓扑中,RelaySGD 仅需常数内存(两个额外模型副本),每轮迭代仅发送和接收两个模型参数,实现线性可扩展性。
- 在 CIFAR-10 数据集上使用 VGG-11 的实验表明,RelaySGD 在高度异质数据上优于标准 gossip 方法和启发式替代方案,尤其在无动量设置下表现更优。
- RelaySGD/Grad(一种使用梯度平均的变体)在固定学习率下收敛出现平台期,而 RelaySGD 保持线性收敛,且对异质性不敏感。
- 实验结果表明,即使在极端数据偏移下,RelaySGD 仍能保持高精度(在 α=0.01 时 CIFAR-10 上达到 88.4% 的 top-1 准确率),显著优于基线 gossip 方法和引入动量的变体。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。