[论文解读] D-Cliques: Compensating NonIIDness in Decentralized Federated Learning with Topology.
D-Cliques 提出了一种去中心化的联邦学习拓扑结构,将节点分组为相互连接的团(clique),以缓解非独立同分布(non-IID)数据带来的梯度偏差,特别是局部类别不平衡问题。通过使本地联合分布与全局类别分布对齐,并结合去中心化随机梯度下降(SGD),D-Cliques 在保持与全连接网络相当收敛速度的同时,将1000个节点设置下的边数减少了98%,消息传输量减少了96%。
The convergence speed of machine learning models trained with Federated Learning is significantly affected by non-independent and identically distributed (non-IID) data partitions, even more so in a fully decentralized setting without a central server. In this paper, we show that the impact of local class bias, an important type of data non-IIDness, can be significantly reduced by carefully designing the underlying communication topology. We present D-Cliques, a novel topology that reduces gradient bias by grouping nodes in interconnected cliques such that the local joint distribution in a clique is representative of the global class distribution. We also show how to adapt the updates of decentralized SGD to obtain unbiased gradients and implement an effective momentum with D-Cliques. Our empirical evaluation on MNIST and CIFAR10 demonstrates that our approach provides similar convergence speed as a fully-connected topology with a significant reduction in the number of edges and messages. In a 1000-node topology, D-Cliques requires 98% less edges and 96% less total messages, with further possible gains using a small-world topology across cliques.
研究动机与目标
- 解决去中心化联邦学习中本地数据分布与全局分布显著偏离的问题,即非独立同分布(non-IID)数据带来的挑战。
- 减少由局部类别不平衡引起的梯度偏差,这是去中心化设置中导致收敛性能下降的主要原因。
- 设计一种通信拓扑结构,使团(clique)层级能够保持对全局数据分布的代表性,且无需依赖中心化服务器。
- 利用所提出的拓扑结构实现无偏梯度更新和去中心化SGD中的有效动量。
- 在保持与全连接拓扑相当的模型收敛速度的同时,最小化通信开销。
提出的方法
- 将通信网络结构化为相互连接的团(clique),其中每个团包含本地数据分布具有代表性的节点。
- 确保团内各节点数据的并集近似反映全局类别分布,从而减少本地偏差。
- 调整去中心化SGD,利用团层级的统计信息进行梯度更新,实现在非IID数据下仍能实现无偏优化。
- 通过结合本地和团层级的梯度信息,在更新规则中引入动量,以加速收敛。
- 在团之间构建小世界(small-world)拓扑,进一步降低长距离通信开销,同时保持网络连通性。
实验结果
研究问题
- RQ1去中心化的通信拓扑能否缓解联邦学习中由局部类别不平衡引起的梯度偏差?
- RQ2与全连接网络相比,基于团的拓扑在多大程度上能减少通信开销,同时保持收敛速度?
- RQ3D-Cliques对去中心化SGD的适应在非IID数据下实现无偏梯度的效率如何?
- RQ4团间拓扑结构(如小世界结构)对大规模去中心化联邦学习中的通信效率和收敛性能有何影响?
- RQ5D-Cliques能否在大幅减少边数和消息数的同时,保持与全连接拓扑相当的性能?
主要发现
- 在1000个节点的去中心化网络中,D-Cliques相比全连接拓扑将边数减少了98%。
- 在相同训练设置下,D-Cliques的总消息传输量相比全连接拓扑减少了96%。
- 在MNIST和CIFAR10数据集上,D-Cliques的模型收敛速度与全连接拓扑相当。
- 基于团的拓扑通过确保团内局部联合分布反映全局类别分布,有效减少了梯度偏差。
- 在团之间采用小世界拓扑结构,可在不牺牲收敛性能的前提下进一步提升通信效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。