[论文解读] Quasi-Global Momentum: Accelerating Decentralized Deep Learning on Heterogeneous Data
该论文提出了一种新型基于动量的去中心化优化方法——准全局动量(QG-DSGDm-N),通过在本地近似全局动量而无需额外通信,在异构数据上实现了训练稳定性提升。在CIFAR-10、ImageNet和AG News数据集上,该方法在高数据非独立同分布(non-i.i.i.d.)设置下,测试准确率比以往方法高出1%–20%,显著提升了去中心化深度学习的泛化能力。
Decentralized training of deep learning models is a key element for enabling data privacy and on-device learning over networks. In realistic learning scenarios, the presence of heterogeneity across different clients' local datasets poses an optimization challenge and may severely deteriorate the generalization performance. In this paper, we investigate and identify the limitation of several decentralized optimization algorithms for different degrees of data heterogeneity. We propose a novel momentum-based method to mitigate this decentralized training difficulty. We show in extensive empirical experiments on various CV/NLP datasets (CIFAR-10, ImageNet, and AG News) and several network topologies (Ring and Social Network) that our method is much more robust to the heterogeneity of clients' data than other existing methods, by a significant improvement in test performance ($1\% \!-\! 20\%$). Our code is publicly available.
研究动机与目标
- 解决由于客户端间数据异构性导致的去中心化深度学习中泛化能力差和收敛不稳定的问题。
- 探究现有带动量的去中心化SGD(DSGDm)在高数据非独立同分布条件下失效的原因。
- 开发一种通信高效的优化方法,以提升在异构数据集上的优化稳定性与泛化性能。
- 证明准全局动量在不同网络拓扑结构和数据分布模式下均优于现有去中心化方法。
提出的方法
- 提出准全局(QG)动量作为全局动量的本地近似,实现无需全局同步的优化稳定性提升。
- 提出QG-DSGDm-N变体,通过保留本地动量缓冲区,并利用邻居信息近似全局动量方向。
- 采用改进的更新规则,结合本地梯度与基于共识的动量估计,以稳定训练轨迹。
- 通过使用邻近模型状态的本地近似来实现全局动量向量的近似,避免全量全局同步带来的高通信开销。
- 将该方法应用于SGD和Adam优化器,验证其在不同优化范式下的有效性。
- 通过实验调优学习率和动量因子,确保在多样化实验设置下具备鲁棒性能。
实验结果
研究问题
- RQ1数据异构性如何影响去中心化SGD带动量方法的收敛性与泛化性能?
- RQ2为何在高度非独立同分布的数据设置下,本地动量无法提升泛化能力?
- RQ3能否通过全局动量的本地近似,在不增加通信开销的前提下提升优化稳定性与测试准确率?
- RQ4在异构数据条件下,QG-DSGDm-N与SOTA去中心化方法(如D²和梯度追踪)相比表现如何?
- RQ5准全局动量是否能在不同网络拓扑结构和模型架构上实现良好泛化?
主要发现
- 在CIFAR-10数据集上,当α=1(中等程度非独立同分布)时,QG-DSGDm-N达到91.28%的top-1准确率,显著优于DSGDm-N(89.98%)和DSGD(88.88%)。
- 在高度非独立同分布设置下(α=0.1),QG-DSGDm-N达到82.20%准确率,较DSGD(74.55%)提升7.65%,较DSGDm-N(77.48%)提升4.72%。
- 在更大的环形拓扑(n=32)下,QG-DSGDm-N在α=0.1时达到85.19%准确率,显著优于DSGD(77.56%)和DSGDm-N(80.59%)。
- 在AG News数据集上的NLP任务中,使用DistilBERT的QG-DAdam达到88.33%准确率(α=0.1),较DAdam(87.29%)提升1.04%。
- 该方法在多种数据集(CIFAR-10、ImageNet、AG News)、网络拓扑(环形、社交网络)以及非独立同分布程度(α=10、1、0.1)下均表现出一致的性能提升。
- 消融实验表明,QG动量在不增加通信成本的前提下,显著优于本地动量、同步缓冲区或梯度共享策略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。