Skip to main content
QUICK REVIEW

[论文解读] Data-heterogeneity-aware Mixing for Decentralized Learning

Yatin Dandi, Anastasia Koloskova|arXiv (Cornell University)|Apr 13, 2022
Privacy-Preserving Technologies in Data被引用 8
一句话总结

该论文提出了一种面向去中心化学习的数据异质性感知混合策略,通过动态优化通信权重以减少梯度漂移并加速收敛。通过将混合矩阵设计建模为一个凸优化问题,该问题由一种捕捉数据异质性与图拓扑相互作用的新度量引导,该方法在不增加通信开销的前提下,在视觉和自然语言处理基准上实现了更高的测试准确率。

ABSTRACT

Decentralized learning provides an effective framework to train machine learning models with data distributed over arbitrary communication graphs. However, most existing approaches toward decentralized learning disregard the interaction between data heterogeneity and graph topology. In this paper, we characterize the dependence of convergence on the relationship between the mixing weights of the graph and the data heterogeneity across nodes. We propose a metric that quantifies the ability of a graph to mix the current gradients. We further prove that the metric controls the convergence rate, particularly in settings where the heterogeneity across nodes dominates the stochasticity between updates for a given node. Motivated by our analysis, we propose an approach that periodically and efficiently optimizes the metric using standard convex constrained optimization and sketching techniques. Through comprehensive experiments on standard computer vision and NLP benchmarks, we show that our approach leads to improvement in test performance for a wide range of tasks.

研究动机与目标

  • 解决由于数据异质性和次优通信拓扑导致的去中心化SGD性能下降问题。
  • 研究数据分布异质性与去中心化学习中混合矩阵设计之间的相互作用。
  • 开发一种实用且通信高效的自适应方法,基于实时梯度统计信息优化混合权重。
  • 证明数据感知的混合策略相较于静态或基于谱隙优化的方法,能实现更快的收敛速度和更高的测试准确率。
  • 为混合矩阵特性与异质性数据下收敛速率之间的理论关系提供基础支持。

提出的方法

  • 提出一种新度量——相对异质性,用于量化节点间平均后梯度漂移的程度。
  • 将最优混合矩阵设计建模为一个最小化相对异质性度量的凸二次规划问题。
  • 利用采样技术实现节点间梯度统计信息的高效、低开销计算,以支持实时混合矩阵更新。
  • 实施周期性、间歇性的混合矩阵更新,以在保持性能提升的同时降低通信成本。
  • 将动态混合策略集成到标准D-SGD中,对训练流水线的改动极小。
  • 以Metropolis-Hastings权重作为基线,与通过约束凸规划实现的数据自适应优化进行对比。

实验结果

研究问题

  • RQ1数据异质性如何与去中心化SGD中的混合矩阵相互作用,这对收敛性有何影响?
  • RQ2在异质性去中心化学习中,数据感知的时变混合矩阵能否优于静态或基于谱隙优化的混合方法?
  • RQ3在去中心化优化中,混合矩阵、数据异质性与收敛速率之间的理论关系是什么?
  • RQ4如何在不产生高昂通信或计算成本的前提下,高效地在实践中更新混合矩阵?
  • RQ5数据感知混合在多样化深度学习基准上的测试准确率提升程度如何?

主要发现

  • 所提方法在多个基准上均实现了高于最先进基线(包括HADSGD和梯度追踪方法)的测试准确率。
  • 在CIFAR-10上使用ResNet20时,该方法相比使用Metropolis-Hastings权重的标准D-SGD,将top-1准确率最高提升了2.5%。
  • 在ImageNet上使用ResNet-20-EvoNorm时,该方法在相同训练设置下相比静态混合策略实现了1.8%的准确率提升。
  • 在AGNews上微调distilBERT时,使用数据感知混合相比均匀权重或基于谱隙优化的权重,top-1准确率提升了3.1%。
  • 该方法在环形、环面和社交网络拓扑结构下,始终优于静态和基于谱隙优化的混合策略。
  • 理论分析证实,相对异质性度量能紧密控制收敛速率,尤其在数据异质性主导随机噪声时表现显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。