Skip to main content
QUICK REVIEW

[论文解读] FedPara: Low-Rank Hadamard Product for Communication-Efficient Federated Learning

Nam Hyeon-Woo, Moon Ye-Bin|arXiv (Cornell University)|Aug 13, 2021
Privacy-Preserving Technologies in Data参考文献 42被引用 16
一句话总结

FedPara 提出了一种通信高效的联邦学习方法,通过使用低秩哈达玛积重参数化神经网络层,实现在显著减少参数量的同时保持全秩表示。该方法相比原始模型将通信成本降低了多达10倍,同时保持或提升准确率,并可与其它联邦学习优化器结合以获得进一步增益。

ABSTRACT

In this work, we propose a communication-efficient parameterization, FedPara, for federated learning (FL) to overcome the burdens on frequent model uploads and downloads. Our method re-parameterizes weight parameters of layers using low-rank weights followed by the Hadamard product. Compared to the conventional low-rank parameterization, our FedPara method is not restricted to low-rank constraints, and thereby it has a far larger capacity. This property enables to achieve comparable performance while requiring 3 to 10 times lower communication costs than the model with the original layers, which is not achievable by the traditional low-rank methods. The efficiency of our method can be further improved by combining with other efficient FL optimizers. In addition, we extend our method to a personalized FL application, pFedPara, which separates parameters into global and local ones. We show that pFedPara outperforms competing personalized FL methods with more than three times fewer parameters.

研究动机与目标

  • 解决由于在带宽受限的边缘设备上频繁上传和下载模型而导致联邦学习中通信开销过高的问题。
  • 克服传统低秩参数化方法的局限性,后者限制了模型容量且无法实现全秩表示。
  • 开发一种参数化方法,在大幅减少每轮通信传输比特数的同时保持模型容量。
  • 通过将全局参数与本地参数分离,将该方法扩展至个性化联邦学习,从而在异构、非独立同分布(non-IID)数据设置下提升性能。
  • 证明 FedPara 可与现有联邦学习优化器及量化技术结合,进一步提升通信效率和准确率。

提出的方法

  • 使用低秩哈达玛积对全连接层和卷积层进行重参数化:$\mathbf{W} = (\mathbf{X}_1\mathbf{Y}_1^\top) \odot (\mathbf{X}_2\mathbf{Y}_2^\top)$,其中每个分解矩阵的秩为 $r$。
  • 利用 $\mathrm{rank}(\mathbf{W}) \leq r^2$ 的性质,以远少于原始 $m \times n$ 权重矩阵的参数量表示全秩矩阵。
  • 通过预计算并存储 $\mathbf{W}$,在推理阶段保持原始模型结构,确保计算复杂度不增加。
  • 引入缩放超参数 $\gamma$ 以控制参数化模型的大小,实现模型大小与性能之间的权衡。
  • 通过将低秩因子划分为全局和本地组件,将 FedPara 扩展为 pFedPara,实现客户端级别的个性化模型学习。
  • 将 FedPara 与其它通信高效方法(如 FedPAQ,即量化)结合,进一步降低通信成本,且准确率损失可忽略。

实验结果

研究问题

  • RQ1低秩哈达玛积参数化是否能在联邦学习中实现全秩表示,同时降低通信成本?
  • RQ2在相同的参数预算下,FedPara 是否在准确率和通信效率方面优于传统低秩参数化方法?
  • RQ3与原始模型相比,FedPara 在非独立同分布(non-IID)和异构数据设置下,通信成本可降低多少?
  • RQ4将 FedPara 与其他联邦学习优化技术(如量化、FedAvg)结合后,对通信效率和模型准确率的影响如何?
  • RQ5pFedPara 是否能在使用显著更少参数的情况下,实现优于现有个性化联邦学习方法的性能?

主要发现

  • FedPara 相比原始模型将通信成本降低了最多10倍,同时在 CIFAR-10、ImageNet 和 Shakespeare 数据集上实现了相当或更优的准确率。
  • 在 VGG16 与 CIFAR-10(IID)设置下,FedPara 使用 $\gamma=0.5$ 时达到 83.82% 的准确率,每轮仅传输 46.4MB 数据——比 FedAvg(122MB)减少超过两倍。
  • 与 FedPAQ 结合后,FedPara 相比单独使用 FedPara 进一步降低 25% 的通信成本,且准确率仅比 FedAvg 低 0.1%。
  • 对于 ResNet18,FedPara 在不同模型尺寸下,达到相同目标准确率所需的通信成本仅为原始模型的 1.17 至 5.1 倍。
  • 在 Shakespeare 数据集的 LSTM 模型中,使用原始参数量 19% 的 FedPara 在 IID 设置下优于低秩基线模型和原始模型,在非 IID 设置下仍保持竞争力。
  • pFedPara 所用参数量比现有个性化联邦学习方法少三倍以上,且在具有挑战性的非 IID 场景下展现出更优的鲁棒性和性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。