Skip to main content
QUICK REVIEW

[论文解读] FedHM: Efficient Federated Learning for Heterogeneous Models via Low-rank Factorization

Dezhong Yao, Wanning Pan|arXiv (Cornell University)|Nov 29, 2021
Privacy-Preserving Technologies in Data被引用 13
一句话总结

FedHM 提出了一种新颖的联邦学习框架,通过使用低秩分解将全局模型压缩为更小、针对客户端的特定模型,从而实现异构模型在不同计算能力下的高效训练。该方法在不同模型规模和通信设置下均表现出卓越的性能与鲁棒性,具备理论收敛保证,并显著降低了通信成本。

ABSTRACT

One underlying assumption of recent federated learning (FL) paradigms is that all local models usually share the same network architecture and size, which becomes impractical for devices with different hardware resources. A scalable federated learning framework should address the heterogeneity that clients have different computing capacities and communication capabilities. To this end, this paper proposes FedHM, a novel heterogeneous federated model compression framework, distributing the heterogeneous low-rank models to clients and then aggregating them into a full-rank model. Our solution enables the training of heterogeneous models with varying computational complexities and aggregates them into a single global model. Furthermore, FedHM significantly reduces the communication cost by using low-rank models. Extensive experimental results demonstrate that FedHM is superior in the performance and robustness of models of different sizes, compared with state-of-the-art heterogeneous FL methods under various FL settings. Additionally, the convergence guarantee of FL for heterogeneous devices is first theoretically analyzed.

研究动机与目标

  • 解决联邦学习中系统与模型异构性的问题,其中客户端具有不同的计算与通信能力。
  • 克服现有方法(如 HeteroFL 和 Split-Mix)在小型模型上表现不佳且缺乏收敛保证的局限性。
  • 在保留模型容量的前提下,实现对不同规模与复杂度的异构模型的有效训练与聚合。
  • 通过向客户端分发低秩压缩模型来减少通信开销,最小化数据传输量。
  • 为异构设备与模型设置下的联邦学习提供理论收敛保证。

提出的方法

  • 在服务器端使用奇异值分解(SVD)对全秩全局模型进行低秩分解,通过混合网络结构保留模型容量。
  • 根据客户端的硬件能力将压缩后的低秩模型分发给客户端,使其能在资源受限设备上高效进行本地训练。
  • 在服务器端使用矩阵恢复技术,从低秩分解的本地模型中重建全秩模型。
  • 通过加权平均聚合恢复后的全秩模型以更新全局模型,确保在异构架构间的兼容性。
  • 通过低秩分解与结构化剪枝(SI 和 FD)引入正则化效果,提升泛化能力并防止过拟合。
  • 采用一种新颖的聚合策略,在与大模型结合时仍能保持小模型的性能,避免性能下降。

实验结果

研究问题

  • RQ1低秩分解是否能在联邦学习中有效压缩深度神经网络,同时在异构客户端上保持模型性能?
  • RQ2与最先进异构联邦学习方法(如 HeteroFL、Split-Mix)相比,FedHM 在准确率、鲁棒性与通信效率方面表现如何?
  • RQ3所提出方法在存在模型与系统异构性的情况下是否具备理论收敛保证?
  • RQ4与均匀宽度剪枝相比,低秩压缩结合混合架构在模型准确率与参数效率方面优势有多大?
  • RQ5FedHM 在非独立同分布(Non-IID)数据分布及不同模型规模下,在同质与异质联邦学习设置中的表现如何?

主要发现

  • FedHM 在所有模型规模下均实现了高于最先进方法的测试准确率,使用 11.17M 参数的全局模型在 CIFAR-10 的 IID 条件下达到 93.50% 的 Top-1 准确率。
  • 在 CIFAR-100 上,最小的低秩模型(3.27M 参数)在 IID 条件下达到 71.05% 的准确率,在 Non-IID 条件下达到 67.96%,在某些情况下优于原始模型。
  • 与全秩模型相比,通信成本降低了 7.8 倍至 9.0 倍,计算开销降低了 2.0 倍。
  • FedHM 中的混合网络结构可防止严重压缩模型的性能下降,若移除该结构,准确率从 90% 下降至 80% 以下。
  • FedHM 在不同模型组合下保持鲁棒性能,小模型在与大模型聚合时不会出现性能损失。
  • 首次为异构设备设置下的联邦学习方法提供了 FedHM 的理论收敛证明。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。