[论文解读] pFedLoRA: Model-Heterogeneous Personalized Federated Learning with LoRA Tuning
该论文提出FedLoRA,一种计算与通信高效的个性化联邦学习框架,适用于模型异构场景,采用低秩适配器(LoRA)。通过在每个客户端的异构本地模型上训练一个共享的小型低秩适配器,并仅在服务器端聚合这些适配器,FedLoRA实现了双向知识迁移,在测试准确率上比最佳基线高出1.35%,计算开销降低11.81倍,通信成本降低7.41倍。
Federated learning (FL) is an emerging machine learning paradigm in which a central server coordinates multiple participants (clients) collaboratively to train on decentralized data. In practice, FL often faces statistical, system, and model heterogeneities, which inspires the field of Model-Heterogeneous Personalized Federated Learning (MHPFL). With the increased interest in adopting large language models (LLMs) in FL, the existing MHPFL methods cannot achieve acceptable computational and communication costs, while maintaining satisfactory model performance. To bridge this gap, we propose a novel and efficient model-heterogeneous personalized Federated learning framework based on LoRA tuning (pFedLoRA). Inspired by the popular LoRA method for fine-tuning pre-trained LLMs with a low-rank model (a.k.a., an adapter), we design a homogeneous small adapter to facilitate federated client's heterogeneous local model training with our proposed iterative training for global-local knowledge exchange. The homogeneous small local adapters are aggregated on the FL server to generate a global adapter. We theoretically prove the convergence of pFedLoRA. Extensive experiments on two benchmark datasets demonstrate that pFedLoRA outperforms six state-of-the-art baselines, beating the best method by 1.35% in test accuracy, 11.81 times computation overhead reduction and 7.41 times communication cost saving.
研究动机与目标
- 解决联邦学习中客户端使用不同模型架构所带来的模型异构性挑战,尤其在大语言模型(LLM)部署场景中。
- 克服现有模型异构个性化联邦学习方法在微调大模型时带来的高计算与通信开销问题。
- 在保护模型个性化与知识产权的前提下,实现异构模型客户端之间的高效知识共享。
- 设计一种在真实资源受限的联邦学习环境中,既能保持高模型准确率,又能显著降低训练与通信开销的框架。
提出的方法
- 为每个客户端的异构本地模型引入一个同构的低秩适配器(LoRA),在微调过程中保持主模型冻结。
- 采用迭代训练机制,实现全局模型(通过聚合的适配器)与本地模型之间的双向知识交换。
- 仅在服务器端聚合小型共享适配器,形成全局适配器,避免传输完整模型,从而降低通信成本。
- 最终推理通过将冻结的本地模型与微调后的适配器结合实现,性能接近全量微调,但计算量显著减少。
- 理论收敛性分析表明,FedLoRA以非凸速率𝒪(1/T)收敛,支持其在实际联邦学习场景中的稳定性与可扩展性。
- 利用LoRA的低秩结构保持模型效率,仅在本地训练中更新适配器参数。
实验结果
研究问题
- RQ1轻量级共享适配器机制是否能在不依赖模型同构性的前提下,实现模型异构联邦学习中的有效知识迁移?
- RQ2在模型异构条件下,FedLoRA在测试准确率、计算效率与通信成本方面与最先进基线相比表现如何?
- RQ3FedLoRA在不同数据非独立同分布(non-IID)程度与客户端参与率变化下,其鲁棒性如何?
- RQ4在异构联邦学习场景中,基于LoRA的适配器是否能同时实现强个性化与有效的全局知识共享?
主要发现
- 在模型异构设置下的基准数据集上,FedLoRA的测试准确率比表现最佳的基线方法(FedProto)高出1.35%。
- 与FedProto相比,FedLoRA将计算开销最高降低了11.81倍,显著提升了资源受限客户端的训练效率。
- 通信成本最高降低7.41倍,因为仅传输和聚合小型适配器参数,而非完整模型权重。
- FedLoRA在数据非独立同分布程度变化与客户端参与率波动下表现出更优的鲁棒性,在所有测试配置中均持续优于FedProto。
- 通过T-SNE可视化证实,FedLoRA实现了更强的类内紧凑性与类间分离性,表明其具备更优的个性化与泛化能力。
- 理论分析验证了FedLoRA以非凸速率𝒪(1/T)收敛,支持其在真实联邦学习条件下的收敛性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。