Skip to main content
QUICK REVIEW

[论文解读] Exploring Parameter-Efficient Fine-Tuning to Enable Foundation Models in Federated Learning

Guangyu Sun, Khalid, Umar|arXiv (Cornell University)|Oct 4, 2022
Privacy-Preserving Technologies in Data被引用 8
一句话总结

该论文提出了 FedPEFT,一种新颖的联邦学习框架,通过应用参数高效微调(PEFT)技术(如适配器、提示词和偏置调优)来实现大型预训练模型(如 ViT-Base)的微调。通过仅传输一小部分模型权重(例如,将每轮通信量从 328MB 减少至 0.68MB),FedPEFT 在多种联邦学习场景中实现了具有竞争力或更优的性能,同时大幅降低了通信开销。

ABSTRACT

Federated learning (FL) has emerged as a promising paradigm for enabling the collaborative training of models without centralized access to the raw data on local devices. In the typical FL paradigm (e.g., FedAvg), model weights are sent to and from the server each round to participating clients. Recently, the use of small pre-trained models has been shown to be effective in federated learning optimization and improving convergence. However, recent state-of-the-art pre-trained models are getting more capable but also have more parameters, known as the "Foundation Models." In conventional FL, sharing the enormous model weights can quickly put a massive communication burden on the system, especially if more capable models are employed. Can we find a solution to enable those strong and readily available pre-trained models in FL to achieve excellent performance while simultaneously reducing the communication burden? To this end, we investigate the use of parameter-efficient fine-tuning in federated learning and thus introduce a new framework: FedPEFT. Specifically, we systemically evaluate the performance of FedPEFT across a variety of client stability, data distribution, and differential privacy settings. By only locally tuning and globally sharing a small portion of the model weights, significant reductions in the total communication overhead can be achieved while maintaining competitive or even better performance in a wide range of federated learning scenarios, providing insight into a new paradigm for practical and effective federated systems.

研究动机与目标

  • 解决在使用大型预训练模型(如拥有 8400 万个参数的 ViT-Base)时联邦学习中的关键通信瓶颈问题。
  • 探究在数据异构性、客户端不稳定性和差分隐私约束下,参数高效微调(PEFT)方法(在集中式训练中常见)是否可有效适配到联邦学习设置中。
  • 在不产生高昂通信成本的前提下,实现基于基础模型的联邦学习中强大性能。
  • 系统性地评估 FedPEFT 在多种联邦学习场景下的表现,包括非独立同分布(non-IID)数据、数据稀缺性以及差分隐私。
  • 证明在具有挑战性的联邦学习条件下,基于 PEFT 的微调在准确率和通信效率方面可超越全参数微调和头层微调。

提出的方法

  • 将三种 PEFT 方法——偏置调优、适配器调优和提示词调优——整合进联邦学习框架中,使每个客户端仅更新一小部分模型参数。
  • 在客户端保持预训练主干网络权重冻结,仅微调一小部分可学习的适配器或提示词头,显著减少可训练参数数量。
  • 仅在客户端与服务器之间传输更新后的 PEFT 参数(如适配器权重或提示词嵌入),将每轮通信量从约 328MB(完整模型)减少至约 0.68MB。
  • 采用标准的联邦平均(FedAvg)进行全局模型聚合,但仅更新并传输特定于 PEFT 的参数。
  • 采用统一的训练流程:每个客户端在预训练模型上执行本地 PEFT,并仅将 PEFT 参数发送至服务器进行聚合。
  • 支持多种预训练范式(监督学习、基于 DINO 的自监督学习)和主干网络大小(ViT-B、ViT-S),以评估泛化能力和鲁棒性。

实验结果

研究问题

  • RQ1参数高效微调(PEFT)是否可在联邦学习中有效应用,以在保持或提升模型性能的同时显著降低通信成本?
  • RQ2与全参数微调和头层微调相比,FedPEFT 在数据异构性、客户端非独立同分布分布以及客户端不稳定性条件下的表现如何?
  • RQ3在差分隐私(DP)设置下,即在梯度或参数中添加噪声时,FedPEFT 是否仍能保持强性能?
  • RQ4在低数据场景下(每个客户端仅有 1,000–2,000 个样本),FedPEFT 的表现如何?
  • RQ5不同的预训练数据集(ImageNet-1K 与 ImageNet-21K)以及不同的预训练范式(监督学习与自监督学习)如何影响 FedPEFT 的性能?

主要发现

  • 当使用 ViT-Base 时,FedPEFT 将每轮通信量从约 328MB 降低至约 0.68MB,通信开销减少了 99.8%。
  • 在 ImageNet-21K 上全量预训练的前提下,FedPEFT 采用适配器调优在 CIFAR-100 上达到 87.99% 的准确率,优于使用相同预训练权重的全参数微调(92.09%)。
  • 在差分隐私(DP)设置下,使用 DINO 预训练的 ViT-B 在 ImageNet-1K 上,FedPEFT 采用偏置调优达到 85.34% 的准确率,优于相同 DP 约束下的全参数微调。
  • 在低数据场景(每个客户端 1,000–2,000 个样本)下,FedPEFT 始终优于全参数微调和头层微调,展现出对数据稀缺性的强鲁棒性。
  • FedPEFT 在不同主干网络大小(ViT-B 与 ViT-S)以及不同预训练数据集(ImageNet-1K 与 ImageNet-21K)下均保持优异性能,表现出良好的泛化性和稳定性。
  • 头层微调的性能在不同模型大小和预训练数据规模下相对稳定,因其表示固定;但 FedPEFT 显著提升了准确率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。