Skip to main content
QUICK REVIEW

[论文解读] Adaptive Parameterization of Deep Learning Models for Federated Learning

Morten From Elvebakken, Alexandros Iosifidis|arXiv (Cornell University)|Feb 6, 2023
Privacy-Preserving Technologies in Data被引用 5
一句话总结

本文提出在联邦学习中使用并行适配器,以将通信开销降低高达90%,同时保持与全模型微调相当的推理性能。通过仅训练适配器参数——即小型、任务特定的模块——客户端仅交换极少的数据,显著降低了在非独立同分布(non-IID)数据分布下的跨小批量和跨设备联邦学习设置中的带宽使用量。

ABSTRACT

Federated Learning offers a way to train deep neural networks in a distributed fashion. While this addresses limitations related to distributed data, it incurs a communication overhead as the model parameters or gradients need to be exchanged regularly during training. This can be an issue with large scale distribution of learning tasks and negate the benefit of the respective resource distribution. In this paper, we we propose to utilise parallel Adapters for Federated Learning. Using various datasets, we show that Adapters can be incorporated to different Federated Learning techniques. We highlight that our approach can achieve similar inference performance compared to training the full model while reducing the communication overhead by roughly 90%. We further explore the applicability of Adapters in cross-silo and cross-device settings, as well as different non-IID data distributions.

研究动机与目标

  • 通过最小化客户端与服务器在训练轮次间传输的数据量,减少联邦学习中的通信开销。
  • 在仅交换轻量级适配器参数的同时,保持与全模型微调相当的高推理性能。
  • 评估适配器在跨小批量和跨设备联邦学习设置下,面对不同非独立同分布数据分布时的有效性。
  • 探索仅交换适配器而非全模型权重在安全性与可扩展性方面的优势。
  • 证明适配器可作为即插即用的增强模块集成到现有联邦学习算法中,而无需修改基础模型架构。

提出的方法

  • 在预训练的、领域无关的基础模型中引入并行适配器作为轻量级可训练模块。
  • 在联邦学习轮次中仅训练适配器参数,同时保持基础模型权重冻结。
  • 仅在客户端与服务器之间交换适配器的 state_dicts,将负载大小从22.2 MB(全模型)降低至2.58 MB(仅适配器)。
  • 以FedAvg、FedProx和FedNova作为基线联邦学习算法,并将适配器作为附加组件集成。
  • 在跨设备和跨小批量设置中,应用标签分布偏移和特征分布偏移,以模拟客户端间的非独立同分布数据。
  • 通过中心化初始化确保所有客户端的适配器具有统一的起始点,从而保持模型对齐。

实验结果

研究问题

  • RQ1适配器是否能在不牺牲模型准确率的前提下减少联邦学习中的通信开销?
  • RQ2在不同非独立同分布数据分布(如标签偏移和特征偏移)下,基于适配器的联邦学习表现如何?
  • RQ3与全模型微调相比,使用适配器时通信成本与推理性能之间的权衡如何?
  • RQ4在客户参与度和资源约束各异的跨小批量与跨设备联邦学习设置下,该方法的可扩展性如何?
  • RQ5通过限制基础模型参数的暴露,适配器是否能增强联邦学习中的安全性?

主要发现

  • 所提出的基于适配器的联邦学习方法将通信开销降低了约90%,负载大小从22.2 MB(全模型)降至2.58 MB(仅适配器)。
  • 基于适配器的联邦学习在多个数据集和联邦学习算法(包括FedAvg、FedProx和FedNova)上实现了与全模型微调相当的推理性能。
  • 在M=1(极端类别不平衡)的数量型标签不平衡下,全微调和适配器训练均表现出较差的收敛性,但适配器训练在较低学习率下仍保持稳定。
  • 在基于分布的标签不平衡下,基于适配器的联邦学习与全微调相比表现出更明显的性能差距,表明其对某些非独立同分布模式具有敏感性。
  • 该方法与现有联邦学习算法兼容,可作为即插即用的解决方案使用,而无需修改基础模型架构。
  • 适配器通过确保被拦截的传输仅包含无功能的适配器权重(需依赖基础模型才能使用),从而提升了安全性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。