Skip to main content
QUICK REVIEW

[论文解读] Efficient and Private Federated Learning with Partially Trainable Networks

Hakim Sidahmed, Zheng Xu|arXiv (Cornell University)|Oct 6, 2021
Privacy-Preserving Technologies in Data参考文献 44被引用 11
一句话总结

本文提出联邦部分可训练网络(FedPT),一种在联邦学习中冻结部分模型参数以大幅降低通信和计算成本的方法。通过仅传输可训练参数和一个随机种子,FedPT在仅造成轻微准确率下降的情况下,将通信成本降低至原来的1/46,同时在强差分隐私保护下提升了模型效用。

ABSTRACT

Federated learning is used for decentralized training of machine learning models on a large number (millions) of edge mobile devices. It is challenging because mobile devices often have limited communication bandwidth and local computation resources. Therefore, improving the efficiency of federated learning is critical for scalability and usability. In this paper, we propose to leverage partially trainable neural networks, which freeze a portion of the model parameters during the entire training process, to reduce the communication cost with little implications on model performance. Through extensive experiments, we empirically show that Federated learning of Partially Trainable neural networks (FedPT) can result in superior communication-accuracy trade-offs, with up to $46 imes$ reduction in communication cost, at a small accuracy cost. Our approach also enables faster training, with a smaller memory footprint, and better utility for strong differential privacy guarantees. The proposed FedPT method can be particularly interesting for pushing the limitations of over-parameterization in on-device learning.

研究动机与目标

  • 解决在跨设备联邦学习中,于资源受限的边缘设备上训练大模型所面临的高通信与计算开销问题。
  • 通过冻结部分模型参数以减少通信和内存使用,提升联邦学习效率。
  • 通过减少参数更新,使训练过程对差分隐私噪声更具鲁棒性,从而增强隐私保障。
  • 探索在实际联邦学习部署中,通信效率、模型准确率与内存占用之间的权衡。
  • 通过减轻边缘设备的资源负担,特别是带宽或计算能力有限的设备,促进更广泛的联邦学习参与。

提出的方法

  • 采用广义FedAvg作为训练框架,仅将客户端在可训练参数上的更新发送至服务器。
  • 在训练过程中冻结部分模型参数,并通过服务器发送的随机种子在各客户端上重建这些参数。
  • 通过仅传输可训练参数(低至总参数量的2%)和每个客户端的随机种子,降低通信成本。
  • 通过在本地训练中跳过对冻结参数的梯度计算,最小化本地计算与内存使用。
  • 通过仅对可训练参数添加噪声,与差分隐私集成,从而因更新参数更少而降低噪声影响。
  • 将FedPT应用于多种架构,包括卷积网络(CIFAR-10、EMNIST)和Transformer模型(Stack Overflow),验证其通用性。

实验结果

研究问题

  • RQ1在联邦学习中,冻结部分模型参数在不显著降低模型准确率的前提下,能将通信成本降低多少?
  • RQ2在部分参数训练下,不同模型架构和数据集上的通信-准确率权衡关系如何变化?
  • RQ3减少可训练参数数量是否能提升对差分隐私噪声的鲁棒性,从而在强隐私约束下获得更好的效用?
  • RQ4参数冻结对联邦学习环境中本地内存占用和训练速度有何影响?
  • RQ5FedPT能否在具有异构客户端能力的真实设备联邦学习中有效扩展?

主要发现

  • 与完全可训练模型相比,FedPT在不同数据集上将通信成本降低高达46倍,测试准确率仅下降0.1%至4%。
  • 在模拟实验中,由于客户端和服务器计算量减少,训练时间最多缩短25%。
  • 随着冻结参数比例的提高,峰值内存使用量最多降低10%,CIFAR-10实验中尤为明显。
  • 在强差分隐私保护下(例如ε ≈ 1.77),FedPT在相同噪声水平下实现15.01%的准确率,优于完全可训练模型的14.60%。
  • 该方法在多种任务中保持了具有竞争力的性能,包括图像分类(EMNIST、CIFAR-10)和自然语言处理(Stack Overflow下一个词预测)。
  • 该方法显著提升了训练效率与隐私保护,尤其适用于带宽或计算能力有限的设备。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。