Skip to main content
QUICK REVIEW

[论文解读] Architecture Agnostic Federated Learning for Neural Networks

Disha Makhija, Xing Han|arXiv (Cornell University)|Feb 15, 2022
Privacy-Preserving Technologies in Data被引用 12
一句话总结

该论文提出 FedHeNN,一种新型的与架构无关的联邦学习框架,通过使用近端项和中心化核对齐(CKA)距离对实例级表征进行对齐,使具有异构神经网络架构的客户端能够协作训练个性化模型。该方法在异构设置下显著优于 FedAvg 和 FedProx,通过在不同模型架构和数据约束下实现稳健的表征迁移,从而取得更优性能。

ABSTRACT

With growing concerns regarding data privacy and rapid increase in data volume, Federated Learning(FL) has become an important learning paradigm. However, jointly learning a deep neural network model in a FL setting proves to be a non-trivial task because of the complexities associated with the neural networks, such as varied architectures across clients, permutation invariance of the neurons, and presence of non-linear transformations in each layer. This work introduces a novel Federated Heterogeneous Neural Networks (FedHeNN) framework that allows each client to build a personalised model without enforcing a common architecture across clients. This allows each client to optimize with respect to local data and compute constraints, while still benefiting from the learnings of other (potentially more powerful) clients. The key idea of FedHeNN is to use the instance-level representations obtained from peer clients to guide the simultaneous training on each client. The extensive experimental results demonstrate that the FedHeNN framework is capable of learning better performing models on clients in both the settings of homogeneous and heterogeneous architectures across clients.

研究动机与目标

  • 解决联邦学习中的客户端异构性问题,其中客户端具有不同的计算资源和数据分布。
  • 克服现有联邦学习方法(如 FedAvg 和 FedProx)的局限性,这些方法要求模型架构一致,且在统计异构性和系统异构性方面表现不佳。
  • 在不强制客户端采用统一架构的前提下,实现个性化模型训练,使每个客户端能够基于本地约束进行优化。
  • 通过表征对齐而非共享模型权重来实现知识迁移,从而提升模型性能和包容性。
  • 开发一种即使在部分客户端数据减少或计算能力较低时仍能保持强性能的框架。

提出的方法

  • FedHeNN 在客户端优化目标中引入近端项,以鼓励不同客户端之间最终层表征的对齐。
  • 该框架使用中心化核对齐(CKA)作为基于核的距离度量,以衡量来自不同客户端的表征之间的相似性。
  • 每个客户端训练具有任意架构的个性化神经网络,包括不同的深度、宽度和激活函数。
  • 近端项将不同客户端中相同输入实例的表征拉近,从而在架构差异下实现知识迁移。
  • 该方法支持同构和异构模型架构,实验评估基于 CIFAR-10、CIFAR-100 和 Sentiment140 数据集。
  • 该框架对部分客户端数据减少具有鲁棒性,并且在高本地训练轮次下仍能保持性能。

实验结果

研究问题

  • RQ1是否可以在不强制要求共享全局模型架构的前提下,将联邦学习有效扩展到具有异构神经网络架构的客户端?
  • RQ2如何在保护隐私的前提下,实现不同模型容量和架构的客户端之间的知识迁移?
  • RQ3与基于权重聚合的联邦学习相比,使用 CKA 和近端项进行表征级对齐是否能提升泛化能力和性能?
  • RQ4在部分客户端数据稀疏或计算资源减少的情况下,FedHeNN 的表现如何?
  • RQ5不同核类型(线性核与 RBF 核)对 FedHeNN 中基于 CKA 的表征对齐有何影响?

主要发现

  • FedHeNN 在同构和异构设置下均优于 FedAvg 和 FedProx,在同构模型下于 CIFAR-10 上达到 94.47% 的测试准确率。
  • 在异构设置下,即使客户端使用不同大小和架构的模型,FedHeNN 仍能保持强劲性能,展现出架构灵活性。
  • CKA 中使用 RBF 核和线性核的性能相当,其中 RBF 核在 CIFAR-10 上达到 93.03%,线性核达到 94.47%。
  • FedHeNN 对数据减少具有鲁棒性:当客户端数据减少 50% 时,平均测试准确率仅平稳下降,表现出对数据稀疏性的抗性。
  • 与 FedAvg 不同,FedHeNN 在高本地训练轮次(最高达 20 轮)下仍能保持稳定性能,表明近端项有效缓解了发散问题。
  • 该框架使计算能力较低的客户端能够有效参与,避免了在传统方法中排除此类客户端时导致的性能下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。