Skip to main content
QUICK REVIEW

[论文解读] Federated Learning with Heterogeneous Architectures using Graph HyperNetworks

Or Litany, Haggai Maron|arXiv (Cornell University)|Jan 20, 2022
Advanced Graph Neural Networks被引用 7
一句话总结

该论文提出 HAFL-GHN,一种联邦学习框架,通过使用图超网络(GHN)从架构图生成模型权重,实现异构神经网络架构客户端之间的知识共享。该方法在 CIFAR-10 和 CIFAR-100 上表现优异,能有效泛化到未见过的架构,并在通信频率降低的情况下仍保持高准确率。

ABSTRACT

Standard Federated Learning (FL) techniques are limited to clients with identical network architectures. This restricts potential use-cases like cross-platform training or inter-organizational collaboration when both data privacy and architectural proprietary are required. We propose a new FL framework that accommodates heterogeneous client architecture by adopting a graph hypernetwork for parameter sharing. A property of the graph hyper network is that it can adapt to various computational graphs, thereby allowing meaningful parameter sharing across models. Unlike existing solutions, our framework does not limit the clients to share the same architecture type, makes no use of external data and does not require clients to disclose their model architecture. Compared with distillation-based and non-graph hypernetwork baselines, our method performs notably better on standard benchmarks. We additionally show encouraging generalization performance to unseen architectures.

研究动机与目标

  • 解决标准联邦学习的局限性,即要求客户端架构完全相同,以支持跨平台和跨组织协作。
  • 在无需客户端披露其模型结构或使用外部数据的前提下,实现异构架构的联邦学习。
  • 开发一种可适应任意网络拓扑和层组成结构的参数共享机制。
  • 通过可学习的、架构感知的超网络,实现对多样化架构的有效知识聚合。
  • 展示对未见架构的泛化能力,以及在低通信频率下的鲁棒性。

提出的方法

  • 将每个客户端的神经网络表示为计算图,其中节点表示层(参数化和非参数化层),边表示数据流连接。
  • 使用图超网络(GHN)基于输入的架构图生成模型权重,实现与架构无关的参数生成。
  • 在每个客户端上使用其私有数据和架构训练本地 GHN 的副本,仅将 GHN 权重上传至服务器进行聚合。
  • 利用图神经网络(GNN)中的消息传递机制编码层的位置信息和结构上下文,确保不同架构中相似层被有意义地编码。
  • 通过 FedAvg 聚合客户端的 GHN 权重,使全局 GHN 学习到共享的、泛化的权重生成策略。
  • 使用训练好的 GHN 初始化新的、未见过的架构,并在本地数据上微调,实现快速收敛和优异性能。

实验结果

研究问题

  • RQ1联邦学习能否在具有根本不同神经网络架构的客户端之间有效聚合知识?
  • RQ2基于超网络的方法能否在无需客户端披露其模型架构的前提下实现参数共享?
  • RQ3通过图表示编码架构结构是否能提升异构联邦学习中的性能与泛化能力?
  • RQ4通信频率如何影响所提出的 HAFL-GHN 框架的性能?
  • RQ5训练好的 GHN 是否能通过极少微调泛化到新的、此前未见过的架构?

主要发现

  • HAFL-GHN 在 CIFAR-10 和 CIFAR-100 基准测试中,针对异构架构实现了最先进性能,优于基于蒸馏和非图超网络的基线方法。
  • 该方法能有效泛化到未见架构:使用 HAFL-GHN 权重初始化的 4 层 CNN 能快速收敛,并达到与在联邦训练中获得的模型相当的性能。
  • 即使通信频率仅为标准频率的 1/5,HAFL-GHN 的准确率下降不足 1%,表明其对通信减少具有高度鲁棒性。
  • 在 GNN 中引入通过消息传递的图结构编码,相比不考虑结构上下文而仅对相同层类型取平均的基线,性能提升达 7–10%。
  • 当将四个主要架构之一替换为更小的 4 层 CNN 时,平均性能下降仅为 2.2±1.4%,显著优于从零开始训练的模型。
  • 该方法在多种架构上均保持优异性能,包括深度和层组成不同的网络,证实了其架构灵活性与可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。