Skip to main content
QUICK REVIEW

[论文解读] Federated Graph Machine Learning: A Survey of Concepts, Techniques, and Applications

Xingbo Fu, Binchi Zhang|arXiv (Cornell University)|Jul 24, 2022
Privacy-Preserving Technologies in Data被引用 13
一句话总结

本综述提出联邦图机器学习(FGML)作为在去中心化、隐私敏感的数据源上训练图神经网络的解决方案。它将FGML新颖地划分为‘带有结构化数据的联邦学习’和‘结构化联邦学习’两类,回顾了关键技术、应用场景、数据集和平台,并指出了包括数据异构性、隐私泄露、通信开销、公平性与安全性在内的开放挑战,为未来研究提供了全面路线图。

ABSTRACT

Graph machine learning has gained great attention in both academia and industry recently. Most of the graph machine learning models, such as Graph Neural Networks (GNNs), are trained over massive graph data. However, in many real-world scenarios, such as hospitalization prediction in healthcare systems, the graph data is usually stored at multiple data owners and cannot be directly accessed by any other parties due to privacy concerns and regulation restrictions. Federated Graph Machine Learning (FGML) is a promising solution to tackle this challenge by training graph machine learning models in a federated manner. In this survey, we conduct a comprehensive review of the literature in FGML. Specifically, we first provide a new taxonomy to divide the existing problems in FGML into two settings, namely, FL with structured data and structured FL. Then, we review the mainstream techniques in each setting and elaborate on how they address the challenges under FGML. In addition, we summarize the real-world applications of FGML from different domains and introduce open graph datasets and platforms adopted in FGML. Finally, we present several limitations in the existing studies with promising research directions in this field.

研究动机与目标

  • 解决在多个客户端之间分布的去中心化、隐私敏感的图数据上训练图机器学习模型的挑战。
  • 提出一种新的FGML分类体系,根据客户端间图结构的作用,区分‘带有结构化数据的联邦学习’与‘结构化联邦学习’。
  • 系统性回顾现有技术,以应对FGML中跨客户端缺失信息、结构隐私泄露和数据异构性的问题。
  • 总结FGML在医疗健康、金融、生物信息学和推荐系统等现实世界应用中的实例。
  • 识别开放挑战与未来研究方向,包括安全聚合、通信效率、公平性以及对投毒攻击的鲁棒性。

提出的方法

  • 提出两级分类体系:‘带有结构化数据的联邦学习’(客户端在本地子图上训练,仅能访问有限的邻居信息)与‘结构化联邦学习’(客户端形成更高层级的客户端图,支持跨客户端信息共享)。
  • 回顾缓解跨客户端缺失信息的技术,如跨客户端边界的消息传递与表示补全策略。
  • 分析图结构的隐私保护机制,包括差分隐私与节点嵌入的安全聚合。
  • 研究处理图结构中数据异构性的方法,如自适应聚合与客户端特定的模型个性化。
  • 评估通信减少策略,如模型压缩与针对图特异性依赖关系定制的本地更新调度。
  • 引入并评估开源平台如FederatedScope-GNN与FedGraphNN,并突出可用于FGML研究的公开图数据集。

实验结果

研究问题

  • RQ1当图数据在多个具有隐私约束的客户端之间分布时,如何有效训练图机器学习模型?
  • RQ2‘带有结构化数据的联邦学习’与‘结构化联邦学习’之间的关键区别是什么?它们如何影响模型设计与优化?
  • RQ3在联邦训练过程中,如何在保护节点特征隐私的同时,也保护图结构信息的隐私?
  • RQ4有哪些技术可以缓解由非独立同分布(non-IID)图结构及客户端间缺失邻居信息导致的性能下降?
  • RQ5FGML中的主要开放挑战是什么?未来研究如何应对通信效率、公平性与安全性问题?

主要发现

  • 该综述识别出两种主要的FGML场景:‘带有结构化数据的联邦学习’与‘结构化联邦学习’,二者在处理数据与结构隐私方面需采用不同的技术路径。
  • 跨客户端缺失信息仍是主要挑战,因为节点无法访问位于其他客户端上的邻居特征,导致表示不完整。
  • 结构隐私泄露是一个重大关切,因为邻接矩阵与节点嵌入在传输过程中可能暴露敏感关系。
  • FGML中的现有通信策略效率低于标准联邦学习,因为需要同时在节点级与客户端级图结构上传播信息。
  • FGML中的公平性研究尚不充分,客户端间的结构差异可能放大不同群体间模型性能的偏差。
  • 当前FGML的基准与平台有限,缺乏真实、大规模的分布式图数据,阻碍了可复现且实用的研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。