Skip to main content
QUICK REVIEW

[论文解读] FedGL: Federated Graph Learning Framework with Global Self-Supervision

Chuan Chen, Weibo Hu|arXiv (Cornell University)|May 7, 2021
Privacy-Preserving Technologies in Data参考文献 61被引用 11
一句话总结

FedGL 是一种联邦图学习框架,通过在客户端之间共享全局伪标签和伪图实现全局自监督,从而在保护数据隐私的前提下提升模型性能。它在四个基准数据集上的节点分类任务中显著优于基线方法,有效缓解了数据异构性,并利用了互补的图信息。

ABSTRACT

Graph data are ubiquitous in the real world. Graph learning (GL) tries to mine and analyze graph data so that valuable information can be discovered. Existing GL methods are designed for centralized scenarios. However, in practical scenarios, graph data are usually distributed in different organizations, i.e., the curse of isolated data islands. To address this problem, we incorporate federated learning into GL and propose a general Federated Graph Learning framework FedGL, which is capable of obtaining a high-quality global graph model while protecting data privacy by discovering the global self-supervision information during the federated training. Concretely, we propose to upload the prediction results and node embeddings to the server for discovering the global pseudo label and global pseudo graph, which are distributed to each client to enrich the training labels and complement the graph structure respectively, thereby improving the quality of each local model. Moreover, the global self-supervision enables the information of each client to flow and share in a privacy-preserving manner, thus alleviating the heterogeneity and utilizing the complementarity of graph data among different clients. Finally, experimental results show that FedGL significantly outperforms baselines on four widely used graph datasets.

研究动机与目标

  • 解决由于隐私和监管限制,图数据分布在多个客户端时训练高质量图模型的挑战。
  • 克服联邦图学习中统计和结构异构性的问题,即客户端拥有不同的节点、边、标签和图结构。
  • 利用客户端之间的重叠节点,挖掘图数据中的互补信息,而无需共享原始数据。
  • 开发一种可泛化的框架,适用于多种图模型和联邦设置,且无需集中化数据。
  • 通过仅共享模型输出(预测结果和嵌入表示)而非原始图数据,确保隐私保护。

提出的方法

  • 客户端使用其私有数据训练本地图神经网络,并仅将预测结果和节点嵌入上传至中央服务器。
  • 服务器通过聚合客户端的预测结果生成全局伪标签,并使用置信度阈值筛选高精度预测。
  • 服务器通过识别并连接在多个客户端中具有高置信度且相似预测结果的节点,构建全局伪图。
  • 将全局伪标签和全局伪图分发回客户端,以丰富本地训练标签并增强本地图结构。
  • 引入自监督学习损失函数,将主任务损失与全局伪标签和全局伪图相结合,以提升泛化能力。
  • 框架使用超参数 α(自监督强度)和 β(伪图重要性)来平衡全局自监督与主任务学习的贡献。

实验结果

研究问题

  • RQ1在存在数据异构性和隐私约束的情况下,全局自监督能否提升联邦图学习的性能?
  • RQ2基于客户端预测生成的全局伪标签在提升本地和全局模型准确率方面效果如何?
  • RQ3通过全局伪图补充本地图结构在多大程度上能改善模型泛化能力?
  • RQ4置信度阈值 λ、自监督系数 α 和邻居数量 s 等超参数如何影响 FedGL 的鲁棒性和性能?
  • RQ5FedGL 是否能在具有重叠但不完全相同的图数据的多种图模型和现实场景中实现泛化?

主要发现

  • 当使用全局伪标签时,FedGL 在 Citeseer 数据集上的节点分类准确率相比基线联邦方法至少提升 5%。
  • 生成全局伪标签的最优置信度阈值 λ 落在 [0.1, 0.3] 范围内,且在此区间内性能保持稳定。
  • 自监督系数 α 在设置低于 0.3 时表现最佳,因为过高的值会导致自监督信号被过度强调,从而降低性能。
  • 全局伪图系数 β 在 [0, 1] 范围内表现稳定,未出现显著的准确率下降,表明对伪图集成强度变化具有鲁棒性。
  • 全局伪图的邻居数量 s 对性能影响极小,s 从 5 到 1000 的范围内结果稳定,表明框架具备可扩展性和鲁棒性。
  • FedGL 在所有四个数据集(Cora、Citeseer、ACM、Wiki)上均持续优于集中式和简单联邦基线方法,证实其在现实联邦图学习场景中的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。