Skip to main content
QUICK REVIEW

[论文解读] STFL: A Temporal-Spatial Federated Learning Framework for Graph Neural Networks

Guannan Lou, Yuze Liu|arXiv (Cornell University)|Nov 12, 2021
Privacy-Preserving Technologies in Data参考文献 28被引用 11
一句话总结

STFL 提出了一种新颖的联邦学习框架,将原始时空数据转换为图结构输入以供图神经网络(GNNs)使用,实现了隐私保护下的协作模型训练。通过利用 PLV 和 PCC 等节点相关性函数构建动态邻接矩阵与特征,STFL 在图级任务上实现了优越的泛化性能,在 ISRUC_S3 睡眠阶段数据集上优于集中式基线模型。

ABSTRACT

We present a spatial-temporal federated learning framework for graph neural networks, namely STFL. The framework explores the underlying correlation of the input spatial-temporal data and transform it to both node features and adjacency matrix. The federated learning setting in the framework ensures data privacy while achieving a good model generalization. Experiments results on the sleep stage dataset, ISRUC_S3, illustrate the effectiveness of STFL on graph prediction tasks.

研究动机与目标

  • 为解决在缺乏预定义图结构的情况下对原始时空数据训练 GNN 所面临的挑战,尤其是在数据隐私约束下。
  • 开发一个端到端框架,通过空间相关性和时间特征提取,自动从时间序列数据生成图表示。
  • 将此图生成过程整合到联邦学习设置中,以在保护数据隐私的同时提升分布式客户端的模型泛化能力。
  • 在真实世界的图级预测任务中评估该框架的有效性,特别是在睡眠阶段分类等医疗应用中。
  • 比较不同节点相关性函数(PLV、PCC、DB、K-NN)在联邦学习环境下构建邻接矩阵时对 GNN 性能的影响。

提出的方法

  • 一个图生成组件使用卷积神经网络进行特征提取,结合相关性函数进行边构建,将原始时空序列转换为节点特征和邻接矩阵。
  • 该框架采用多种节点相关性函数——皮尔逊相关系数(PCC)、相位锁定值(PLV)、基于距离的(DB)以及 K-最近邻(K-NN)——从时间序列数据动态定义图拓扑结构。
  • 设计了一个端到端的联邦学习流程,客户端在其生成的图上训练本地 GNN 模型,并通过 FedAvg 将模型更新发送至中央服务器进行聚合。
  • 该框架支持图级分类任务,模型训练与评估在非独立同分布(non-IID)数据分布下进行,以模拟真实世界的联邦学习环境。
  • 图生成器与三种 GNN 架构——GCN、GAT 和 GraphSage——集成,支持在联邦学习下对模型性能进行对比分析。
  • 联邦训练与集中式训练设置中的超参数保持一致,以确保对泛化性能比较的公平性。

实验结果

研究问题

  • RQ1在联邦学习环境下,不同节点相关性函数(PLV、PCC、DB、K-NN)在构建时空 GNN 邻接矩阵方面的有效性如何?
  • RQ2在非独立同分布数据设置下,特别是在数据具有隐私敏感性时,STFL 是否能实现优于集中式训练的模型泛化?
  • RQ3在 STFL 框架下,对于时空数据的图级分类任务,哪种 GNN 架构(GCN、GAT、GraphSage)表现最佳?
  • RQ4当使用相同大小的训练数据和相同超参数时,联邦模型的性能与集中式模型相比如何?
  • RQ5相关性函数的选择是否显著影响联邦 GNN 训练中的收敛速度和最终模型准确率?

主要发现

  • 相位锁定值(PLV)相关性函数在所有联邦 GNN 模型上均持续优于 PCC、DB 和 K-NN,在 ISRUC_S3 数据集上实现了最高的平均 F1 分数。
  • 采用 PLV 的 Fed-GraphSage 在联邦模型中取得了最高的 F1 分数(0.848)和准确率(0.857),在某些情况下甚至优于集中式基线模型。
  • 所有联邦模型在相同大小的本地数据上训练时,泛化性能均优于其集中式对应模型,表明 STFL 在处理非独立同分布数据分布方面取得了成功。
  • GraphSage 在 REM 睡眠阶段类别上表现出最稳定的训练动态和最高的 F1 分数(0.831),而 GCN 在其他类别上表现最佳(F1 > 0.90)。
  • 所有模型的训练损失在最后几个周期出现显著波动,可能是因为客户端在后期训练阶段难以将其本地数据拟合到全局模型。
  • 该框架成功将原始睡眠 EEG 数据转换为图结构输入,实现了有效的 GNN 训练,同时通过联邦学习保护了数据隐私。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。