Skip to main content
QUICK REVIEW

[论文解读] Towards Representation Identical Privacy-Preserving Graph Neural Network via Split Learning

Chuanqiang Shan, Huiyun Jiao|arXiv (Cornell University)|Jul 13, 2021
Privacy-Preserving Technologies in Data参考文献 30被引用 8
一句话总结

本文提出SAPGNN,一种基于分割学习的隐私保护图神经网络框架,可在不共享原始数据的前提下实现水平划分图数据上的节点分类。通过将GNN层在本地客户端与半诚实服务器之间拆分,并采用安全池化机制,SAPGNN实现了与集中式训练完全相同的节点嵌入,性能匹配或超越当前最先进水平,尤其在接近独立同分布(I.I.D.)的标签分布下表现更优。

ABSTRACT

In recent years, the fast rise in number of studies on graph neural network (GNN) has put it from the theories research to reality application stage. Despite the encouraging performance achieved by GNN, less attention has been paid to the privacy-preserving training and inference over distributed graph data in the related literature. Due to the particularity of graph structure, it is challenging to extend the existing private learning framework to GNN. Motivated by the idea of split learning, we propose a extbf{S}erver extbf{A}ided extbf{P}rivacy-preserving extbf{GNN} (SAPGNN) for the node level task on horizontally partitioned cross-silo scenario. It offers a natural extension of centralized GNN to isolated graph with max/min pooling aggregation, while guaranteeing that all the private data involved in computation still stays at local data holders. To further enhancing the data privacy, a secure pooling aggregation mechanism is proposed. Theoretical and experimental results show that the proposed model achieves the same accuracy as the one learned over the combined data.

研究动机与目标

  • 解决去中心化环境下针对水平划分图数据缺乏隐私保护GNN框架的问题。
  • 实现协作式GNN训练,确保私有节点和边数据保留在本地客户端,避免数据共享。
  • 确保最终的节点表示与从集中式图中学习到的结果完全一致,保持模型保真度。
  • 通过安全池化聚合机制,保护本地嵌入免受半诚实服务器的威胁,提升隐私保护能力。
  • 评估在不同标签分布偏移情况下的性能表现,特别是非独立同分布(non-I.I.D.)场景。

提出的方法

  • 将每个GNN层拆分为本地模型(部署在数据持有方)和全局模型(部署在半诚实服务器)以保护数据隐私。
  • 使用最大/最小池化聚合方法,实现在不暴露单个本地嵌入的情况下计算全局嵌入。
  • 设计一种安全池化机制,隐藏原始本地嵌入以防止服务器推断,增强对半诚实攻击者的抵抗力。
  • 通过在数据持有方之间保留重叠的节点和边,实现子图之间的消息传递。
  • 仅使用加密或聚合后的表示训练全局模型,不直接使用原始特征或标签。
  • 通过在各层对齐聚合与更新函数,确保最终节点表示与集中式GNN训练结果一致。

实验结果

研究问题

  • RQ1能否为水平划分的图数据设计一种隐私保护的GNN框架,使其学习到的节点表示与集中式GNN完全一致?
  • RQ2如何将分割学习适配于图神经网络,在保障数据隐私的同时维持模型准确性?
  • RQ3标签分布偏移(I.I.D. 与非I.I.D.)对去中心化GNN训练性能有何影响?
  • RQ4安全池化机制能否在半诚实威胁模型下防止服务器推断出敏感的本地嵌入?
  • RQ5在不同数据划分与标签分布设置下,SAPGNN与现有方法(如PPGNN和SP)相比,在准确率与鲁棒性方面表现如何?

主要发现

  • SAPGNN实现了与集中式图训练完全相同的节点嵌入,确保了模型保真度。
  • 在Cora和Citeseer数据集上,SAPGNN的性能与PPGNN相当或更优,尤其在接近I.I.D.的标签分布下(q ≥ 25%)表现更佳。
  • 当标签分布高度偏移(q = 0%)时,PPGNN优于SAPGNN,表明SAPGNN的优势在标签分布均衡时最为显著。
  • SAPGNN始终优于SP基线模型,且随着数据持有方数量的增加,性能差距进一步扩大。
  • 安全池化机制有效保护了本地嵌入免受半诚实服务器的窥探,提升了隐私保护水平,且未牺牲模型准确性。
  • 移除类间边对Citeseer的影响显著大于Cora或Pubmed,表明不同数据集对结构碎片化的敏感性存在差异。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。