[论文解读] Membership Inference Attack on Graph Neural Networks
本文通过仅使用模型输出的黑盒访问,提出了针对图神经网络(GNNs)的成员推理攻击,揭示了图中的结构信息——而不仅仅是过拟合——使GNNs极易遭受隐私泄露。本文提出了两种基于输出扰动和查询邻域采样的有效防御方法,可在不降低模型效用的前提下将攻击成功率降低高达60%。
Graph Neural Networks (GNNs), which generalize traditional deep neural networks on graph data, have achieved state-of-the-art performance on several graph analytical tasks. We focus on how trained GNN models could leak information about the \emph{member} nodes that they were trained on. We introduce two realistic settings for performing a membership inference (MI) attack on GNNs. While choosing the simplest possible attack model that utilizes the posteriors of the trained model (black-box access), we thoroughly analyze the properties of GNNs and the datasets which dictate the differences in their robustness towards MI attack. While in traditional machine learning models, overfitting is considered the main cause of such leakage, we show that in GNNs the additional structural information is the major contributing factor. We support our findings by extensive experiments on four representative GNN models. To prevent MI attacks on GNN, we propose two effective defenses that significantly decreases the attacker's inference by up to 60% without degradation to the target model's performance. Our code is available at https://github.com/iyempissy/rebMIGraph.
研究动机与目标
- 探究GNNs在具备泛化能力且未过拟合的情况下,是否仍会泄露训练节点的成员信息。
- 识别GNNs脆弱性的根本原因,超越过拟合,特别关注图结构的作用。
- 开发能够保持模型效用的实用防御机制,以应对成员推理攻击。
- 评估输出扰动和邻域查询扰动在降低攻击成功率方面的有效性。
- 在具有不同图属性的多样化数据集上,比较不同防御机制的性能。
提出的方法
- 引入两种现实的成员推理攻击设置:一种直接使用模型后验概率(VanPd),另一种使用邻域采样(NsD)以模拟现实世界中的查询约束。
- 训练一个黑盒攻击模型,利用目标GNN输出的置信度分数(类别后验概率)来区分训练节点与非训练节点。
- 通过输出扰动(VanPd)和查询邻域扰动(NsD)实现防御,其中邻居采样在推理过程中扭曲目标模型的输入。
- 提出LbP(基于标签的扰动)防御机制,作为一种基于分箱的策略,在保持隐私的同时减少噪声,尤其在低度图中效果显著。
- 使用攻击AUC、标签损失(ℒ)和置信度分数失真度(𝓒)等指标评估性能,并在五个基准数据集上进行对比。
- 实验在Cora、CiteSeer、PubMed、Flickr和Reddit上进行,涵盖多样化的图结构和节点度数。

实验结果
研究问题
- RQ1为何即使GNNs泛化良好且未过拟合,仍对成员推理攻击表现出脆弱性?
- RQ2图结构和节点度数如何影响GNNs上成员推理攻击的成功率?
- RQ3输出扰动和邻域查询扰动能否有效防御GNNs上的成员推理攻击?
- RQ4不同防御机制在隐私保护和模型效用保持方面如何比较?
- RQ5防御机制在降低攻击者推理能力的同时,对目标模型性能的退化程度如何?
主要发现
- GNNs中的结构编码是导致其易受成员推理攻击的主要因素,而不仅仅是过拟合。
- 即使经过充分正则化的GNNs,仍对成员推理攻击高度敏感,这是由于节点表示对图拓扑具有固有的敏感性。
- NsD防御机制通过采样查询邻域,将攻击成功率降低高达60%,且标签损失和置信度失真度极低,尤其在高阶图(如Reddit和Flickr)中效果显著。
- NsD在置信度分数失真度方面表现最优(Reddit上为0.05),相比VanPd(0.82失真)和LbP(0.60失真)更具隐蔽性且更有利于保持模型效用。
- 在低度图(如Cora和PubMed)中,NsD效果较弱,因邻域变化有限,但仍可在0.15标签损失下将攻击精确率降低12%。
- VanPd虽能有效降低攻击性能,但导致模型效用显著下降,置信度失真度较高(Reddit上为0.82),因此在实际部署中实用性较低。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。