[论文解读] Adversarial Model Extraction on Graph Neural Networks
本文首次对图神经网络(GNNs)的对抗性模型提取进行了形式化研究,提出了一种基于学习的方法,通过迭代扰动子图查询黑箱受害者模型,以提取高保真度的GNN。尽管仅能访问图的一小部分(低至1.7%的节点),该方法在Cora和PubMed数据集上仍能实现高达80%的保真度,以复制受害者模型的预测结果。
Along with the advent of deep neural networks came various methods of exploitation, such as fooling the classifier or contaminating its training data. Another such attack is known as model extraction, where provided API access to some black box neural network, the adversary extracts the underlying model. This is done by querying the model in such a way that the underlying neural network provides enough information to the adversary to be reconstructed. While several works have achieved impressive results with neural network extraction in the propositional domain, this problem has not yet been considered over the relational domain, where data samples are no longer considered to be independent and identically distributed (iid). Graph Neural Networks (GNNs) are a popular deep learning framework to perform machine learning tasks over relational data. In this work, we formalize an instance of GNN extraction, present a solution with preliminary results, and discuss our assumptions and future directions.
研究动机与目标
- 对图结构化数据这一关系性、非独立同分布(non-iid)领域中的模型提取问题进行形式化定义。
- 开发一种仅通过API访问黑箱受害者GNN的基于学习的GNN模型提取方法。
- 在有限子图访问和对抗性扰动成本等现实约束下,评估GNN模型提取的可行性和保真度。
- 识别可扩展且隐蔽的GNN提取的关键假设、局限性以及未来研究方向。
提出的方法
- 该方法通过生成受害者图的扰动子图来构建代理GNN,其中每次扰动会改变节点特征或增删节点。
- 对每个扰动子图,查询受害者GNN以获取节点级别的预测结果,将其作为标签用于训练提取模型。
- 提取模型在由扰动子图组成的块对角矩阵上进行训练,每个子图代表一个不同类别,以确保类别覆盖。
- 该方法假设扰动足够保持结构和特征分布,从而能从受害者GNN中激发有信息量的预测。
- 使用GCN作为提取模型,其训练目标是匹配受害者模型的预测结果而非真实标签,以聚焦于功能等价性。
- 实验通过改变子图样本数量和子图大小,评估在不同查询约束下的保真度。
实验结果
研究问题
- RQ1在关系性、非独立同分布的设定下,对抗性模型提取能否有效应用于图神经网络?
- RQ2可访问子图的大小以及扰动样本数量如何影响提取GNN的保真度?
- RQ3在仅通过黑箱查询访问的条件下,基于学习的GNN提取的关键假设和局限性是什么?
- RQ4如何在真实图环境中使模型提取更具可扩展性且更难被检测?
- RQ5受害者GNN的解释性信息或梯度信息能否进一步提升提取保真度?
主要发现
- 所提方法在Cora和PubMed引文网络上复制受害者GNN预测结果的保真度最高可达80%,即使仅能访问极小部分子图。
- 在Cora数据集中,平均子图大小为45.9个节点(占总节点数的1.7%),在10个随机节点上实现了77%的平均保真度。
- 当每类使用100个样本时,Cora和PubMed的保真度分别达到83%。
- 较小的子图在样本数量增加时保真度显著提升,而较大的子图即使样本较少也能实现高保真度。
- 尽管在与测试分布不同的合成扰动图分布上进行训练,该方法仍保持有效,表明其对分布偏移具有鲁棒性。
- 当前方法受限于GCN的归纳性(transductive nature)以及对大量扰动的需求,提示未来需采用如GraphSAGE等归纳式GNN以实现更好的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。