[论文解读] Explainability-based Backdoor Attacks Against Graph Neural Networks
本文提出了一种基于可解释性的图神经网络(GNN)后门攻击方法,通过利用 GNNExplainer 和 GraphLIME 识别最优触发注入位置——在图分类任务中为子图,在节点分类任务中为重要性最低的节点特征。该方法在干净准确率下降不足 2.5% 的情况下实现了超过 84% 的攻击成功率,实现了隐蔽性高、性能强的攻击,能够有效规避检测。
Backdoor attacks represent a serious threat to neural network models. A backdoored model will misclassify the trigger-embedded inputs into an attacker-chosen target label while performing normally on other benign inputs. There are already numerous works on backdoor attacks on neural networks, but only a few works consider graph neural networks (GNNs). As such, there is no intensive research on explaining the impact of trigger injecting position on the performance of backdoor attacks on GNNs. To bridge this gap, we conduct an experimental investigation on the performance of backdoor attacks on GNNs. We apply two powerful GNN explainability approaches to select the optimal trigger injecting position to achieve two attacker objectives -- high attack success rate and low clean accuracy drop. Our empirical results on benchmark datasets and state-of-the-art neural network models demonstrate the proposed method's effectiveness in selecting trigger injecting position for backdoor attacks on GNNs. For instance, on the node classification task, the backdoor attack with trigger injecting position selected by GraphLIME reaches over $84 \%$ attack success rate with less than $2.5 \%$ accuracy drop
研究动机与目标
- 研究触发注入位置对 GNN 后门攻击性能的影响,特别是攻击成功率和干净准确率下降方面的影响。
- 开发一种实用且高效的基于 GNN 可解释性技术选择最优触发注入位置的方法。
- 通过针对重要性最低的图结构或特征实现更隐蔽的后门攻击,降低被检测的可能性。
- 弥合现有研究中关于 GNN 后门攻击可解释性触发位置的空白,特别是在节点分类和图分类任务中的应用。
- 证明利用 GNNExplainer 和 GraphLIME 等可解释性工具实现高性能后门攻击的可行性和有效性。
提出的方法
- 利用 GNNExplainer 识别图分类任务中对模型影响最大的子图,作为触发注入的目标区域。
- 应用 GraphLIME 计算节点的局部特征重要性得分,从而在节点分类任务中选择重要性最低的特征用于触发注入。
- 通过将选定的子图或节点特征修改为固定值来注入触发,同时保持模型在良性输入上的功能完整性。
- 采用三管齐下的攻击策略:随机选择(RSA)、最重要特征(MIA)和最不重要特征(LIA),用于基于特征的触发注入。
- 在多种 GNN 架构(如 GIN、GraphSAGE、GAT)和基准数据集(Cora、CiteSeer、Mutagenicity、Facebook)上评估攻击性能。
- 利用可解释性方法指导触发位置的选择,确保高攻击成功率的同时最小化干净准确率的下降。
实验结果
研究问题
- RQ1触发注入位置的选择如何影响 GNN 后门攻击中的攻击成功率和干净准确率下降?
- RQ2GNN 可解释性方法(如 GNNExplainer 和 GraphLIME)能否有效用于识别最优触发注入位置?
- RQ3针对重要性最低的图结构或特征是否能提升 GNN 后门攻击的隐蔽性?
- RQ4基于可解释性的后门攻击在不同 GNN 模型和数据集上的性能表现如何?
- RQ5基于可解释性的触发位置选择能否在最小化对干净模型准确率影响的前提下实现高攻击成功率?
主要发现
- 在节点分类任务中,选择最不重要特征的攻击(LIA)在 Cora 和 CiteSeer 数据集上实现了超过 84% 的攻击成功率,且干净准确率下降不足 2.5%。
- 在 Cora 数据集上,LIA 实现了 84.22% 的攻击成功率和 1.95% 的干净准确率下降,而 MIA 分别为 84.11% 和 0.66%,表明针对最不重要特征进行攻击时性能下降极小。
- 在 Mutagenicity 数据集上,基于 GNNExplainer 的攻击使用最优子图注入触发,实现了 98.24% 的攻击成功率,仅导致 2.80% 的干净准确率下降。
- 使用 GraphLIME 选择最优触发位置的平均耗时仅为 0.06 秒/节点(Cora)和 0.09 秒/节点(CiteSeer),证明了其计算可行性。
- 采用最不重要特征(LIA)的攻击与随机选择(RSA)的攻击成功率相当,表明隐蔽性触发与随机触发同样有效。
- 结果证实,基于可解释性的触发位置选择能够实现高性能且低可检测性的后门攻击,尤其在针对影响较小的图组件时效果更佳。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。