Skip to main content
QUICK REVIEW

[论文解读] Defending Against Backdoor Attack on Graph Nerual Network by Explainability

Bingchen Jiang, Zhao Li|arXiv (Cornell University)|Sep 7, 2022
Adversarial Robustness in Machine Learning被引用 7
一句话总结

本文提出了首个基于可解释性的图神经网络(GNN)后门攻击防御方法。通过利用可解释性评分(ES)检测具有高影响力的子图(即触发器),识别并移除输入图中的恶意子结构,显著降低了多种数据集上的攻击成功率,同时保持了干净样本的高准确率。

ABSTRACT

Backdoor attack is a powerful attack algorithm to deep learning model. Recently, GNN's vulnerability to backdoor attack has been proved especially on graph classification task. In this paper, we propose the first backdoor detection and defense method on GNN. Most backdoor attack depends on injecting small but influential trigger to the clean sample. For graph data, current backdoor attack focus on manipulating the graph structure to inject the trigger. We find that there are apparent differences between benign samples and malicious samples in some explanatory evaluation metrics, such as fidelity and infidelity. After identifying the malicious sample, the explainability of the GNN model can help us capture the most significant subgraph which is probably the trigger in a trojan graph. We use various dataset and different attack settings to prove the effectiveness of our defense method. The attack success rate all turns out to decrease considerably.

研究动机与目标

  • 为解决GNN在图分类任务中缺乏后门检测与防御机制的问题。
  • 识别那些隐蔽且结构多样的后门触发器,以规避传统检测方法。
  • 开发一种对各种触发模式和图结构均具有鲁棒性的防御机制,且无需事先了解触发器信息。
  • 在有效中和后门攻击的同时,保持对干净样本的高模型准确率。

提出的方法

  • 引入可解释性评分(ES)以量化子图对GNN预测的影响,从而区分良性与恶意子图。
  • 使用基于梯度的解释方法识别每个输入图中最具影响力的子图(潜在触发器)。
  • 应用自适应稀疏化控制,移除高ES子图中的边,从而破坏触发器结构。
  • 在验证集中设定最大ES值的阈值,以分类新输入样本为干净或恶意。
  • 利用可解释性中的保真度与非保真度度量,检测由后门触发器引起的结构异常。
  • 通过有针对性的边移除,将被植入后门的样本转化为干净样本,从而实现防御。

实验结果

研究问题

  • RQ1可解释性度量(如保真度与非保真度)是否能有效区分良性与被植入后门的图样本?
  • RQ2一种单一的、与触发器无关的防御机制是否能检测并移除GNN中多样化的后门触发器?
  • RQ3通过自适应稀疏化移除高ES子图,是否能有效中和后门攻击而不降低干净样本的性能?
  • RQ4模型表达能力如何影响后门攻击的可检测性与成功率?
  • RQ5该方法在检测稀疏图中后门时存在哪些局限性?

主要发现

  • 在三种真实世界图数据集上,该方法在各种攻击设置下均实现了低误接受率(FAR)和低误拒绝率(FRR)。
  • 防御后攻击成功率(ASR)显著下降,尤其在模型表达能力较低时更为明显,表明后门学习对模型容量敏感。
  • 当模型参数较小时(例如4611个参数),ASR上升缓慢且在达到高干净准确率后仍保持较低水平,表明早停策略可有效缓解攻击。
  • 当模型表达能力较高时(例如27973个参数),ASR迅速上升且与干净准确率强相关,表明触发器更容易被学习。
  • 该方法在稀疏图上表现较差,因为边移除更具破坏性,且触发器更难分离,如未检测到的恶意样本分布所示。
  • 较大的触发器会加速ASR的增长但降低隐蔽性,表明攻击者面临权衡,这一发现或可为未来防御策略提供参考。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。