Skip to main content
QUICK REVIEW

[论文解读] Detecting Backdoor Poisoning Attacks on Deep Neural Networks by Heatmap Clustering

Lukas Schulth, Christian Berghoff|arXiv (Cornell University)|Apr 27, 2022
Adversarial Robustness in Machine Learning被引用 4
一句话总结

本文提出了一种名为热力图聚类(Heatmap Clustering, HC)的新方法,通过将k-means聚类应用于通过层归因传播(Layer-wise Relevance Propagation, LRP)生成的热力图,以检测深度神经网络中的后门投毒攻击。HC在检测标准后门攻击和标签一致型后门攻击方面优于激活聚类(Activation Clustering, AC),尤其在触发器可见性降低的情况下表现更优,可在33%被污染数据下实现高达99.82%的准确率和100%的真正例率,且性能方差显著更低。

ABSTRACT

Predicitions made by neural networks can be fraudulently altered by so-called poisoning attacks. A special case are backdoor poisoning attacks. We study suitable detection methods and introduce a new method called Heatmap Clustering. There, we apply a $k$-means clustering algorithm on heatmaps produced by the state-of-the-art explainable AI method Layer-wise relevance propagation. The goal is to separate poisoned from un-poisoned data in the dataset. We compare this method with a similar method, called Activation Clustering, which also uses $k$-means clustering but applies it on the activation of certain hidden layers of the neural network as input. We test the performance of both approaches for standard backdoor poisoning attacks, label-consistent poisoning attacks and label-consistent poisoning attacks with reduced amplitude stickers. We show that Heatmap Clustering consistently performs better than Activation Clustering. However, when considering label-consistent poisoning attacks, the latter method also yields good detection performance.

研究动机与目标

  • 解决检测后门投毒攻击的挑战,特别是那些因标签一致而难以通过人工检查识别的变体。
  • 开发一种鲁棒的检测方法,能够在不依赖人类可感知的触发模式的前提下识别被污染的数据点。
  • 评估基于热力图的聚类与基于激活的聚类在检测各种后门攻击变体方面的有效性。
  • 证明标签一致型后门攻击——此前被认为不可检测——可借助可解释人工智能技术(如LRP)得以识别。

提出的方法

  • 对每个数据点应用层归因传播(LRP)以生成输入-激活热力图,可视化网络中特征的重要性。
  • 在LRP热力图上应用k-means聚类,基于其决策策略对数据点进行分组,使用Gromov-Wasserstein距离作为相似性度量。
  • 通过比较聚类结果识别出对应于被污染样本的离群点,假设被污染数据遵循独特的决策模式。
  • 实现一个基线方法——激活聚类(AC),该方法在中间层的激活值上应用k-means聚类,而非热力图。
  • 使用Gromov-Wasserstein距离度量热力图之间的结构相似性,从而实现对复杂、非欧几里得归因分布的比较。
  • 通过检测准确率(ACC)、真正例率(TPR)和真负例率(TNR)等指标,在多种攻击配置下评估检测性能。

实验结果

研究问题

  • RQ1通过LRP实现的热力图聚类是否能比激活聚类更有效地检测标准后门投毒攻击?
  • RQ2当通过降低振幅使触发器在视觉上不可见时,热力图聚类是否仍保持有效性?
  • RQ3标签一致型后门攻击——其中被污染样本被正确标注——是否仍能通过可解释人工智能方法检测?
  • RQ4在触发器位置和图像选择变化的情况下,热力图聚类与激活聚类的鲁棒性如何比较?
  • RQ5热力图聚类是否存在检测准确率与计算成本之间的权衡?

主要发现

  • 在标签一致型攻击中,热力图聚类(HC)在33%被污染数据下实现了99.82%的平均检测准确率和99.46%的真正例率,显著优于激活聚类(AC)。
  • 在触发器振幅降低(如32)的攻击中,HC保持了81.58%的检测准确率和58.46%的TPR,而AC下降至78.97%的准确率和74.26%的TPR。
  • HC在检测性能上表现出近乎零的方差(准确率标准差为0.19),而AC的标准差为6.81,表明其具有更高的鲁棒性。
  • 在33%被污染数据且触发器振幅降低的实验中,AC的攻击成功率(ASR)降至25.65%,而HC的ASR为81.58%,表明HC对细微触发器具有更强的鲁棒性。
  • 本研究反驳了‘标签一致型后门攻击不可检测’的说法,证明此类攻击可通过基于LRP的热力图分析被识别。
  • 由于Gromov-Wasserstein距离计算计算量大,HC的运行时间显著长于AC,提示混合检测流程可能是最优选择。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。