Skip to main content
QUICK REVIEW

[论文解读] Check Your Other Door! Creating Backdoor Attacks in the Frequency Domain

Hasan Abed Al Kader Hammoud, Bernard Ghanem|arXiv (Cornell University)|Sep 12, 2021
Adversarial Robustness in Machine Learning被引用 7
一句话总结

本文提出了一种新颖的频域后门攻击方法,利用傅里叶热图识别深度神经网络中最敏感的频率分量,从而实现高效、隐蔽且鲁棒的后门攻击,且中毒率极低。该方法在保持高干净数据准确率的同时,实现了最先进的攻击成功率(高达99.97%),并能有效规避多种最先进的防御机制。

ABSTRACT

Deep Neural Networks (DNNs) are ubiquitous and span a variety of applications ranging from image classification to real-time object detection. As DNN models become more sophisticated, the computational cost of training these models becomes a burden. For this reason, outsourcing the training process has been the go-to option for many DNN users. Unfortunately, this comes at the cost of vulnerability to backdoor attacks. These attacks aim to establish hidden backdoors in the DNN so that it performs well on clean samples, but outputs a particular target label when a trigger is applied to the input. Existing backdoor attacks either generate triggers in the spatial domain or naively poison frequencies in the Fourier domain. In this work, we propose a pipeline based on Fourier heatmaps to generate a spatially dynamic and invisible backdoor attack in the frequency domain. The proposed attack is extensively evaluated on various datasets and network architectures. Unlike most existing backdoor attacks, the proposed attack can achieve high attack success rates with low poisoning rates and little to no drop in performance while remaining imperceptible to the human eye. Moreover, we show that the models poisoned by our attack are resistant to various state-of-the-art (SOTA) defenses, so we contribute two possible defenses that can evade the attack.

研究动机与目标

  • 为应对外包DNN训练面临后门攻击的漏洞,开发一种更具隐蔽性和有效性的方法。
  • 克服空间域后门攻击的局限性,后者常因静态、可见的触发器而易被检测。
  • 设计一种针对最敏感频率分量的频域攻击,以增强隐蔽性并提高对防御机制的鲁棒性。
  • 评估该攻击对最先进的后门防御机制的鲁棒性,并展示其规避能力。
  • 提出两种新型防御方法,以检测并缓解所提出的频域后门攻击。

提出的方法

  • 该方法基于梯度敏感性分析,构建傅里叶热图以识别预训练模型中最敏感的频率分量。
  • 选取最敏感的前-k个频率分量,并通过修改训练数据中的这些分量,嵌入空间动态、不可见的触发器。
  • 通过在选定的频率带中随机化相位或振幅,为每张图像使用不同的触发器模式,从而增强隐蔽性。
  • 中毒过程在数据预处理阶段完成:将干净图像转换至频域,加入触发器,再转换回空间域。
  • 该方法在多个架构(ResNet、DenseNet、VGG)和数据集(CIFAR-10、ImageNet)上进行评估,使用PSNR、LPIPS、CDA和ASR等指标。
  • 提出两种防御方法:JPEG压缩和基于自编码器的重建,旨在通过移除或扭曲中毒分量来破坏频域触发器。

实验结果

研究问题

  • RQ1频域后门攻击能否在保持高干净数据准确率和低中毒率的同时,实现高攻击成功率?
  • RQ2与现有空间域后门攻击相比,所提出的频域攻击在隐蔽性和鲁棒性方面表现如何?
  • RQ3为何残差网络比非残差网络(如VGG19)更容易受到后门攻击?
  • RQ4所提出的攻击能否规避最先进的后门检测防御机制,如频谱特征和激活聚类?
  • RQ5哪些防御措施对频域后门攻击有效,其性能表现如何比较?

主要发现

  • 在VGG19上,该攻击在仅10%中毒率下实现了99.97%的攻击成功率,优于所有空间域攻击在ASR以及PSNR/LPIPS指标上的表现。
  • 在ResNet18上,当中毒率为0.4%时,干净数据准确率仍保持在94.38%,攻击成功率高达99.44%,展现出极高的效率与隐蔽性。
  • 该攻击可有效规避多种最先进的防御机制:Spectral Signatures仅在33%的情况下检测到后门(ResNet50),而激活聚类因各类别间轮廓分数相似而无法检测后门。
  • 该攻击对JPEG压缩和基于自编码器的防御具有高度鲁棒性,当使用自编码器时,攻击成功率仅下降至83.15%和0.00%,分别。
  • 残差网络(如ResNet、DenseNet)因跳跃连接可保留中毒信息而更易受攻击,而非残差网络如VGG19则需更高的中毒率才能达到类似成功率。
  • 所提出的防御方法——JPEG压缩和自编码器——能有效破坏攻击,分别将ASR降低至0.00%和71.43%,表明频域防御可有效应对此类攻击。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。