Skip to main content
QUICK REVIEW

[论文解读] Backdoor Attack with Sample-Specific Triggers.

Yuezun Li, Yiming Li|arXiv (Cornell University)|Dec 7, 2020
Adversarial Robustness in Machine Learning参考文献 56被引用 17
一句话总结

本文提出了一种新颖的后门攻击方法,利用基于DNN的编码器-解码器网络生成样本特定的、不可见的触发器,将攻击者定义的字符串嵌入良性图像中。该方法通过为每个样本生成唯一的触发器,即使在防御模型下也能实现极高的攻击成功率,从而规避现有防御机制的检测。

ABSTRACT

Recently, backdoor attacks pose a new security threat to the training process of deep neural networks (DNNs). Attackers intend to inject hidden backdoor into DNNs, such that the attacked model performs well on benign samples, whereas its prediction will be maliciously changed if the hidden backdoor is activated by an attacker-defined trigger. Existing backdoor attacks usually adopt the setting that the trigger is sample-agnostic, $i.e.,$ different poisoned samples contain the same trigger, resulting in that the attacks could be easily mitigated by current backdoor defenses. In this work, we explore a novel attack paradigm that the backdoor trigger is sample-specific. Specifically, inspired by the recent advance in DNN-based image steganography, we generate sample-specific invisible additive noises as backdoor triggers by encoding an attacker-specified string into benign images through an encoder-decoder network. The mapping from the string to the target label will be generated when DNNs are trained on the poisoned dataset. Extensive experiments on benchmark datasets verify the effectiveness of our method in attacking models with or without defenses.

研究动机与目标

  • 解决现有后门攻击中使用样本无关触发器所导致的漏洞,这些触发器容易被当前防御机制检测到。
  • 通过基于深度学习隐写术生成每样本唯一的不可见触发器,开发更具隐蔽性的后门攻击。
  • 评估样本特定触发器在绕过最先进后门防御机制方面的有效性。
  • 证明样本特定触发器在保持高攻击成功率的同时仍具有不可感知性。

提出的方法

  • 该方法使用训练好的编码器-解码器网络,将秘密字符串以不可见的加性噪声模式嵌入每张良性图像中。
  • 编码后的噪声作为样本特定的触发器,每个污染样本均不相同。
  • 触发器的生成方式使其对人类观察者不可见,并在常见图像变换下保持鲁棒性。
  • 在模型训练过程中,DNN学习将编码后的字符串(通过触发器)映射到预定义的目标标签。
  • 攻击框架将编码器-解码器集成到数据污染流程中,确保每样本触发器的一致性。
  • 该方法利用DNN图像隐写术的最新进展,确保触发器既不可见又具备鲁棒性。

实验结果

研究问题

  • RQ1通过深度隐写术生成的样本特定触发器能否规避现有后门检测防御机制?
  • RQ2当模型在带有每样本唯一触发器的污染数据上进行训练时,该攻击的成功率如何?
  • RQ3在标准和防御性训练设置下,该方法在基准数据集上的表现如何?
  • RQ4触发器对人类观察者有多不可感知,且对图像预处理的鲁棒性如何?

主要发现

  • 所提出的攻击在多个基准数据集上实现了接近完美的攻击成功率(接近100%),即使在使用防御技术训练模型的情况下亦如此。
  • 由于其唯一性和不可见性,样本特定触发器可逃避最先进后门检测方法的检测。
  • 该方法在良性样本上保持了高模型准确率,确保模型在推理过程中表现可信。
  • 视觉检查和感知相似性度量均证实,触发器对人类观察者不可见。
  • 该攻击在各种图像预处理和数据增强技术下仍保持有效性。
  • 该方法在不同DNN架构和数据集(包括CIFAR-10和Tiny ImageNet)上表现出良好的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。