Skip to main content
QUICK REVIEW

[论文解读] Regula Sub-rosa: Latent Backdoor Attacks on Deep Neural Networks

Yuanshun Yao, Huiying Li|arXiv (Cornell University)|May 24, 2019
Adversarial Robustness in Machine Learning参考文献 46被引用 7
一句话总结

本文提出了一种潜在后门攻击(latent backdoor attacks),这是一种新颖的方法,可在预训练的‘教师’模型(如 VGG16)中嵌入隐藏后门,这些后门在迁移学习过程中添加新目标类别(例如,Elon Musk)时才会被激活,且在正常评估中保持不可见。该攻击会传播至所有由该教师模型衍生的‘学生’模型,在真实世界的人脸识别、交通标志识别和虹膜识别任务中均实现了高成功率,仅有一种防御方法——多层微调——被证明有效,但代价是准确率下降。

ABSTRACT

Recent work has proposed the concept of backdoor attacks on deep neural networks (DNNs), where misbehaviors are hidden inside "normal" models, only to be triggered by very specific inputs. In practice, however, these attacks are difficult to perform and highly constrained by sharing of models through transfer learning. Adversaries have a small window during which they must compromise the student model before it is deployed. In this paper, we describe a significantly more powerful variant of the backdoor attack, latent backdoors, where hidden rules can be embedded in a single "Teacher" model, and automatically inherited by all "Student" models through the transfer learning process. We show that latent backdoors can be quite effective in a variety of application contexts, and validate its practicality through real-world attacks against traffic sign recognition, iris identification of lab volunteers, and facial recognition of public figures (politicians). Finally, we evaluate 4 potential defenses, and find that only one is effective in disrupting latent backdoors, but might incur a cost in classification accuracy as tradeoff.

研究动机与目标

  • 解决深度神经网络(DNNs)在安全关键应用中后门攻击日益增长的风险。
  • 识别迁移学习中的重大漏洞,即后门可被嵌入共享的教师模型中,并在微调过程中持续存在。
  • 证明传统后门检测方法因该攻击的隐蔽性和潜在性而失效。
  • 评估防御措施,识别哪些方法能有效破坏潜在后门,同时不损害模型实用性。

提出的方法

  • 使用精心设计的损失函数,在预训练教师模型(如 VGG16)的不存在输出类别(如 'Elon Musk')上嵌入潜在触发器,且不影响标准准确率。
  • 利用迁移学习流程:当学生模型被微调以识别目标类别(如 Musk)时,潜在触发器被激活,将匹配触发器模式的输入错误分类。
  • 使用对目标类别无关且人眼不可察觉的触发器模式,确保在教师模型评估期间保持隐蔽。
  • 利用触发器未与教师模型中任何现有类别绑定的事实,使其对基于输入的标准测试方法不可见。
  • 使用真实物理数据进行实际评估:真实交通标志照片、用智能手机拍摄的虹膜图像,以及从 Google 图像获取的公众人物图像。
  • 评估四种防御方法:输入异常检测、微调重训练、输入预处理和多层微调;识别出唯一有效的防御方法。

实验结果

研究问题

  • RQ1后门攻击能否以一种在检测中不可见且能通过迁移学习过程存活的方式嵌入共享教师模型?
  • RQ2潜在后门在真实世界应用(如人脸识别、交通标志检测和虹膜识别)中的有效性如何?
  • RQ3为何传统后门检测方法对潜在后门攻击无效?
  • RQ4哪些防御机制能有效破坏潜在后门,其在模型准确率方面存在何种权衡?

主要发现

  • 潜在后门攻击在使用公开可用的政治人物图像进行真实世界人脸识别任务中,成功率超过 90%。
  • 在使用真实标志的物理照片进行交通标志识别时,该攻击有效,证明了其在真实世界约束下的可行性。
  • 使用智能手机拍摄的图像进行虹膜识别攻击,成功率超过 85%,表明该方法在低质量输入数据上依然有效。
  • 仅在迁移学习过程中采用多层微调才能有效破坏潜在后门,但会导致干净输入上分类准确率明显下降。
  • 传统防御措施(如输入异常检测、重训练和输入预处理)因攻击的隐蔽性和潜在性而无法检测或破坏潜在后门。
  • 该攻击在教师模型中保持不可检测,因为触发器未与任何现有输出类别关联,使其对标准测试方法完全不可见。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。