Skip to main content
QUICK REVIEW

[论文解读] Subnet Replacement: Deployment-stage backdoor attack against deep neural networks in gray-box setting

Xiangyu Qi, Zhu Jifeng|arXiv (Cornell University)|Jul 15, 2021
Adversarial Robustness in Machine Learning参考文献 21被引用 9
一句话总结

本文提出子网替换攻击(SRA),一种灰盒部署阶段后门攻击,通过用恶意后门子网替换预训练深度神经网络中的窄小子网,在仅掌握架构知识、无需访问参数的情况下,实现超过95%的攻击成功率,且干净准确率下降不足1%。该攻击通过实验室环境中的真实内存篡改实现。

ABSTRACT

We study the realistic potential of conducting backdoor attack against deep neural networks (DNNs) during deployment stage. Specifically, our goal is to design a deployment-stage backdoor attack algorithm that is both threatening and realistically implementable. To this end, we propose Subnet Replacement Attack (SRA), which is capable of embedding backdoor into DNNs by directly modifying a limited number of model parameters. Considering the realistic practicability, we abandon the strong white-box assumption widely adopted in existing studies, instead, our algorithm works in a gray-box setting, where architecture information of the victim model is available but the adversaries do not have any knowledge of parameter values. The key philosophy underlying our approach is -- given any neural network instance (regardless of its specific parameter values) of a certain architecture, we can always embed a backdoor into that model instance, by replacing a very narrow subnet of a benign model (without backdoor) with a malicious backdoor subnet, which is designed to be sensitive (fire large activation value) to a particular backdoor trigger pattern.

研究动机与目标

  • 研究在现实、受限环境中,深度神经网络部署阶段后门攻击的可行性与威胁。
  • 设计一种在灰盒环境下运作的后门攻击,仅知晓模型架构,而不知晓参数值。
  • 开发一种方法,通过仅替换一小部分模型参数实现有效的后门注入,最大限度减少对干净准确率的影响。
  • 通过实验室环境中真实内存参数篡改,证明该方法的实际可行性。

提出的方法

  • 该方法生成一个通道数极少的窄小子网,对触发器敏感,仅在特定后门触发器出现时激活。
  • 将攻击替换目标DNN架构中预定义的小型子网,用预先训练好的恶意子网替代,同时保持原始模型结构不变。
  • 该方法基于灰盒假设:已知模型架构,但未知参数值,从而具备更广泛的实际应用潜力。
  • 实现了两种真实世界内存篡改技术:(1) 模型加载期间的库钩子技术,(2) 部署后的远程线程注入。
  • 后门子网被设计为仅在触发时产生高激活,确保隐蔽性与高攻击成功率。
  • 该方法在VGG16和VGGFace模型上使用标准数据集进行评估,涵盖软件仿真与物理世界触发测试。

实验结果

研究问题

  • RQ1是否可以在不访问模型参数的情况下,有效将后门注入DNN的部署阶段?
  • RQ2仅依靠架构知识,是否可以实现高攻击成功率且对干净准确率影响极小?
  • RQ3所提出的攻击是否可通过真实系统中的内存参数篡改实际实现?
  • RQ4当后门触发器在物理世界环境中应用时,该攻击的有效性如何?

主要发现

  • 在CIFAR-10图像分类任务中,SRA在10个随机初始化的VGG16模型上平均攻击成功率达96.01%,干净准确率仅下降0.31%。
  • 在VGGFace人脸识别任务中,攻击保持高度有效,即使触发器为物理打印并应用于测试图像,后门仍能成功激活。
  • 该方法成功在实验室服务器环境中,通过库钩子与远程线程注入两种技术,实现了真实内存参数篡改。
  • 在VGG16中,后门子网替换的参数量不足原始模型容量的0.05%,证实了结构修改极小。
  • 即使在测试集中对非目标类别样本应用触发器,攻击成功率仍保持在95%以上。
  • 该方法在使用不同随机种子训练的不同模型实例上均表现稳健,证实其对同架构模型具有通用适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。