[论文解读] Programmable Neural Network Trojan for Pre-Trained Feature Extractor
本文提出一种可编程的神经网络后门,能够基于任意目标图像动态生成触发器,从而在迁移学习中使用的预训练模型上实现隐蔽且高成功率的后门攻击。该后门在微调后仍保持有效,顶级5名预测的攻击成功率高达75.87%,迁移学习场景下的攻击成功率达38.15%,同时可规避统计分析和模型重训练的检测。
Neural network (NN) trojaning attack is an emerging and important attack model that can broadly damage the system deployed with NN models. Existing studies have explored the outsourced training attack scenario and transfer learning attack scenario in some small datasets for specific domains, with limited numbers of fixed target classes. In this paper, we propose a more powerful trojaning attack method for both outsourced training attack and transfer learning attack, which outperforms existing studies in the capability, generality, and stealthiness. First, The attack is programmable that the malicious misclassification target is not fixed and can be generated on demand even after the victim's deployment. Second, our trojan attack is not limited in a small domain; one trojaned model on a large-scale dataset can affect applications of different domains that reuse its general features. Thirdly, our trojan design is hard to be detected or eliminated even if the victims fine-tune the whole model.
研究动机与目标
- 解决后门预训练神经网络在真实部署场景中带来的关键安全威胁。
- 克服以往后门攻击受限于固定小规模目标类别或特定领域的局限性。
- 开发一种在受害者对模型进行微调后仍能保持隐蔽且持久的后门机制。
- 实现在部署后对任意期望类别标签的按需、可编程目标生成。
- 在如ImageNet预训练网络等大规模通用模型的通用迁移学习设置中,证明后门攻击的可行性和有效性。
提出的方法
- 训练一个生成器神经网络,从目标图像合成触发器模式,实现动态灵活的触发器创建。
- 在端到端训练流程中将生成器与预训练的特征提取器(如VGG16、ResNet)集成,将后门嵌入卷积层。
- 通过联合优化过程同时训练生成器与特征提取器,使得带有生成触发器的输入被错误分类为目标类别。
- 通过在训练期间随机化触发器的空间位置,增强其鲁棒性,提升对输入变化的泛化能力。
- 利用大规模预训练模型中的冗余性,在不降低干净准确率的前提下嵌入后门。
- 通过应用标准防御机制(如微调和超参数调优)评估后门的鲁棒性,模拟真实世界中的缓解尝试。
实验结果
研究问题
- RQ1是否能在部署时为任意目标类别动态生成后门,即使受害者模型的类别集合未知?
- RQ2受害者在其数据集上进行微调后,后门在多大程度上仍保持有效且不被检测?
- RQ3与现有方法相比,所提出的可编程后门在隐蔽性方面表现如何,特别是在统计检测方法下?
- RQ4后门是否可嵌入通用特征提取器(如ImageNet模型)中,并在多种下游任务中正常运行?
- RQ5在应用标准防御策略(如微调)时,模型准确率与后门持久性之间的权衡如何?
主要发现
- 在外部训练场景中,该后门在VGG16上的顶级1名攻击成功率达50.27%,顶级5名攻击成功率达75.87%,接近模型的自然准确率。
- 在花卉分类数据集的迁移学习设置中,后门模型在干净输入上的准确率为91.56%(对比干净模型的91.70%),攻击成功率达38.15%。
- 统计检测方法无法识别该后门,因为权重和激活分布与原始模型无明显差异。
- 即使在学习率为$10^{-3}$的端到端微调后,后门仍保持17%至29%的攻击成功率,从受害者视角看仍具有效性。
- 当使用更大学习率时,后门被消除,但模型准确率显著下降,表明防御与性能之间存在权衡。
- 后门在多种超参数设置下均保持鲁棒,表明通过超参数调优进行防御并不可靠。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。