[论文解读] TOP: Backdoor Detection in Neural Networks via Transferability of Perturbation
本文提出TOP(扰动可迁移性),一种新颖的后门检测方法,通过测量中毒模型中对抗扰动相较于干净模型的可迁移性提升来识别中毒神经网络。该方法无需访问训练数据或触发样本,仅需少量良性输入和对抗攻击即可实现高精度检测,在TrojAI基准测试中AUC > 0.85,且在极少量训练数据或非独立同分布(non-IID)设置下仍表现出稳健性能。
Deep neural networks (DNNs) are vulnerable to "backdoor" poisoning attacks, in which an adversary implants a secret trigger into an otherwise normally functioning model. Detection of backdoors in trained models without access to the training data or example triggers is an important open problem. In this paper, we identify an interesting property of these models: adversarial perturbations transfer from image to image more readily in poisoned models than in clean models. This holds for a variety of model and trigger types, including triggers that are not linearly separable from clean data. We use this feature to detect poisoned models in the TrojAI benchmark, as well as additional models.
研究动机与目标
- 为解决在无训练数据或触发样本访问条件下检测深度神经网络后门的开放性问题。
- 识别一种可靠的模型级属性,以在真实部署场景中可靠地区分中毒模型与干净模型。
- 开发一种在多种触发类型、模型架构及非独立同分布数据分布下均具鲁棒性的检测方法。
- 实现适用于生产环境的轻量化、实用化后门检测,以应对训练数据监控不可行的场景。
提出的方法
- 该方法基于观察:对抗扰动在中毒模型中比在干净模型中更容易在输入之间迁移。
- 通过在少量良性输入上使用无目标攻击(如PGD)生成对抗扰动,以探测模型对扰动的敏感性。
- 在小规模、类别平衡的模型子集(干净与中毒)上训练检测器,使用这些扰动可迁移性所提取的特征。
- 检测器使用分类器(如逻辑回归)对基于扰动可迁移性得分的特征进行训练,以区分干净与中毒模型。
- 该方法通过少量标注模型进行校准,并在未见过的测试模型上进行评估,包括不同轮次的TrojAI基准测试模型。
- 即使攻击域(如基于滤波器的攻击 vs. ℓ₁攻击)与实际触发类型不匹配,该方法仍表现出良好的泛化能力。
实验结果
研究问题
- RQ1在无训练数据或触发样本访问条件下,对抗扰动的可迁移性能否作为深度神经网络后门中毒的可靠指标?
- RQ2在不同触发类型和模型架构下,对抗扰动在中毒模型与干净模型之间的可迁移性有何差异?
- RQ3当在小规模、非独立同分布的模型子集上训练,而在未见过的多样化模型集合上测试时,TOP方法能否有效检测后门?
- RQ4当训练与测试数据分布发生偏移(如TrojAI基准不同轮次)时,TOP检测器的鲁棒性如何?
- RQ5该方法是否能泛化至不同类型的触发,包括非线性可分的触发(如Instagram风格滤镜)?
主要发现
- 在TrojAI基准测试Round 3(多边形触发)中,TOP实现了0.90的AUC,表现出强劲的检测性能。
- 即使仅使用单个正样本和负样本,检测器AUC仍高于0.80,表明在极小训练数据下仍具有效性。
- 在非独立同分布的跨轮次检测中,AUC保持在约0.75,表明对分布偏移具有鲁棒性。
- 在CIFAR-10模型上,TOP检测器使用仅基于滤波器的攻击时AUC达0.92,使用ℓ₁与滤波器攻击组合时AUC为0.84。
- 检测器在不同触发类型间泛化良好:基于滤波器的攻击对多边形触发的检测AUC > 0.75;ℓ₁攻击即使与触发类型不匹配,仍能提供可检测信号。
- 跨轮次性能保持稳定,AUC在0.68至0.88之间波动,证实该方法在实际、真实场景中的抗干扰能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。