Skip to main content
QUICK REVIEW

[论文解读] IBD-PSC: Input-level Backdoor Detection via Parameter-oriented Scaling Consistency

Linshan Hou, Ruili Feng|arXiv (Cornell University)|May 16, 2024
Medical Imaging Techniques and ApplicationsMedicine被引用 3
一句话总结

本文提出 IBD-PSC,一种新颖的输入级后门检测方法,通过利用批量归一化层中的参数导向缩放一致性(PSC)来检测中毒输入。通过缩放 BN 参数并测量预测置信度的稳定性,IBD-PSC 以高精度和高效率识别恶意样本,尤其在极端像素值图像上优于先前方法(如 SCALE-UP),并在基准数据集上对自适应攻击表现出强抵抗能力。

ABSTRACT

Deep neural networks (DNNs) are vulnerable to backdoor attacks, where adversaries can maliciously trigger model misclassifications by implanting a hidden backdoor during model training. This paper proposes a simple yet effective input-level backdoor detection (dubbed IBD-PSC) as a `firewall' to filter out malicious testing images. Our method is motivated by an intriguing phenomenon, i.e., parameter-oriented scaling consistency (PSC), where the prediction confidences of poisoned samples are significantly more consistent than those of benign ones when amplifying model parameters. In particular, we provide theoretical analysis to safeguard the foundations of the PSC phenomenon. We also design an adaptive method to select BN layers to scale up for effective detection. Extensive experiments are conducted on benchmark datasets, verifying the effectiveness and efficiency of our IBD-PSC method and its resistance to adaptive attacks. Codes are available at \href{https://github.com/THUYimingLi/BackdoorBox}{BackdoorBox}.

研究动机与目标

  • 为解决现有输入级后门检测方法的局限性,特别是其在具有极端像素值(如黑白像素)的良性样本上失效的问题。
  • 通过模型参数缩放,识别一种独立于像素值限制的新颖、鲁棒的检测信号。
  • 开发一种实用、高效且有效的检测框架,适用于第三方模型部署中的实时推理。
  • 从理论上证明在中毒样本与良性样本中观察到的参数导向缩放一致性(PSC)现象的合理性。
  • 评估该方法对多样化后门攻击及自适应规避策略的鲁棒性。

提出的方法

  • 该方法通过缩放部署模型中批量归一化(BN)层的运行统计量来检测后门,从最后一层开始,逐步增加缩放的 BN 层数量。
  • 对于每个可疑输入,IBD-PSC 计算一个 PSC 分数,即在原始模型预测的标签上,对多个参数缩放后的模型版本的平均预测置信度。
  • 较高的 PSC 分数表示在不同缩放模型中预测的一致性更高,表明输入更可能是中毒的。
  • 自适应算法通过评估对良性样本性能的影响,选择最优的 BN 层缩放数量,确保检测灵敏度的同时不降低正常推理性能。
  • 该方法设计为内存高效,仅需保留原始模型的一个副本,并在推理过程中动态生成缩放后的模型。
  • 理论分析证明,在标准学习假设下,缩放 BN 参数始终能暴露潜在后门,确保 PSC 现象并非偶然。

实验结果

研究问题

  • RQ1在批量归一化层中进行参数缩放,能否揭示一种对像素值限制具有鲁棒性的中毒输入一致检测信号?
  • RQ2是否存在一个理论基础,可保证在任何被攻击模型中,都存在一个能暴露后门的缩放因子?
  • RQ3自适应层选择策略是否能提升检测性能,同时最小化计算开销?
  • RQ4IBD-PSC 在面对广泛范围的后门攻击(包括自适应和复杂攻击)时表现如何?
  • RQ5IBD-PSC 是否能有效应用于检测训练数据中的中毒样本,而不仅限于推理阶段?

主要发现

  • IBD-PSC 在多种攻击下对中毒训练样本的检测实现了 100% 真阳性率(TPR)和接近 100% 的 AUROC,错误阳性率(FPR)接近 0%。
  • 该方法在具有极端像素值(如黑白像素)的图像上显著优于 SCALE-UP,后者因放大过程中的像素饱和而失效。
  • IBD-PSC 在 13 种代表性后门攻击中均保持高检测性能,展现出对自适应规避技术的强大抵抗力。
  • 理论分析证实,在学习理论的标准假设下,总存在一个缩放因子可暴露任何被攻击模型中的后门。
  • 当应用于训练数据时,IBD-PSC 成功识别并过滤了中毒样本,使微调后模型的攻击成功率(ASR)在 CIFAR-10 上降低至 0.5% 以下。
  • 该方法在实时推理场景中有效,可作为第三方模型的轻量级防护墙,无需重训练或访问原始训练数据。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。