Skip to main content
QUICK REVIEW

[论文解读] BaDExpert: Extracting Backdoor Functionality for Accurate Backdoor Input Detection

Tinghao Xie, Xiangyu Qi|arXiv (Cornell University)|Aug 23, 2023
Adversarial Robustness in Machine Learning被引用 4
一句话总结

BaDExpert 提出了一种后开发阶段的防御方法,通过在少量被错误标记的干净样本上微调,将后门功能提取到一个专用的后门专家模型中。该专家模型通过与原始模型的预测不一致来检测后门输入,在 CIFAR10、GTSRB 和 ImageNet 上实现了高达 99.8% 的 AUROC,并以极小的干净准确率损失缓解了 17 种最先进后门攻击。

ABSTRACT

We present a novel defense, against backdoor attacks on Deep Neural Networks (DNNs), wherein adversaries covertly implant malicious behaviors (backdoors) into DNNs. Our defense falls within the category of post-development defenses that operate independently of how the model was generated. The proposed defense is built upon a novel reverse engineering approach that can directly extract backdoor functionality of a given backdoored model to a backdoor expert model. The approach is straightforward -- finetuning the backdoored model over a small set of intentionally mislabeled clean samples, such that it unlearns the normal functionality while still preserving the backdoor functionality, and thus resulting in a model (dubbed a backdoor expert model) that can only recognize backdoor inputs. Based on the extracted backdoor expert model, we show the feasibility of devising highly accurate backdoor input detectors that filter out the backdoor inputs during model inference. Further augmented by an ensemble strategy with a finetuned auxiliary model, our defense, BaDExpert (Backdoor Input Detection with Backdoor Expert), effectively mitigates 17 SOTA backdoor attacks while minimally impacting clean utility. The effectiveness of BaDExpert has been verified on multiple datasets (CIFAR10, GTSRB and ImageNet) across various model architectures (ResNet, VGG, MobileNetV2 and Vision Transformer).

研究动机与目标

  • 解决在无法访问训练数据或训练动态信息的情况下,检测后开发阶段深度神经网络中后门输入的挑战。
  • 开发一种对模型训练方式完全无感的防御机制,适用于包括数据投毒和权重篡改在内的各类攻击。
  • 直接提取后门功能,避免依赖于在全局变换或复杂触发器下会失效的触发模式重建。
  • 在保持模型正常功能的前提下,实现高精度的后门输入检测并最小化对干净模型性能的影响。
  • 在多种数据集、模型架构以及 17 种最先进后门攻击上验证方法的有效性。

提出的方法

  • 在少量被故意错误标记的干净数据集上微调被污染的模型,使其逐步丧失正常分类能力,同时保留后门功能。
  • 训练一个仅识别后门输入的后门专家模型,利用模型在此微调过程中失去干净准确率但保持攻击成功率的特性。
  • 在推理阶段通过检查后门专家模型与原始模型预测结果是否不一致,来检测后门输入。
  • 采用集成策略,将后门专家模型与微调后的辅助模型结合,以提升检测鲁棒性与 AUROC。
  • 将检测流程应用于多个数据集(CIFAR10、GTSRB、ImageNet)和多种模型架构(ResNet、VGG、MobileNetV2、Vision Transformer)。
  • 使用 AUROC 作为主要指标,评估不同攻击类型下的检测性能。

实验结果

研究问题

  • RQ1在无法访问训练数据或梯度信息的情况下,能否可靠地从被污染模型中提取后门功能?
  • RQ2在错误标记的干净样本上微调是否能有效隔离后门功能,同时抑制正常分类能力?
  • RQ3通过该方法构建的后门专家模型能否在推理阶段作为有效的后门输入检测器?
  • RQ4后门专家模型与辅助模型的集成策略在多种攻击类型下如何提升检测鲁棒性?
  • RQ5该防御方法在缓解最先进后门攻击的同时,对干净准确率的保持程度如何?

主要发现

  • 在 BadNet 攻击下,BaDExpert 在 CIFAR10 上实现了 99.8% 的 AUROC,显著优于现有检测器。
  • 该方法在 CIFAR10、GTSRB 和 ImageNet 上对 17 种最先进后门攻击均表现出色,且干净准确率损失极小(≤0.5%)。
  • 微调后,后门专家模型保持了高达 ≥95% 的攻击成功率,而干净准确率降至 1% 以下。
  • 集成策略显著提升了检测鲁棒性,大多数攻击下 AUROC 的标准差始终低于 1.0%。
  • 该方法在多种模型架构(包括 Vision Transformer)上均有效,且在基于全局变换的触发器下依然稳健,而此前方法在此类场景下会失效。
  • 标准差分析表明结果具有高度可复现性,主要实验中大多数攻击的 AUROC 标准差低于 1.0%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。