Skip to main content
QUICK REVIEW

[论文解读] Backdoor Vulnerabilities in Normally Trained Deep Learning Models

Guanhong Tao, Zhenting Wang|arXiv (Cornell University)|Nov 29, 2022
Adversarial Robustness in Machine Learning被引用 6
一句话总结

该论文揭示了自然后门漏洞——即由恶意触发器引发误分类的漏洞——广泛存在于未经数据中毒的正常训练深度学习模型中。通过一种新颖的检测框架,作者在56个公开模型中识别出315个自然后门,表明现有扫描工具大多无法检测到此类漏洞,并提出了模型加固作为防御策略。

ABSTRACT

We conduct a systematic study of backdoor vulnerabilities in normally trained Deep Learning models. They are as dangerous as backdoors injected by data poisoning because both can be equally exploited. We leverage 20 different types of injected backdoor attacks in the literature as the guidance and study their correspondences in normally trained models, which we call natural backdoor vulnerabilities. We find that natural backdoors are widely existing, with most injected backdoor attacks having natural correspondences. We categorize these natural backdoors and propose a general detection framework. It finds 315 natural backdoors in the 56 normally trained models downloaded from the Internet, covering all the different categories, while existing scanners designed for injected backdoors can at most detect 65 backdoors. We also study the root causes and defense of natural backdoors.

研究动机与目标

  • 探究在未进行数据 poisoning 的情况下,后门漏洞是否可能存在于正常训练的深度学习模型中。
  • 基于触发器模式和模型行为,系统性地对自然后门漏洞进行分类。
  • 开发一种通用检测框架,能够识别多种模型架构和数据集中的自然后门。
  • 评估模型加固技术在缓解自然后门方面的作用。
  • 证明现有后门检测与防御方法对自然发生的漏洞无效。

提出的方法

  • 利用20种先前发表的注入后门攻击作为模板,指导在干净模型中搜索自然后门的对应关系。
  • 提出一种通用检测框架,采用触发器生成技术,如GenL0(用于基于补丁的触发器)和FeatureL2(用于动态/基于特征的触发器),以识别自然后门。
  • 在来自公共仓库的56个预训练模型上开展系统性实验,检测不同架构和数据集中的自然后门。
  • 通过使用检测框架生成的触发器对模型进行微调,评估模型加固效果,以Moth作为基础加固框架。
  • 根据触发器特征和模型行为,将自然后门分为四类,从而支持针对性的防御策略。
  • 采用ASR(对抗成功率)和干净准确率作为指标,评估检测与加固性能。

实验结果

研究问题

  • RQ1自然后门漏洞——由模型和数据的固有特征引发——是否存在于未经任何数据 poisoning 的正常训练深度学习模型中?
  • RQ2这些自然后门在不同预训练模型和数据集中有多普遍?
  • RQ3统一的检测框架是否能够识别多种触发器类型和模型架构中的自然后门?
  • RQ4现有的后门防御机制(如扫描、剪枝)对自然发生的后门是否仍然有效?
  • RQ5使用自然生成触发器进行模型加固,是否能有效降低不同后门类别中的漏洞水平?

主要发现

  • 自然后门漏洞广泛存在于正常训练的深度学习模型中,在56个公开模型中检测到315个此类漏洞。
  • 所提出的检测框架识别出315个自然后门,而专为注入后门设计的现有扫描工具最多仅能检测到65个。
  • 对于I类补丁后门,使用GenL0生成的触发器进行加固,使三种四分之三子类的漏洞水平降至27%以下,但复合后门例外。
  • 使用IV类触发器(通过FeatureL2生成)进行加固,能有效降低IV类后门的漏洞水平,但对I类后门影响有限,证实了需采用类别特异性防御策略。
  • 加固后模型准确率下降不足2%,表明基于触发器的微调防御在实际部署中具有可行性与实用性。
  • 本研究揭示,现有后门防御技术对自然后门基本无效,凸显了深度学习安全领域中一种新型、关键的威胁面。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。