Skip to main content
QUICK REVIEW

[论文解读] FreeEagle: Detecting Complex Neural Trojans in Data-Free Cases

Chong Fu, Xuhong Zhang|arXiv (Cornell University)|Feb 28, 2023
Adversarial Robustness in Machine Learning被引用 5
一句话总结

FreeEagle 是一种新颖的无数据后门检测方法,通过分析 DNN 的分类器头,在无需干净样本或污染样本的情况下,识别复杂的神经后门——包括特定类别和逃避触发器攻击。它通过优化生成虚拟中间表征,检测类别后验中的异常,相较于 SOTA 方法 DF-TND,在多种数据集和模型架构上表现更优。

ABSTRACT

Trojan attack on deep neural networks, also known as backdoor attack, is a typical threat to artificial intelligence. A trojaned neural network behaves normally with clean inputs. However, if the input contains a particular trigger, the trojaned model will have attacker-chosen abnormal behavior. Although many backdoor detection methods exist, most of them assume that the defender has access to a set of clean validation samples or samples with the trigger, which may not hold in some crucial real-world cases, e.g., the case where the defender is the maintainer of model-sharing platforms. Thus, in this paper, we propose FreeEagle, the first data-free backdoor detection method that can effectively detect complex backdoor attacks on deep neural networks, without relying on the access to any clean samples or samples with the trigger. The evaluation results on diverse datasets and model architectures show that FreeEagle is effective against various complex backdoor attacks, even outperforming some state-of-the-art non-data-free backdoor detection methods.

研究动机与目标

  • 解决在模型共享平台中检测后门的迫切需求,这些平台无法获取干净的验证数据或触发器样本。
  • 克服现有无数据检测器(如 DF-TND)在面对特定类别和语义级触发器时的局限性。
  • 实现在无需依赖外部数据的前提下,高效检测复杂后门,包括类别无关和类别特定的后门。
  • 确保对多种触发器类型(包括细微和语义上有意义的触发器)的鲁棒性,这些触发器可逃避传统检测方法。
  • 提供一种可扩展的解决方案,适用于人工智能模型市场和共享平台中的实际部署。

提出的方法

  • FreeEagle 将 DNN 分解为特征提取器和分类器头,将分析重点集中于后者,以检测高层表征中的后门行为。
  • 通过基于梯度的优化,为每个类别生成虚拟中间表征,从而无需真实干净或污染数据。
  • 使用分位数基度量在分类器输出后验中执行异常检测,识别出指示后门的异常行为。
  • 检查所有可能的源类别-目标类别对,以检测类别特定后门,显著提升检测覆盖率。
  • 通过分析分类器的决策过程,FreeEagle 对触发器形式的变化(包括复杂和语义触发器)具有鲁棒性。
  • 由于聚焦于最后几层,该方法计算效率高,可在无数据环境下快速扫描所有类别对。

实验结果

研究问题

  • RQ1在无法访问任何干净样本或嵌入触发器样本的情况下,后门检测方法能否有效检测类别特定后门?
  • RQ2无数据检测器在面对可逃避传统输入空间分析的复杂语义级触发器时,性能如何?
  • RQ3仅基于分类器头行为的方法能否在真实世界部署场景中以高精度和低误报率检测后门?
  • RQ4FreeEagle 在检测准确率和鲁棒性方面与 SOTA 非无数据检测器相比表现如何?
  • RQ5FreeEagle 能否抵抗自适应后门攻击,即攻击者通过修改触发器模式或模型行为来规避检测?

主要发现

  • FreeEagle 在 GTSRB 和 CIFAR-10 等多样化数据集上,对类别无关和类别特定后门均实现了优越的检测性能。
  • 在所有评估基准上,其性能优于最先进的无数据检测器 DF-TND,尤其在检测类别特定和复杂触发器攻击方面表现更优。
  • 即使在修改触发器模式的自适应后门攻击下,FreeEagle 仍保持高真正例率(TPR),且误报率(FPR)低于 0.05。
  • 该方法在 GoogLeNet 和 VGG-16 等不同模型架构上均表现出强泛化能力,证实其鲁棒性。
  • 实验表明,即使禁用数据增强,FreeEagle 依然有效,尽管此时性能略有下降。
  • 该方法依赖于分类器头分析,使其对触发器形式变化(包括语义和补丁式触发器)具有强韧性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。