[论文解读] Detection based Defense against Adversarial Examples from the Steganalysis Point of View
该论文提出了一种受隐写分析启发的防御方法,通过修改概率估计(MPM)增强隐写分析特征,检测对抗性样本,对 ImageNet 上的强攻击(如 C&W)实现了高达 93.41% 的准确率,且由于其非神经网络设计,能够有效抵抗二次对抗攻击。
Deep Neural Networks (DNNs) have recently led to significant improvements in many fields. However, DNNs are vulnerable to adversarial examples which are samples with imperceptible perturbations while dramatically misleading the DNNs. Moreover, adversarial examples can be used to perform an attack on various kinds of DNN based systems, even if the adversary has no access to the underlying model. Many defense methods have been proposed, such as obfuscating gradients of the networks or detecting adversarial examples. However it is proved out that these defense methods are not effective or cannot resist secondary adversarial attacks. In this paper, we point out that steganalysis can be applied to adversarial examples detection, and propose a method to enhance steganalysis features by estimating the probability of modifications caused by adversarial attacks. Experimental results show that the proposed method can accurately detect adversarial examples. Moreover, secondary adversarial attacks cannot be directly performed to our method because our method is not based on a neural network but based on high-dimensional artificial features and FLD (Fisher Linear Discriminant) ensemble.
研究动机与目标
- 解决深度神经网络对肉眼不可见但会误导模型的对抗性样本的脆弱性问题。
- 克服现有防御方法的局限性,特别是其在使用神经网络进行检测时对二次对抗攻击的敏感性。
- 探索将隐写分析作为检测对抗性样本的新范式,灵感来源于对抗性扰动类似于隐写术中隐藏数据的特性。
- 开发一种特征增强方法(MPM),以提升在多种对抗性攻击类型下基于隐写分析的检测性能。
- 设计一种检测系统,通过在检测流程中避免使用神经网络架构,从而对二次攻击具备鲁棒性。
提出的方法
- 该方法将隐写分析原理应用于检测对抗性样本,通过将扰动建模为图像中的隐藏修改来实现。
- 提出一种修改概率估计(MPM)技术,以增强隐写分析特征,估计由对抗性攻击引起的像素变化的可能性。
- 检测系统结合高维人工特征与 Fisher 线性判别(FLD)集成进行分类。
- 在 ImageNet-1000 上使用 VGG-16 分类器,评估四种攻击类型(FGSM、IGSM、Deepfool 和 C&W)下的检测性能。
- 通过对比使用和不使用 MPM 的检测器(如 SPAM 与 ESPAM、SRM 与 ESRM),验证特征增强的有效性。
- 检测模型明确采用非神经网络结构,避免了神经网络检测器普遍面临的二次对抗攻击漏洞。
实验结果
研究问题
- RQ1能否有效将隐写分析应用于检测对抗性样本,将扰动视为隐藏数据的修改?
- RQ2修改概率估计(MPM)如何增强隐写分析特征,以提升在多种对抗性攻击下的检测准确率?
- RQ3非神经网络检测模型是否能抵抗绕过神经网络检测器的二次对抗攻击?
- RQ4与现有防御方法相比,MPM 增强检测器的性能如何,特别是在 ImageNet 上对强攻击(如 C&W)的表现如何?
- RQ5结合 MPM 的低维特征检测器能否实现与高维特征检测器相当的性能?
主要发现
- 使用 MPM 的 ESRM 检测器在 ImageNet 上对 C&W 攻击的检测准确率达到 93.41%,显著优于基线方法。
- MPM 使 SPAM 的检测准确率提升超过 15 个百分点,证明了其强大的特征增强能力。
- ESPM 和 ESRM 的表现优于 RBF-SVM,后者在 C&W 攻击下近乎无效(准确率为 51.87%)。
- ESRM 检测器在所有攻击类型(包括 FGSM、IGSM、Deepfool 和 C&W)下的平均检测准确率最高。
- 使用 MPM 的检测器在所有情况下均表现出比无 MPM 对应检测器更高的准确率,证实了该增强方法的有效性。
- 检测模型的非神经网络结构可有效防止直接的二次对抗攻击,相较于基于神经网络的防御方法具有关键优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。