Skip to main content
QUICK REVIEW

[论文解读] Enhancing Intrinsic Adversarial Robustness via Feature Pyramid Decoder

Guanlin Li, Shuya Ding|arXiv (Cornell University)|May 6, 2020
Adversarial Robustness in Machine Learning参考文献 27被引用 4
一句话总结

本文提出了一种新颖的、与攻击无关的防御框架——特征金字塔解码器(Feature Pyramid Decoder, FPD),通过在分类层引入Lipschitz常数约束,并集成多尺度去噪与图像恢复模块,增强了基于块的卷积神经网络(CNN)的内在鲁棒性。该框架采用两阶段训练策略,利用$\varepsilon$-邻域噪声图像进行多任务学习与自监督学习。在MNIST、SVHN和CALTECH数据集上,FPD增强的模型在多种白盒与黑盒对抗攻击下均表现出显著更高的鲁棒性,优于标准模型与对抗训练模型。

ABSTRACT

Whereas adversarial training is employed as the main defence strategy against specific adversarial samples, it has limited generalization capability and incurs excessive time complexity. In this paper, we propose an attack-agnostic defence framework to enhance the intrinsic robustness of neural networks, without jeopardizing the ability of generalizing clean samples. Our Feature Pyramid Decoder (FPD) framework applies to all block-based convolutional neural networks (CNNs). It implants denoising and image restoration modules into a targeted CNN, and it also constraints the Lipschitz constant of the classification layer. Moreover, we propose a two-phase strategy to train the FPD-enhanced CNN, utilizing $ε$-neighbourhood noisy images with multi-task and self-supervised learning. Evaluated against a variety of white-box and black-box attacks, we demonstrate that FPD-enhanced CNNs gain sufficient robustness against general adversarial samples on MNIST, SVHN and CALTECH. In addition, if we further conduct adversarial training, the FPD-enhanced CNNs perform better than their non-enhanced versions.

研究动机与目标

  • 为解决对抗训练在特定攻击下泛化能力有限且计算成本高的问题,该方法旨在提升模型内在鲁棒性,而非依赖特定攻击数据。
  • 开发一种与攻击无关的防御框架,通过不依赖对抗训练数据,提升基于块的CNN的内在鲁棒性。
  • 设计一种多尺度特征金字塔解码器,在网络多个层级集成去噪与图像恢复能力。
  • 对分类层施加Lipschitz常数约束,以限制输入扰动引起的输出敏感性。
  • 在多种数据集与攻击类型(包括白盒与黑盒设置)下验证该框架的有效性。

提出的方法

  • 将前端去噪模块、图像恢复模块、中间去噪层与后端去噪模块集成到基于块的CNN中,实现在多尺度特征层级上的去噪。
  • 采用两阶段训练策略,利用$\varepsilon$-邻域噪声图像,实现多任务学习(重建与分类)与自监督学习。
  • 在最终分类层施加Lipschitz常数约束,以限制输入扰动下的输出变化。
  • 在内部去噪层中采用瓶颈结构,以提升效率与特征表示能力。
  • 通过使用干净图像作为真实标签,对恢复头与分类头进行多任务监督,实现联合训练。
  • 在特征图上部署金字塔结构,实现从恢复输入中进行分层去噪与特征抽象。

实验结果

研究问题

  • RQ1是否存在一种防御框架,能够在不依赖对抗训练或攻击特定数据的情况下,提升CNN的内在鲁棒性?
  • RQ2所提出的FPD框架在多种数据集上对白盒与黑盒对抗攻击的防御效果如何?
  • RQ3与标准模型相比,多尺度去噪与图像恢复的集成在多大程度上提升了模型鲁棒性?
  • RQ4对分类层施加Lipschitz常数约束是否对扰动下的鲁棒性有实质性贡献?
  • RQ5FPD框架能否与对抗训练有效结合,进一步提升鲁棒性?

主要发现

  • 在MNIST上,FPD增强的ResNet-101在$\epsilon = 8/256$的$L_{\infty}$-PGD攻击下实现了95.2%的鲁棒准确率,显著优于未增强模型。
  • 在SVHN上,FPD增强模型在$L_{\infty}$-PGD攻击下保持了78.4%的鲁棒准确率,而基线模型仅为61.2%。
  • 在CALTECH-101上,FPD增强的ResNet-101在$L_{\infty}$-PGD攻击下实现了61.78%的鲁棒准确率,较原始模型提升34.64个百分点。
  • 在CALTECH-256上,FPD增强的ResNet-101实现了49.79%的鲁棒准确率,而原始模型在相同攻击下为0.00%。
  • 当与对抗训练结合时,FPD增强模型的鲁棒性高于未增强模型,表明存在协同增益效应。
  • 可视化分析表明,图像恢复模块对干净输入与对抗输入均生成高度相似的输出,表明其具备有效的扰动过滤能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。