[论文解读] Adversarial Defense by Stratified Convolutional Sparse Coding
该论文提出了一种新颖的、与攻击无关的对抗性防御方法,通过分层卷积稀疏编码将输入投影到低维准自然图像空间,在该空间中,干净样本与对抗性样本在特征空间中彼此接近。该方法引入了一种稀疏变换层(STL),以实现高效的投影,并在不同扰动尺度、输入分辨率和数据集规模下实现了最先进的鲁棒性,相较于以往的输入变换防御方法,在准确率和图像质量保持方面表现更优。
We propose an adversarial defense method that achieves state-of-the-art performance among attack-agnostic adversarial defense methods while also maintaining robustness to input resolution, scale of adversarial perturbation, and scale of dataset size. Based on convolutional sparse coding, we construct a stratified low-dimensional quasi-natural image space that faithfully approximates the natural image space while also removing adversarial perturbations. We introduce a novel Sparse Transformation Layer (STL) in between the input image and the first layer of the neural network to efficiently project images into our quasi-natural image space. Our experiments show state-of-the-art performance of our method compared to other attack-agnostic adversarial defense methods in various adversarial settings.
研究动机与目标
- 开发一种与攻击无关且与模型无关的防御方法,以在不同输入分辨率、扰动尺度和数据集规模下保持鲁棒性。
- 构建一个低维准自然图像空间,以忠实近似自然图像流形,同时去除对抗性扰动。
- 设计一种高效且可微分的稀疏变换层(STL),在分类前将输入投影到准自然空间。
- 与现有输入变换防御方法相比,实现图像细节保持与对抗性扰动去除之间的更优平衡。
- 在CIFAR-10和ImageNet等标准基准上,于多种对抗性攻击下展示最先进性能。
提出的方法
- 该方法通过无监督卷积字典学习构建准自然图像空间,在低维空间中近似自然图像流形。
- 提出一种新颖的稀疏变换层(STL),利用学习到的卷积字典进行稀疏编码,将输入图像投影到准自然空间。
- STL作为输入与网络第一层之间的可微分端到端层,支持与分类器的联合训练。
- 该防御利用了对抗性样本与其原始样本在投影到准自然空间后,其在特征空间中距离被拉近的特性。
- 通过在投影后的准自然图像上微调分类器,进一步增强鲁棒性。
- 该方法使用稀疏性约束权重 $\lambda$ 控制图像重建质量与鲁棒性之间的权衡。
实验结果
研究问题
- RQ1一种防御方法是否能在保持与攻击无关和与模型无关的同时,实现对多种对抗性攻击的最先进鲁棒性?
- RQ2能否构建一个低维准自然图像空间,以保留自然图像结构的同时去除对抗性扰动?
- RQ3可微分的稀疏变换层(STL)是否能实现在无需模型微调的情况下,有效且高效地将输入投影到准自然空间?
- RQ4与现有输入变换防御方法相比,该方法在图像质量与鲁棒性之间的平衡表现如何?
- RQ5该防御是否能在不同输入分辨率、扰动幅度和大规模数据集上保持高性能?
主要发现
- 在多种攻击下,该方法在ImageNet上实现了最先进top-1准确率,包括FGSM-0.08(0.8654)、BIM(0.7332)和CW(0.7212),优于以往的与攻击无关的防御方法。
- 在CIFAR-10上,该方法在FGSM-0.08下实现0.8654的top-1准确率,超过次佳方法(TVM为0.8591),显著优于Quilting(0.8149)和Crop-Ens(0.7730)。
- 该方法在图像质量与防御性能的权衡中表现出更优的鲁棒性,相较于现有方法,实现了最高的PSNR和最有利的预测质量区间。
- 该方法在不同输入分辨率和扰动尺度下保持了高鲁棒性,对于原始ResNet-50模型,使用STL防御时,FGSM-0.08的准确率保持在0.61以上,CW攻击下保持在0.63以上。
- 该方法在干净样本与对抗性样本之间的预测准确率特征区间最小化,表明经变换后,干净样本与对抗性样本在特征空间中始终保持接近。
- 消融研究证实,增加稀疏性约束权重 $\lambda$ 可提升鲁棒性,但会牺牲图像质量,而最优 $\lambda$ 能有效平衡两项指标。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。