[论文解读] AdvDrop: Adversarial Attack to DNNs by Dropping Information
本文提出AdvDrop,一种新型对抗性攻击方法,通过在频域中删除人眼难以察觉的图像细节——特别是高频分量——而非添加扰动来生成对抗性样本。该方法在ImageNet上实现了97.20%的攻击成功率,并对基于去噪的防御措施表现出极强的鲁棒性,暴露出当前深度神经网络鲁棒性评估中的关键漏洞。
Human can easily recognize visual objects with lost information: even losing most details with only contour reserved, e.g. cartoon. However, in terms of visual perception of Deep Neural Networks (DNNs), the ability for recognizing abstract objects (visual objects with lost information) is still a challenge. In this work, we investigate this issue from an adversarial viewpoint: will the performance of DNNs decrease even for the images only losing a little information? Towards this end, we propose a novel adversarial attack, named extit{AdvDrop}, which crafts adversarial examples by dropping existing information of images. Previously, most adversarial attacks add extra disturbing information on clean images explicitly. Opposite to previous works, our proposed work explores the adversarial robustness of DNN models in a novel perspective by dropping imperceptible details to craft adversarial examples. We demonstrate the effectiveness of extit{AdvDrop} by extensive experiments, and show that this new type of adversarial examples is more difficult to be defended by current defense systems.
研究动机与目标
- 探究在频域中删除人眼难以察觉的图像细节是否能生成可欺骗深度神经网络的对抗性样本。
- 从信息丢失的角度而非扰动添加的角度,探索对抗性鲁棒性。
- 评估AdvDrop对现有防御机制(尤其是基于去噪的防御)的有效性。
- 分析模型注意力与被删除图像特征之间的关系。
- 证明频域信息删除比空间域方法(如色彩深度降低)更具有效性且更自然。
提出的方法
- AdvDrop使用离散余弦变换(DCT)将输入图像从空间域转换到频域。
- 通过可微分量化策略选择性地减少高频分量,这些分量对人类感知不明显但对深度神经网络至关重要。
- 该攻击采用可微分量化策略,在保留图像结构的同时去除细微纹理和细节。
- 通过以保持与干净图像视觉相似性但破坏深度神经网络分类的方式删除信息,生成对抗性样本。
- 通过调整被删除频率分量的数量和位置,实现定向和非定向攻击。
- 通过频带删除(低、中、高频)和量化方法的消融实验对方法进行评估。
实验结果
研究问题
- RQ1在频域中删除人眼难以察觉的图像细节是否能生成有效对抗性样本以欺骗深度神经网络?
- RQ2与添加扰动的现有对抗性攻击相比,AdvDrop在有效性和鲁棒性方面表现如何?
- RQ3为何频域信息删除比空间域方法(如色彩深度降低)更有效?
- RQ4AdvDrop在多大程度上利用或与深度神经网络注意力图重叠?
- RQ5当前防御机制(尤其是基于去噪的防御)对AdvDrop生成的对抗性样本有多有效?
主要发现
- AdvDrop在ImageNet上实现了97.20%的攻击成功率,显著优于标准舍入(5.00%)和可微分量化(65.20%)方法。
- 该方法对基于去噪的防御具有极强鲁棒性:尽管PGD生成的对抗性样本可被去噪处理缓解,但AdvDrop生成的样本仍保持有效性。
- 删除低频分量导致准确率下降最显著(降至30.00%),表明其在深度神经网络识别中的主导作用;而高频分量的删除危害较小,但仍具显著效果。
- 视觉分析显示,AdvDrop倾向于去除高频纹理细节,且常与模型高注意力区域重叠,尤其是在纹理丰富的区域。
- 与空间域方法(如色彩深度降低)相比,频域信息删除更具有效性且生成的对抗性图像更自然。
- 消融实验确认,可微分量化对高性能至关重要,因为它实现了精确的非均匀信息删除,从而最大化攻击成功率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。