[论文解读] Identifying Classes Susceptible to Adversarial Attacks
本文提出一种基于距离的方法,通过分析高维特征空间的几何结构,识别出最易受对抗攻击的前 $k$ 个类别。利用最近邻跳跃距离和一种新颖的“禁用距离”边界,构建对抗性映射以预测可能的误分类,其在 CIFAR-10/ResNet-32 上对 $k=4$ 的情形实现了 99.9% 的准确率,优于基于交叉熵(CE)和类均衡交叉熵(RCE)训练的防御方法,且无需额外计算开销。
Despite numerous attempts to defend deep learning based image classifiers, they remain susceptible to the adversarial attacks. This paper proposes a technique to identify susceptible classes, those classes that are more easily subverted. To identify the susceptible classes we use distance-based measures and apply them on a trained model. Based on the distance among original classes, we create mapping among original classes and adversarial classes that helps to reduce the randomness of a model to a significant amount in an adversarial setting. We analyze the high dimensional geometry among the feature classes and identify the k most susceptible target classes in an adversarial attack. We conduct experiments using MNIST, Fashion MNIST, CIFAR-10 (ImageNet and ResNet-32) datasets. Finally, we evaluate our techniques in order to determine which distance-based measure works best and how the randomness of a model changes with perturbation.
研究动机与目标
- 确定对抗攻击是否会对所有类别造成同等程度的破坏,还是某些类别本质上更具脆弱性。
- 开发一种基于深度神经网络分类器特征空间几何特性的方法,识别出最易受攻击的 $k$ 个目标类别。
- 构建一种对抗性映射,通过利用类别间距离,减少对抗性设置下的模型随机性。
- 评估并比较四种基于距离的度量方法(t-SNE、N维欧氏距离、N维余弦距离、最近邻跳跃距离)在识别易受攻击类别方面的表现。
- 提出并验证“禁用距离”作为对抗扰动能力上限的有效性。
提出的方法
- 使用四种度量方法(t-SNE、N维欧氏距离、N维余弦距离、最近邻跳跃距离)计算深度特征空间中的类别间距离。
- 利用这些距离构建对抗性映射,以预测每个真实类别可能发生的对抗性目标类别。
- 提出“禁用距离”($F_D$)作为模型特定的扰动上限,防止在超过此距离时发生误分类。
- 采用最近邻跳跃距离最小化模型熵,精确估计 $F_D$,从而实现对易受攻击类别的鲁棒检测。
- 采用阈值策略:若类别 $c_i$ 与 $c_j$ 之间的跳跃距离超过 $F_D$,则判定从 $c_i$ 到 $c_j$ 的误分类不可能发生。
- 在 MNIST、Fashion-MNIST 和 CIFAR-10(使用 ImageNet 和 ResNet-32)上评估该方法,并与基于交叉熵(CE)和类均衡交叉熵(RCE)训练的防御方法进行对比。
实验结果
研究问题
- RQ1所有类别是否对对抗攻击具有同等的脆弱性,还是某些类别表现出更高的易损性?
- RQ2哪种基于距离的度量方法最能有效捕捉特征空间的几何结构,以识别易受攻击的类别?
- RQ3‘禁用距离’的概念能否作为对抗扰动能力的可靠上限?
- RQ4易受攻击类别数量($k$)如何影响检测准确率?不同模型的最优 $k$ 值是多少?
- RQ5所提出的方法是否在识别对抗性目标类别方面优于基于学习的防御技术(如 CE 和 RCE)?
主要发现
- 最近邻跳跃距离度量最有效地降低了模型熵,并准确计算出禁用距离($F_D$),从而实现对易受攻击类别的精确识别。
- 在 $k=4$ 的情况下,所提方法在 CIFAR-10/ResNet-32 模型上对易受攻击目标类别的识别准确率达到 99.9%,优于基于 CE(71.5%)和 RCE(92.6%)训练的方法。
- 在 MNIST 上,该方法对易受攻击类别的检测准确率为 55.3%,低于 RCE 的 98.8%,原因在于类别在 2D t-SNE 可视化中具有高度可分性且特征重叠较少。
- 禁用距离($F_D$)为对抗扰动提供了有效的上限,因为在所有测试的扰动水平下,实际距离 $D$ 均保持在 $F_D$ 以下。
- 基于距离度量构建的对抗性映射成功捕捉了模型的易受攻击模式,尤其在存在特征重叠的复杂数据集(如 CIFAR-10)中表现突出。
- 该方法在高复杂度模型(如 CIFAR-10 上的 ResNet-32)上表现最佳,其特征空间中的几何模式使得对抗行为能够被准确预测。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。