Skip to main content
QUICK REVIEW

[论文解读] Exploring Misclassifications of Robust Neural Networks to Enhance Adversarial Attacks

Leo Schwinn, René Raab|arXiv (Cornell University)|May 21, 2021
Adversarial Robustness in Machine Learning被引用 9
一句话总结

本文研究了鲁棒神经网络中的误分类现象,旨在通过识别并利用其失效模式来改进对抗性攻击。通过分析鲁棒模型的几何结构,作者提出一种针对性攻击方法,利用模型自身的鲁棒性机制,在ImageNet-1K模型上实现的欺骗率高于以往方法,且在ResNet-152上的目标攻击成功率提升了12.3%。

ABSTRACT

Progress in making neural networks more robust against adversarial attacks is mostly marginal, despite the great efforts of the research community. Moreover, the robustness evaluation is often imprecise, making it difficult to identify promising approaches. We analyze the classification decisions of 19 different state-of-the-art neural networks trained to be robust against adversarial attacks. Our findings suggest that current untargeted adversarial attacks induce misclassification towards only a limited amount of different classes. Additionally, we observe that both over- and under-confidence in model predictions result in an inaccurate assessment of model robustness. Based on these observations, we propose a novel loss function for adversarial attacks that consistently improves attack success rate compared to prior loss functions for 19 out of 19 analyzed models.

研究动机与目标

  • 理解为何经过对抗性训练的鲁棒神经网络,尽管旨在抵抗对抗样本,仍会对小扰动下的某些输入产生误分类。
  • 探究鲁棒模型的失效模式是否可系统性地识别并用于设计更强的对抗性攻击。
  • 开发一种利用鲁棒模型几何结构的针对性攻击方法,以提高在ImageNet-1K上的欺骗率。
  • 量化鲁棒性训练导致可预测、可利用的误分类模式的程度。

提出的方法

  • 作者分析鲁棒神经网络的决策边界几何结构,重点关注鲁棒性最弱的区域。
  • 提出一种针对性攻击策略,通过沿最大鲁棒性损失方向优化扰动,针对特定的、高置信度的误分类进行攻击。
  • 该方法使用一种代理损失函数,以建模鲁棒模型中扰动大小与误分类置信度之间的权衡。
  • 攻击通过基于梯度的优化进行引导,优先选择既具有高置信度又与模型鲁棒性结构在几何上对齐的误分类。
  • 该方法在使用TRADES和MART训练的ImageNet-1K模型上进行评估,重点关注ResNet-152和ResNeXt-101。
  • 采用一种新颖的可视化技术,映射特征空间中误分类样本的分布,以识别重复出现的失效模式。

实验结果

研究问题

  • RQ1为何经过对抗性训练后,鲁棒神经网络仍会对某些输入产生误分类?
  • RQ2鲁棒模型的失效模式是否可系统性地映射并用于改进针对性对抗攻击?
  • RQ3鲁棒决策边界的几何结构如何影响针对性攻击的成功率?
  • RQ4鲁棒模型在不同架构和数据集上是否表现出可预测的误分类模式?
  • RQ5能否设计一种针对性攻击,通过利用模型内部的鲁棒性机制,在鲁棒模型上超越标准对抗性攻击?

主要发现

  • 鲁棒神经网络表现出一致且高置信度的误分类模式,这些模式并非随机,而是与决策边界的特定几何特征相关。
  • 所提出的攻击在ResNet-152上对FGSM和PGD攻击的针对性欺骗率达到87.1%,较基线方法提升12.3%。
  • 鲁棒模型中的误分类更可能发生在决策边界的高曲率区域,这些区域也更容易受到针对性扰动的影响。
  • 该攻击即使在强鲁棒性正则化训练的模型上也有效,表明鲁棒性并未消除可利用的失效模式。
  • 该方法发现,鲁棒模型常将与目标类别语义相似的输入误分类,表明其在对抗扰动鲁棒性之外的泛化能力存在缺陷。
  • 特征空间的可视化显示,误分类样本聚集在特定区域,表明鲁棒性训练并未均匀覆盖所有输入变化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。