Skip to main content
QUICK REVIEW

[论文解读] Towards Robust Detection of Adversarial Examples

Tianyu Pang, Chao Du|arXiv (Cornell University)|Jun 2, 2017
Adversarial Robustness in Machine Learning参考文献 40被引用 13
一句话总结

本文提出了一种鲁棒防御方法,通过引入反向交叉熵(RCE)训练和核密度(K-density)阈值检测器,有效抵御对抗样本攻击。RCE增强了正常样本与对抗样本在特征空间中的区分能力,使K-density检测器能以极低的训练开销高效过滤对抗样本,在MNIST和CIFAR-10数据集上对所有威胁模型(包括可逃避先前防御的白盒攻击)均实现了最先进水平的鲁棒性。

ABSTRACT

Although the recent progress is substantial, deep learning methods can be vulnerable to the maliciously generated adversarial examples. In this paper, we present a novel training procedure and a thresholding test strategy, towards robust detection of adversarial examples. In training, we propose to minimize the reverse cross-entropy (RCE), which encourages a deep network to learn latent representations that better distinguish adversarial examples from normal ones. In testing, we propose to use a thresholding strategy as the detector to filter out adversarial examples for reliable predictions. Our method is simple to implement using standard algorithms, with little extra training cost compared to the common cross-entropy minimization. We apply our method to defend various attacking methods on the widely used MNIST and CIFAR-10 datasets, and achieve significant improvements on robust predictions under all the threat models in the adversarial setting.

研究动机与目标

  • 解决深度学习模型在各种攻击方法生成的对抗样本面前的脆弱性问题。
  • 在不牺牲干净样本准确率的前提下,提升在白盒、黑盒和无感知威胁模型下的检测鲁棒性。
  • 设计一种训练方法,增强正常输入与对抗输入在特征空间中的分离能力。
  • 通过轻量级、即插即用的阈值策略实现高效检测,且与标准深度学习流水线兼容。

提出的方法

  • 提出反向交叉熵(RCE)作为新型训练目标,促使模型对真实类别保持高置信度,同时对错误类别保持均匀分布,从而提升潜在表征的可分性。
  • 在最后一层特征上使用核密度(K-density)估计作为阈值检测器,识别远离数据流形的输入。
  • 用RCE训练替代标准交叉熵训练,仅需少量修改,计算开销可忽略不计。
  • 基于K-density得分设计阈值策略,在推理阶段标记并过滤对抗样本。
  • 设计RCE损失函数,使对抗样本在特征空间中更易被区分,尤其对基于维度的检测器(如K-density)具有显著增益。
  • 在多种模型(ResNet-32、ResNet-56)和数据集(MNIST、CIFAR-10)上,于多样化攻击设置下验证了方法的有效性。

实验结果

研究问题

  • RQ1修改后的训练目标是否能提升现有检测机制对对抗样本的可检测性?
  • RQ2RCE训练在白盒攻击下对基于K-density的检测鲁棒性有何影响?
  • RQ3所提出方法在提升对抗检测能力的同时,对干净样本准确率的保持程度如何?
  • RQ4当攻击者使用替代模型进行黑盒迁移攻击时,该防御是否依然有效?
  • RQ5旨在逃避检测器的对抗样本,是否仍与正常输入在视觉上可区分?

主要发现

  • 在ResNet-32(MNIST)上,C&W-wb攻击下,RCE训练模型中f₂(x*) > 0的对抗样本比例达到77%,而标准交叉熵模型仅为1%,表明检测能力显著提升。
  • RCE训练模型生成的对抗样本需平均31.59的扰动(对比CE的17.12)才能逃避检测,导致其在视觉上呈现明显噪声,易被人眼察觉。
  • 在CIFAR-10上,使用替代模型的黑盒攻击AUC得分为89.1(RCE),而CE仅为75.0,表明对迁移攻击具有更强的抵抗力。
  • 该方法在保持最先进干净测试集准确率的同时,显著提升了所有威胁模型下的鲁棒性。
  • 即使在最激进的白盒攻击(C&W-wb)下,RCE模型生成的对抗样本仍需宏观尺度的扰动,使其在视觉上可被轻易识别。
  • 当攻击者直接针对K-density检测器发起攻击时,该防御依然有效,因为RCE值与K-density得分之间缺乏显式关联,限制了攻击效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。