Skip to main content
QUICK REVIEW

[论文解读] RAID: Randomized Adversarial-Input Detection for Neural Networks

Hasan Ferit Enişer, Maria Christakis|arXiv (Cornell University)|Feb 7, 2020
Adversarial Robustness in Machine Learning参考文献 51被引用 13
一句话总结

RAID 是一种新颖且稳健的对抗性图像检测方法,通过训练一个辅助分类器,基于良性样本与对抗性样本之间神经元激活模式的差异来检测对抗性输入。该方法在六类攻击类型中,相较于最先进的技术 SADL 和 mMutant,检测效果最高提升 88%,并通过 P-RAID 扩展可有效抵御检测感知型对抗者,同时不损失有效性。

ABSTRACT

In recent years, neural networks have become the default choice for image classification and many other learning tasks, even though they are vulnerable to so-called adversarial attacks. To increase their robustness against these attacks, there have emerged numerous detection mechanisms that aim to automatically determine if an input is adversarial. However, state-of-the-art detection mechanisms either rely on being tuned for each type of attack, or they do not generalize across different attack types. To alleviate these issues, we propose a novel technique for adversarial-image detection, RAID, that trains a secondary classifier to identify differences in neuron activation values between benign and adversarial inputs. Our technique is both more reliable and more effective than the state of the art when evaluated against six popular attacks. Moreover, a straightforward extension of RAID increases its robustness against detection-aware adversaries without affecting its effectiveness.

研究动机与目标

  • 解决现有对抗性检测方法在多样化攻击类型下泛化能力不足的问题。
  • 开发一种无需攻击特定超参数调优即可保持有效性的检测机制。
  • 提升对针对检测机制进行定制化攻击的自适应对抗者的鲁棒性。
  • 为实际部署提供一种简单、高效且公开可用的检测框架。

提出的方法

  • RAID 训练一个辅助分类器,基于从随机选择的神经元子集中神经元激活值的差异,区分良性输入与对抗性输入。
  • 该方法使用固定的随机种子选择用于激活比较的神经元,以确保一致性并降低对超参数选择的敏感性。
  • 其核心观察是:即使扰动不可察觉,对抗性输入仍会引致与良性输入不同的激活模式。
  • 一种变体 P-RAID 在推理时对神经元选择过程引入随机化,以增强对自适应对抗者的鲁棒性。
  • 该方法无需对主网络进行架构修改,作为轻量级在线检测器运行。
  • 检测机制通过 AUC 和 EER 等标准指标,在多种攻击类型和数据集上进行评估。

实验结果

研究问题

  • RQ1基于神经元激活差异的检测方法是否能在无需超参数调优的情况下,泛化到多种对抗性攻击类型?
  • RQ2RAID 在性能和稳定性方面相较于 SADL 和 mMutant 等最先进检测技术表现如何?
  • RQ3RAID 是否可扩展以在针对检测机制的自适应对抗者面前仍保持有效性?
  • RQ4对神经元选择过程引入随机化对检测对逃避攻击的鲁棒性有何影响?
  • RQ5RAID 在强攻击(如 Carlini & Wagner (CW) 和 DeepFool (DF))下的表现如何?

主要发现

  • RAID 在最强攻击(包括 Carlini & Wagner (CW) 和 DeepFool (DF))下达到 90% 的 AUC 得分,表现出优异的检测性能。
  • 在六种流行的对抗性攻击类型中,RAID 的检测有效性相较于 SADL 和 mMutant 最高提升 88%。
  • RAID 对较弱攻击(如 PGD、BIM 和 FGSM)实现了完美检测(100% 真阳性率)。
  • P-RAID 扩展在显著提升对检测感知型对抗者的鲁棒性的同时,保持了高水平的检测有效性。
  • RAID 在广泛超参数范围内表现出稳定性能,表明对配置选择具有较低敏感性。
  • 该方法在应用于未见过的攻击类型时依然有效,表明其具备强大的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。