[论文解读] Detecting Adversarial Examples via Neural Fingerprinting
本文提出神经指纹技术(NFP),一种在训练过程中将唯一且随机的指纹嵌入深度神经网络的方法,以检测对抗性样本。通过验证模型对预定义扰动的响应是否与嵌入的指纹保持一致,NFP在MNIST、CIFAR-10和MiniImageNet上对多种灰盒和黑盒攻击均实现了98–100%的AUC-ROC,展现出最先进的检测性能,且计算开销极低。
Deep neural networks are vulnerable to adversarial examples, which dramatically alter model output using small input changes. We propose Neural Fingerprinting, a simple, yet effective method to detect adversarial examples by verifying whether model behavior is consistent with a set of secret fingerprints, inspired by the use of biometric and cryptographic signatures. The benefits of our method are that 1) it is fast, 2) it is prohibitively expensive for an attacker to reverse-engineer which fingerprints were used, and 3) it does not assume knowledge of the adversary. In this work, we pose a formal framework to analyze fingerprints under various threat models, and characterize Neural Fingerprinting for linear models. For complex neural networks, we empirically demonstrate that Neural Fingerprinting significantly improves on state-of-the-art detection mechanisms by detecting the strongest known adversarial attacks with 98-100% AUC-ROC scores on the MNIST, CIFAR-10 and MiniImagenet (20 classes) datasets. In particular, the detection accuracy of Neural Fingerprinting generalizes well to unseen test-data under various black- and whitebox threat models, and is robust over a wide range of hyperparameters and choices of fingerprints.
研究动机与目标
- 解决深度神经网络对导致灾难性误判的对抗性样本的脆弱性问题。
- 开发一种在敌手对防御机制仅有有限或无访问权限的灰盒和黑盒威胁模型下仍有效的检测机制。
- 提出一种与攻击类型无关的方法,无需辅助分类器或复杂重训练。
- 评估对自适应攻击的鲁棒性,包括利用期望-变换(EOT)和白盒自适应攻击的场景。
- 证明指纹在未见数据上的泛化能力,同时保持与对抗性样本的强分离性。
提出的方法
- NFP在训练期间通过小扰动$\Delta x$和$\Delta y$,将随机的、类似生物特征的指纹编码到模型对真实数据的预测响应中。
- 该方法通过验证模型对这些扰动的敏感性是否与预期的指纹模式一致,作为判断输入为真实或对抗性样本的一致性检查。
- 指纹源自分布$T_{\Delta x}$和$T_{\Delta y}$,且在推理阶段不与模型共享。
- 检测通过将模型对测试输入周围扰动的响应与训练期间学习到的参考指纹模式进行比较来完成。
- 防御性能通过AUC-ROC评估,采用不同阈值$\tau$,更高得分表示干净数据与对抗性数据之间分离效果更好。
- 开发了一种自适应白盒攻击以测试NFP的极限,该攻击基于最小化指纹损失的同时诱导误分类。
实验结果
研究问题
- RQ1在灰盒和黑盒环境下,是否可通过训练时简单嵌入随机指纹,实现对多种攻击类型的对抗性样本检测?
- RQ2NFP对利用指纹分布知识或采用期望-变换(EOT)技术的自适应攻击是否具备鲁棒性?
- RQ3NFP在不同数据集和超参数选择(包括指纹大小$N$和扰动幅度$\varepsilon$)下是否保持高检测性能?
- RQ4在未知攻击机制下,NFP与SOTA检测基线(如LID、KD和BU)相比,AUC-ROC表现如何?
- RQ5新型自适应白盒攻击是否能成功绕过NFP?这对基于指纹的防御安全性意味着什么?
主要发现
- NFP在MNIST、CIFAR-10和MiniImageNet(20类)上对包括FGSM、BIM、JSMA和CW-L2在内的各类对抗攻击均实现了98–100%的AUC-ROC。
- 在CIFAR-10上,NFP平均比LID高出11.77%,且显著优于KD+BU、KD和BU的检测性能。
- 即使与LID-white-box(即LID知晓攻击机制)相比,NFP平均仍高出8.0%。
- NFP在$N$和$\varepsilon$等广泛超参数范围内均保持高性能,如图5和图7所示。
- 在MiniImageNet-20上,当$N=20$、$\varepsilon=0.05$时,NFP的AUC-ROC超过99.5%;对FGSM为99.96%,对BIM-b为99.68%。
- NFP对EOT风格攻击保持鲁棒性,即敌手从相同分布中采样指纹时,仍能有效检测,表明即使部分知晓指纹生成机制,NFP仍具韧性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。