[论文解读] Optimal Transport Classifier: Defending Against Adversarial Attacks by Regularized Deep Embedding
本文提出了一种新型端到端深度学习框架——最优传输分类器(OT-Classifier),通过使用正则化的深度编码器将高维图像投影到低维潜在空间,从而防御白盒对抗攻击。通过最小化真实标签分布与模型输出分布之间的最优传输成本,该方法在保留关键特征的同时减弱对抗扰动,在 MNIST、CIFAR10、STL10 和 Tiny ImageNet 上对强对抗攻击展现出最先进水平的鲁棒性。
Recent studies have demonstrated the vulnerability of deep convolutional neural networks against adversarial examples. Inspired by the observation that the intrinsic dimension of image data is much smaller than its pixel space dimension and the vulnerability of neural networks grows with the input dimension, we propose to embed high-dimensional input images into a low-dimensional space to perform classification. However, arbitrarily projecting the input images to a low-dimensional space without regularization will not improve the robustness of deep neural networks. Leveraging optimal transport theory, we propose a new framework, Optimal Transport Classifier (OT-Classifier), and derive an objective that minimizes the discrepancy between the distribution of the true label and the distribution of the OT-Classifier output. Experimental results on several benchmark datasets show that, our proposed framework achieves state-of-the-art performance against strong adversarial attack methods.
研究动机与目标
- 为解决深度神经网络对对抗样本的脆弱性,特别是在可完全访问模型的白盒攻击设置下。
- 通过将高维图像输入投影到低维潜在空间,降低模型鲁棒性退化,从而削弱对抗扰动的影响。
- 确保低维嵌入仅保留对分类最相关的特征,避免判别性信息的损失。
- 利用最优传输理论形式化一种防御机制,以最小化真实标签与模型输出之间分布的差异。
- 在多个基准数据集上,对强对抗攻击的鲁棒性超越现有防御方法。
提出的方法
- 该框架采用深度编码器将输入图像映射到低维潜在空间,随后通过分类器头进行最终预测。
- 在潜在空间中引入一个判别器,通过类似 GAN 的对抗机制,强制编码器输出分布匹配一个先验分布(标准正态分布)。
- 通过最小化真实类别分布与 OT-Classifier 输出分布之间的最优传输成本,确保在投影过程中保留关键特征。
- 目标函数结合了用于分类的交叉熵损失与基于最优传输理论推导出的分布正则化项。
- 编码器与判别器以端到端方式联合训练,判别器作为正则化器,将潜在空间塑造成结构良好、低维的流形。
- 通过对抗训练在框架中引入对抗样本,进一步增强在白盒攻击场景下的鲁棒性。
实验结果
研究问题
- RQ1降低深度神经网络的输入维度是否能提升其对白盒对抗攻击的鲁棒性?
- RQ2如何对嵌入过程进行正则化,以仅保留最具判别性的特征,同时抑制对抗噪声?
- RQ3最优传输理论是否可有效应用于防御框架中,以最小化真实标签与模型输出之间的分布差异?
- RQ4结合表示学习与分布正则化的统一端到端架构是否在标准基准上优于现有防御方法?
- RQ5OT-Classifier 在实现卓越鲁棒性的同时,其在干净样本上的准确率保持程度如何?
主要发现
- OT-Classifier 在 MNIST、CIFAR10、STL10 和 Tiny ImageNet 上对强白盒对抗攻击实现了最先进水平的鲁棒准确率。
- 该方法通过将输入投影到低维空间,显著降低了对抗扰动的影响,因为此类扰动在该空间中被衰减。
- 基于最优传输的正则化确保潜在空间仅保留对分类最相关的特征,最大限度减少信息损失。
- 该框架优于其他最先进防御方法,尤其在结合对抗训练时表现更优。
- 实证结果表明,图像数据的内在维度远低于其像素空间维度,验证了该方法核心假设的合理性。
- 类似 GAN 的判别器有效正则化了潜在空间,强制其服从标准正态先验分布,从而增强了模型鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。