[论文解读] Towards Defending against Adversarial Examples via Attack-Invariant Features
本文提出了一种对抗噪声去除网络(ARN),通过在多种对抗攻击下学习攻击不变特征(AIFs),实现对自然输入的恢复。通过对抗特征学习解耦AIFs,并对潜在空间进行归一化以减少偏差,ARN在对抗未见攻击和自适应攻击方面表现出卓越的鲁棒性,在CIFAR-10和MNIST上的像素约束与空间约束攻击中均优于当前最先进防御方法。
Deep neural networks (DNNs) are vulnerable to adversarial noise. Their adversarial robustness can be improved by exploiting adversarial examples. However, given the continuously evolving attacks, models trained on seen types of adversarial examples generally cannot generalize well to unseen types of adversarial examples. To solve this problem, in this paper, we propose to remove adversarial noise by learning generalizable invariant features across attacks which maintain semantic classification information. Specifically, we introduce an adversarial feature learning mechanism to disentangle invariant features from adversarial noise. A normalization term has been proposed in the encoded space of the attack-invariant features to address the bias issue between the seen and unseen types of attacks. Empirical evaluations demonstrate that our method could provide better protection in comparison to previous state-of-the-art approaches, especially against unseen types of attacks and adaptive attacks.
研究动机与目标
- 解决对抗防御中的泛化差距问题,即在已见攻击上训练的模型在面对未见或自适应攻击时失效。
- 克服训练期间攻击类型分布不均导致的特征学习偏差。
- 开发一种预处理防御机制,通过提取跨攻击的不变语义特征,恢复自然样本。
- 提升对像素约束和空间约束攻击的鲁棒性,尤其针对训练中未见过的攻击类型。
- 在推理阶段无需访问目标模型的架构或梯度信息,实现有效防御。
提出的方法
- 提出一种基于自编码器的ARN框架,通过成对的编码器和判别器,将攻击不变特征(AIFs)与对抗噪声分离。
- 采用对抗特征学习:判别器区分编码后的AIF空间中与攻击类型相关的信息(如攻击类型),而编码器则学习使特征在判别器视角下无法区分。
- 在AIF潜在空间中引入归一化项,使特征分布匹配多元高斯先验,从而减少已见攻击与未见攻击之间的偏差。
- 训练解码器以最小化合成样本与原始自然输入之间的像素级重建损失,实现对干净数据的精确恢复。
- 联合优化编码器与解码器,学习鲁棒且可泛化的AIFs,同时保留语义内容并去除对抗扰动。
- 在训练中使用多种攻击类型(如PGD、AA、STA)以提高对潜在未见攻击的覆盖度,增强泛化能力。
实验结果
研究问题
- RQ1能否在多种对抗攻击下有效学习攻击不变特征(AIFs),以实现稳健防御?
- RQ2对AIF潜在空间进行归一化在缓解已见与未见攻击类型之间偏差方面有何作用?
- RQ3ARN在未见和自适应攻击上的泛化能力如何,尤其是训练中未出现的攻击?
- RQ4通过AIFs去除对抗噪声后,恢复的样本在检测模型眼中是否与自然样本几乎无法区分?
- RQ5在不同攻击类型和约束条件下,ARN与当前最先进防御方法相比,其鲁棒准确率表现如何?
主要发现
- ARN在CIFAR-10上实现了最先进水平的鲁棒准确率,对未见AutoAttack(AA N)达到88.7%,对PGD N达到86.9%,对空间变换攻击(STA N)达到85.1%,显著优于先前方法。
- 消融实验表明,若移除归一化损失($\mathcal{L}_{nor}$),鲁棒性急剧下降——例如,对未见STA N的准确率从85.1%降至64.3%,证明其在泛化中的关键作用。
- 若移除攻击不变特征学习损失($\mathcal{L}_{att}$),ARN的鲁棒性完全崩溃,未见攻击上的准确率降至50%以下,证明其在解耦AIFs中的必要性。
- 通过局部固有维度(LID)的对抗样本检测显示,对恢复样本的召回率在MNIST上仅为1.26%,在CIFAR-10上为8.48%,表明其几乎无法与自然数据区分。
- 该方法在跨模型防御中表现出良好泛化性:ARN预处理后的样本即使在不同目标模型上测试,仍保持高鲁棒性,证实其预处理机制的有效性。
- 模型在自适应攻击下依然保持鲁棒,表明AIFs捕捉到了抵抗演化攻击策略扰动模式的语义不变性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。