Skip to main content
QUICK REVIEW

[论文解读] Online Adversarial Purification based on Self-Supervision

Changhao Shi, Chester Holtz|arXiv (Cornell University)|Jan 23, 2021
Adversarial Robustness in Machine Learning参考文献 33被引用 12
一句话总结

本文提出自监督在线对抗净化(SOAP),一种测试时防御方法,利用自监督表示学习在无需微调的情况下净化对抗样本。通过在训练过程中联合优化分类任务与与标签无关的自监督任务,SOAP 实现了推理时的迭代梯度净化,以极低的训练开销实现了对强对抗攻击的竞争力鲁棒准确率,且在对抗者知晓防御策略时仍保持鲁棒性。

ABSTRACT

Deep neural networks are known to be vulnerable to adversarial examples, where a perturbation in the input space leads to an amplified shift in the latent network representation. In this paper, we combine canonical supervised learning with self-supervised representation learning, and present Self-supervised Online Adversarial Purification (SOAP), a novel defense strategy that uses a self-supervised loss to purify adversarial examples at test-time. Our approach leverages the label-independent nature of self-supervised signals and counters the adversarial perturbation with respect to the self-supervised tasks. SOAP yields competitive robust accuracy against state-of-the-art adversarial training and purification methods, with considerably less training complexity. In addition, our approach is robust even when adversaries are given knowledge of the purification defense strategy. To the best of our knowledge, our paper is the first that generalizes the idea of using self-supervised signals to perform online test-time purification.

研究动机与目标

  • 为解决深度神经网络对对抗样本的脆弱性问题,即模型可能因难以察觉的扰动而错误分类输入。
  • 通过将鲁棒性转移至测试时净化,降低对抗训练的计算负担。
  • 探究自监督信号(因其与标签无关)是否可用于检测并逆转对抗扰动。
  • 设计一种即使在对抗者知晓净化机制时仍有效的防御方法。
  • 通过使用通用的自监督掩码任务,将对抗净化推广至图像以外的模态,超越图像专用的自编码器或生成对抗网络。

提出的方法

  • 在标准训练过程中,联合训练一个深度神经网络的分类头与辅助自监督任务(如旋转预测、对比学习或重建)。
  • 在测试时,应用迭代投影梯度下降(PGD)最小化自监督损失,同时保持分类器输入不变,从而有效将输入净化至干净数据流形。
  • 为分类和净化任务共用一个编码器,确保两个任务使用相同的表示。
  • 定义联合目标用于对抗攻击,同时优化交叉熵损失与辅助自监督损失,以模拟对抗者知晓净化机制的情形。
  • 选择对标签变化不敏感但对由对抗噪声引起的分布偏移敏感的自监督任务,以实现有效的扰动校正。
  • 迭代应用净化过程直至收敛,利用辅助损失作为正则化项,引导输入向干净、自然的表示靠拢。

实验结果

研究问题

  • RQ1能否在不需微调或再训练的情况下,利用自监督表示学习在测试时净化对抗样本?
  • RQ2自监督信号的标签无关性是否使其在检测和逆转对抗扰动方面具有有效性?
  • RQ3测试时净化方法是否能在降低训练复杂度的同时,实现与最先进对抗训练相当的鲁棒准确率?
  • RQ4当对抗者知晓净化机制并可相应调整攻击策略时,该防御是否依然有效?
  • RQ5该方法能否推广至图像以外的数据模态,通过适配的自监督任务应用于其他数据类型?

主要发现

  • SOAP 在 MNIST 和 CIFAR-10 上实现了具有竞争力的鲁棒准确率,在某些设置下甚至优于标准对抗训练,尤其在黑盒 FGSM 攻击下表现更优。
  • 在 FCN 架构上,SOAP-DR(基于重建)在 FGSM 黑盒攻击下达到 97.57% 的鲁棒准确率,超过 FGSM 对抗训练(79.76%),并接近 PGD 对抗训练(96.02%)。
  • 当对抗者知晓防御机制并同时针对分类损失与辅助损失优化时,攻击成功率下降,尤其在重建和标签一致性任务中更为显著。
  • 对于旋转预测任务,鲁棒准确率在不同攻击权衡参数下保持稳定,表明其对这类攻击的敏感性高于其他任务。
  • 即使对抗者使用替代模型生成黑盒对抗样本,该方法仍保持强性能,表明其在迁移攻击场景中具有高度鲁棒性。
  • 测试时净化过程为每个样本增加的计算开销可忽略不计,使其在实际部署中具有可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。