Skip to main content
QUICK REVIEW

[论文解读] Fooling Adversarial Training with Inducing Noise

Zhirui Wang, Yifei Wang|arXiv (Cornell University)|Nov 19, 2021
Adversarial Robustness in Machine Learning参考文献 26被引用 4
一句话总结

本文提出ADVIN,一种新型数据投毒方法,通过注入具有一致误分类目标的对抗性噪声,导致对抗性训练模型出现灾难性鲁棒性退化。与以往在对抗性训练下失效的投毒方法不同,ADVIN利用AT模型中的鲁棒特征,创建无法移除的、高效的投毒,使CIFAR-10上的鲁棒测试准确率从51.7%降至0.57%,同时在100%训练准确率下实现13.1%的标准测试准确率,并有效保护个人数据免遭未经授权的学习。

ABSTRACT

Adversarial training is widely believed to be a reliable approach to improve model robustness against adversarial attack. However, in this paper, we show that when trained on one type of poisoned data, adversarial training can also be fooled to have catastrophic behavior, e.g., $<1\%$ robust test accuracy with $>90\%$ robust training accuracy on CIFAR-10 dataset. Previously, there are other types of noise poisoned in the training data that have successfully fooled standard training ($15.8\%$ standard test accuracy with $99.9\%$ standard training accuracy on CIFAR-10 dataset), but their poisonings can be easily removed when adopting adversarial training. Therefore, we aim to design a new type of inducing noise, named ADVIN, which is an irremovable poisoning of training data. ADVIN can not only degrade the robustness of adversarial training by a large margin, for example, from $51.7\%$ to $0.57\%$ on CIFAR-10 dataset, but also be effective for fooling standard training ($13.1\%$ standard test accuracy with $100\%$ standard training accuracy). Additionally, ADVIN can be applied to preventing personal data (like selfies) from being exploited without authorization under whether standard or adversarial training.

研究动机与目标

  • 挑战广泛认为对抗性训练对数据投毒具有鲁棒性的信念,通过展示其对一类新型不可移除投毒的脆弱性。
  • 设计一种对标准训练和对抗性训练均有效的投毒方法,克服以往方法在对抗性训练下被消除的局限性。
  • 通过确保在标准训练和对抗性训练下均失效,实现对个人数据(如自拍照)的不可学习性。
  • 分析先前投毒方法在对抗性训练下失效的机制,并识别出在鲁棒特征中保持一致误分类目标的必要性。

提出的方法

  • ADVIN通过使用预训练的对抗性训练模型生成投毒噪声,确保投毒利用的是鲁棒特征而非非鲁棒特征。
  • 该方法在所有类别上强制实施一致的误分类目标标签,形成系统性偏差,从而破坏对抗性训练。
  • 通过在训练图像中注入小而局部的噪声块(例如8×8至32×32)来应用投毒,保留语义内容的同时降低模型泛化能力。
  • 用于生成投毒的源模型采用基于PGD的对抗性训练进行训练,确保投毒对标准和对抗性训练防御均具有鲁棒性。
  • 投毒同时应用于干净数据和个人数据(如Webface-10),展示了其在真实世界隐私保护场景中的有效性。
  • 实验对比了ADVIN与标准诱导噪声(STDIN),结果表明ADVIN在对抗性训练下对自然准确率和鲁棒准确率的降级效果更优。

实验结果

研究问题

  • RQ1对抗性训练能否被一种在对抗性训练下仍不可移除的数据投毒有效欺骗?
  • RQ2为何先前在标准训练下有效的投毒方法在应用对抗性训练后会失效?
  • RQ3投毒设计的哪些特定属性(如特征类型、标签一致性)是破坏对抗性训练所必需的?
  • RQ4能否设计一种对标准训练和对抗性训练均有效的投毒方法,从而真正实现个人数据的不可学习性?

主要发现

  • 在CIFAR-10上,ADVIN使对抗性训练下的鲁棒测试准确率从51.7%降至0.57%,证明了AT的灾难性失效。
  • 在标准训练下,ADVIN实现13.1%的自然测试准确率和100%的训练准确率,优于以往方法(约15.8%)。
  • 较小的噪声块(16×16)导致最严重的退化,实现44.16%的自然准确率和0.76%的鲁棒准确率,优于更大的块。
  • 在Webface-10数据集上,ADVIN使对抗性训练下的自然准确率从81.34%降至40.82%,鲁棒准确率从43.81%降至22.69%。
  • ADVIN在不同模型架构和训练策略下均保持有效性,包括不同的停止准则和标签分配方案。
  • ADVIN成功保护了个人数据免遭未经授权的使用,使其在标准训练和对抗性训练下均不可学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。