Skip to main content
QUICK REVIEW

[论文解读] PuVAE: A Variational Autoencoder to Purify Adversarial Examples

Uiwon Hwang, Jaewoo Park|arXiv (Cornell University)|Mar 2, 2019
Adversarial Robustness in Machine Learning参考文献 15被引用 11
一句话总结

PuVAE 提出了一种基于变分自编码器的防御方法,通过使用变分推理将对抗性样本投影到特定类别的流形上实现净化,实现了最先进的鲁棒性,且推理速度比 Defense-GAN 快 130 倍。该方法在多种攻击和数据集上优于对抗性训练和 MagNet,尤其在时间受限场景下表现突出。

ABSTRACT

Deep neural networks are widely used and exhibit excellent performance in many areas. However, they are vulnerable to adversarial attacks that compromise the network at the inference time by applying elaborately designed perturbation to input data. Although several defense methods have been proposed to address specific attacks, other attack methods can circumvent these defense mechanisms. Therefore, we propose Purifying Variational Autoencoder (PuVAE), a method to purify adversarial examples. The proposed method eliminates an adversarial perturbation by projecting an adversarial example on the manifold of each class, and determines the closest projection as a purified sample. We experimentally illustrate the robustness of PuVAE against various attack methods without any prior knowledge. In our experiments, the proposed method exhibits performances competitive with state-of-the-art defense methods, and the inference time is approximately 130 times faster than that of Defense-GAN that is the state-of-the art purifier model.

研究动机与目标

  • 解决深度神经网络对小而难以察觉的扰动所引发的对抗性攻击的脆弱性。
  • 克服现有防御方法的局限性,如对攻击类型泛化能力差以及推理延迟高。
  • 开发一种无需事先了解攻击类型即可工作的快速、可扩展的净化机制。
  • 实现在自动驾驶等安全关键应用中对鲁棒模型的实时部署。
  • 在显著降低推理时间的同时,实现与最先进方法相当的防御性能。

提出的方法

  • 训练一个类别条件 VAE,以学习每个类别的数据流形,从而实现从潜在向量重建干净样本。
  • 对于每个对抗性输入,从基于输入及其预测类别的后验分布中采样潜在向量。
  • 通过使用采样得到的潜在码优化 VAE 的重构目标,将对抗性样本投影到特定类别的流形上。
  • 通过 VAE 解码器的一次前向传播生成净化后的样本,避免迭代优化。
  • 利用 VAE 的重参数化技巧实现可微采样,从而实现净化过程的端到端训练。
  • 在训练过程中固定源分类器的参数,以确保净化器能够纠正对抗性输入,而不会过拟合于分类器的预测结果。

实验结果

研究问题

  • RQ1基于 VAE 的净化器是否能在不了解攻击类型的情况下,对多种对抗性攻击实现鲁棒防御?
  • RQ2在实时场景中,基于 VAE 的净化器的推理速度与像 Defense-GAN 这类迭代式 GAN 方法相比如何?
  • RQ3所提出的方法是否在多个数据集(MNIST、Fashion-MNIST、CIFAR-10)和攻击类型下均保持高分类准确率?
  • RQ4基于 VAE 的净化方法是否能有效泛化到不同模型架构和攻击强度?
  • RQ5在严格的时间约束下,PuVAE 的单步推理相比 Defense-GAN 等迭代方法在性能上优势有多大?

主要发现

  • PuVAE 在 MNIST、Fashion-MNIST 和 CIFAR-10 上实现了最先进的防御性能,优于 MagNet,并在所有攻击类型下与 Defense-GAN 表现相当。
  • 在 MNIST 数据集上,PuVAE 对 iFGSM 攻击的准确率为 92.33%,对 CW 攻击的准确率为 90.80%,显著优于 Defense-GAN 的 73.85% 和 72.79%(在 1 秒时间限制内)。
  • PuVAE 每批 128 个样本的推理时间为 0.114 秒,比 Defense-GAN 的 14.80 秒快 134.55 倍。
  • 在 1 秒时间限制下,PuVAE 对 FGSM 攻击的准确率为 81.33%,对 iFGSM 攻击为 92.33%,对 CW 攻击为 90.80%,显著优于 Defense-GAN 的 69.25%、73.85% 和 72.79%。
  • PuVAE 展现出对不同模型架构和攻击类型的鲁棒泛化能力,在未在每种设置下均取得最高分的情况下,仍保持一致的高性能。
  • 该方法无需迭代优化即可保持高性能,因此适用于自动驾驶和监控系统等实时应用场景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。