Skip to main content
QUICK REVIEW

[论文解读] BAAAN: Backdoor Attacks Against Autoencoder and GAN-Based Machine Learning Models

Ahmed Salem, Yannick Sautter|arXiv (Cornell University)|Oct 6, 2020
Adversarial Robustness in Machine Learning参考文献 26被引用 20
一句话总结

本文首次提出了针对自编码器和生成对抗网络(GAN)的后门攻击,攻击者在训练过程中注入隐藏触发器以控制模型输出:自编码器在触发激活时可反转输入,而GAN在触发时则能生成目标分布的数据。这些攻击在干净数据上的性能与干净模型几乎完全一致,后门成功率分别为0.0036 MSE(自编码器)和4.4–8.7 FID(GAN),表明攻击具有高度隐蔽性和有效性。

ABSTRACT

The tremendous progress of autoencoders and generative adversarial networks (GANs) has led to their application to multiple critical tasks, such as fraud detection and sanitized data generation. This increasing adoption has fostered the study of security and privacy risks stemming from these models. However, previous works have mainly focused on membership inference attacks. In this work, we explore one of the most severe attacks against machine learning models, namely the backdoor attack, against both autoencoders and GANs. The backdoor attack is a training time attack where the adversary implements a hidden backdoor in the target model that can only be activated by a secret trigger. State-of-the-art backdoor attacks focus on classification-based tasks. We extend the applicability of backdoor attacks to autoencoders and GAN-based models. More concretely, we propose the first backdoor attack against autoencoders and GANs where the adversary can control what the decoded or generated images are when the backdoor is activated. Our results show that the adversary can build a backdoored autoencoder that returns a target output for all backdoored inputs, while behaving perfectly normal on clean inputs. Similarly, for the GANs, our experiments show that the adversary can generate data from a different distribution when the backdoor is activated, while maintaining the same utility when the backdoor is not.

研究动机与目标

  • 调查后门攻击在自编码器和基于GAN的模型上的可行性与影响,这些模型在欺诈检测和数据净化等关键应用中日益广泛应用。
  • 将后门攻击的威胁面从分类模型扩展至生成式和重建类模型。
  • 证明攻击者可仅在隐藏触发器存在时秘密控制模型行为——例如生成特定图像或反转输入。
  • 通过测量在干净输入上的性能下降和在触发输入上的成功度,评估后门模型的隐蔽性与实用性。

提出的方法

  • 提出一种新颖的自编码器后门攻击框架,通过在训练数据中注入触发器(如白色方块)强制模型输出目标重建结果,例如输入的逆向重构。
  • 使用含触发器样本训练自编码器,通过优化嵌入触发器样本的重建损失,确保在干净输入上性能下降最小化。
  • 为GAN设计多判别器训练机制,实现对生成输出分布的后门控制,使模型在触发时能生成目标分布的数据。
  • 将触发器嵌入GAN的潜在噪声向量输入中,使攻击者可通过向噪声中注入特定模式来激活后门。
  • 使用Fréchet Inception Distance(FID)和均方误差(MSE)定量评估模型在MNIST、CIFAR-10、CelebA等数据集上的实用性与后门成功率。
  • 在GAN中评估单张图像目标和全分布目标两种后门场景,包括目标分布与原始分布不相交的情况(如将MNIST作为CIFAR-10 GAN的目标)

实验结果

研究问题

  • RQ1后门攻击能否成功应用于自编码器,使得当存在触发器时,攻击者可控制重构图像的输出?
  • RQ2GAN能否被植入后门,使其仅在潜在噪声向量中嵌入特定触发器时,才生成来自不同分布的数据?
  • RQ3后门自编码器和GAN在干净输入上的性能与干净模型相比如何,体现在重构质量和生成保真度方面?
  • RQ4后门能在多大程度上实现隐蔽性,使在非触发输入上的模型实用性下降最小?
  • RQ5后门能否灵活配置,使得在激活时可生成单张目标图像或整个图像分布?

主要发现

  • 后门自编码器在后门输入上的均方误差(MSE)为0.0036(目标为逆向重构),仅比干净模型高出0.00042,表明在干净数据上性能几乎完全一致。
  • 对于GAN,后门模型的实用性与干净模型几乎完全相同,MNIST、CIFAR-10和CelebA数据集上的FID分数分别为4.4、8.7和5.5,表明性能下降可忽略不计。
  • 在干净输入上,后门GAN的FID值与干净GAN相比仅下降0.8%,表明隐蔽性与实用性均得到良好保留。
  • 当目标为单张图像时,生成图像与目标图像之间的MSE约为0,确认了后门控制的精确性。
  • 攻击成功生成了来自不相交分布的数据(如将MNIST作为CIFAR-10 GAN的目标),在干净输入上FID提高1.6%,在后门输出上FID恶化3.4%,表明攻击具有鲁棒性与灵活性。
  • 可视化结果证实,后门GAN生成的图像在原始分布和目标分布下均与干净GAN生成的图像难以区分,验证了攻击的有效性与隐蔽性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。