[论文解读] Invert and Defend: Model-based Approximate Inversion of Generative Adversarial Networks for Secure Inference
该论文提出InvGAN,一种无需数据、基于模型的方法,通过训练编码器网络将生成图像近似反向映射回其潜在码,以实现对预训练GAN生成器的近似反演。该方法在反演质量上表现优越,显著提升了DefenseGAN类对抗防御的效率,并实现了高效的重参数化白盒攻击,相较于先前方法在鲁棒性和运行效率方面均有显著改进。
Inferring the latent variable generating a given test sample is a challenging problem in Generative Adversarial Networks (GANs). In this paper, we propose InvGAN - a novel framework for solving the inference problem in GANs, which involves training an encoder network capable of inverting a pre-trained generator network without access to any training data. Under mild assumptions, we theoretically show that using InvGAN, we can approximately invert the generations of any latent code of a trained GAN model. Furthermore, we empirically demonstrate the superiority of our inference scheme by quantitative and qualitative comparisons with other methods that perform a similar task. We also show the effectiveness of our framework in the problem of adversarial defenses where InvGAN can successfully be used as a projection-based defense mechanism. Additionally, we show how InvGAN can be used to implement reparameterization white-box attacks on projection-based defense mechanisms. Experimental validation on several benchmark datasets demonstrate the efficacy of our method in achieving improved performance on several white-box and black-box attacks. Our code is available at https://github.com/yogeshbalaji/InvGAN.
研究动机与目标
- 为解决在无训练数据访问的情况下,将GAN生成图像反向还原至其潜在码这一具有挑战性的问题。
- 通过用学习的编码器替代缓慢的优化过程,提升基于投影的对抗防御方法(如DefenseGAN)的效率与性能。
- 利用重参数化技术,实现对基于投影防御的有效白盒攻击。
- 证明该反演框架可同时增强防御鲁棒性与攻击检测能力。
- 提供一种可扩展、快速且准确的反演机制,适用于多种数据集与GAN架构。
提出的方法
- 通过结合重建损失、感知损失与对抗损失的新型损失函数,训练编码器网络,将生成器输出空间中的图像映射回潜在空间。
- 利用编码器为DefenseGAN中的优化过程提供初始化,减少迭代次数并消除超参数调优的需要。
- 将反演问题建模为可微分优化问题,使编码器作为先验以实现高效的流形投影。
- 通过学习的编码器近似投影操作,实现重参数化攻击,从而支持基于梯度的攻击构造。
- 通过损失函数优化编码器,确保反演图像在语义上与原始GAN生成结果一致,并符合GAN的数据分布。
- 在MNIST、Fashion-MNIST、CIFAR-10和CelebA等基准数据集上应用该框架,以验证其在多样化设置下的性能表现。
实验结果
研究问题
- RQ1是否可以训练一种无需数据、基于模型的编码器,在无原始训练数据访问的情况下,准确反演预训练GAN生成器?
- RQ2与基于优化的方法(如DefenseGAN)相比,InvGAN在提升基于投影的对抗防御速度与准确性方面表现如何?
- RQ3在存在对抗扰动的情况下,InvGAN在多大程度上能增强攻击检测性能?
- RQ4InvGAN是否可用于在基于投影的防御上实现有效的重参数化白盒攻击?
- RQ5在编码器训练目标中引入对抗损失,对反演质量与下游防御性能有何影响?
主要发现
- 在MNIST上,InvGAN在干净条件下测试准确率达到0.99,优于DefenseGAN(0.98)和无防御(0.99),且在FGSM和CW攻击下鲁棒性显著提升。
- 在Fashion-MNIST上,InvGAN在FGSM攻击(ε=0.3)下准确率达到0.88,远超DefenseGAN的0.34,表明其防御性能更优。
- 在CIFAR-10上,InvGAN在FGSM攻击(ε=0.3)下准确率达到0.66,显著优于DefenseGAN的0.44,表明其在复杂数据集上具备更强鲁棒性。
- InvGAN将MNIST FGSM攻击的攻击检测AUC提升至0.9985,优于DefenseGAN的0.9878,表明其对大扰动攻击的可检测性更强。
- 通过使用编码器作为初始化,将有效推理迭代次数减少至1,实现了相较于DefenseGAN的显著加速,同时保持或提升了重建质量。
- 消融实验表明,若移除对抗损失,FID下降至28.07(对比19.85),准确率下降至0.603(对比0.625),证实其对感知真实感与性能的重要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。