[论文解读] Model Extraction and Defenses on Generative Adversarial Networks
本文系统性地研究了生成对抗网络(GANs)上的模型提取攻击,区分了准确率提取(匹配目标模型的数据分布)与保真度提取(匹配训练数据分布)。研究证明,攻击者可仅通过约50,000次查询成功提取高质量GAN,并将其迁移至新领域;同时提出了基于输入和输出扰动的有效防御方法——尤其是语义插值与高斯噪声——在不牺牲模型实用性的前提下稳定性能并阻碍提取。
Model extraction attacks aim to duplicate a machine learning model through query access to a target model. Early studies mainly focus on discriminative models. Despite the success, model extraction attacks against generative models are less well explored. In this paper, we systematically study the feasibility of model extraction attacks against generative adversarial networks (GANs). Specifically, we first define accuracy and fidelity on model extraction attacks against GANs. Then we study model extraction attacks against GANs from the perspective of accuracy extraction and fidelity extraction, according to the adversary's goals and background knowledge. We further conduct a case study where an adversary can transfer knowledge of the extracted model which steals a state-of-the-art GAN trained with more than 3 million images to new domains to broaden the scope of applications of model extraction attacks. Finally, we propose effective defense techniques to safeguard GANs, considering a trade-off between the utility and security of GAN models.
研究动机与目标
- 研究生成对抗网络(GANs)上模型提取攻击的可行性,此类攻击相较于判别模型仍属研究不足领域。
- 定义并评估两种不同的攻击目标:准确率提取(匹配目标模型生成的数据分布)与保真度提取(匹配真实训练数据分布)。
- 证明提取的GAN模型可被成功迁移至新领域,从而扩大模型提取的实际影响范围。
- 提出并评估两种新颖的防御策略——输入扰动(潜在码操作)与输出扰动(样本级噪声/过滤)——以保护GAN免受提取攻击。
- 通过评估防御机制在模型实用性与安全性之间的权衡,特别是关注在查询量增加情况下的稳定性与鲁棒性。
提出的方法
- 将准确率提取定义为仅通过查询访问或公开发布的样本,匹配目标GAN生成数据分布。
- 将保真度提取定义为匹配真实训练数据分布,需额外背景知识,如部分真实数据或目标判别器。
- 在CelebA数据集上,以渐进式GAN(PGGAN)和谱归一化GAN(SNGAN)作为目标模型进行评估。
- 通过潜在码的语义插值实现输入扰动防御,通过随机噪声、对抗性噪声、过滤及JPEG压缩实现输出扰动防御。
- 在黑盒准确率提取场景下评估防御效果,即攻击者通过查询或公开发布获取样本,使用FID与视觉质量指标进行评估。
- 应用迁移学习,证明提取的GAN模型可经知识蒸馏后微调并应用于新领域,验证攻击的广泛适用性。
实验结果
研究问题
- RQ1模型提取攻击能否有效作用于GAN,其与针对判别模型的攻击有何不同?
- RQ2在仅具备查询访问或公开样本的情况下,攻击者在多大程度上能实现高准确率与高保真度的GAN提取?
- RQ3访问部分真实训练数据或目标判别器架构在多大程度上可提升提取模型的保真度?
- RQ4提取的GAN模型能否成功迁移至新领域,其对模型安全性的含义是什么?
- RQ5哪些防御机制能有效缓解模型提取攻击,同时保持模型实用性与性能?
主要发现
- 仅通过约50,000次查询即可实现对GAN的模型提取,且在匹配目标模型生成数据分布方面达到可接受性能。
- 当攻击者可访问部分真实训练数据或目标判别器时,保真度提取显著提升模型质量,增强与真实数据分布的对齐。
- 语义插值与高斯噪声防御在查询量不断增加时表现出稳定性能,相较于其他防御技术更具鲁棒性。
- 对抗性噪声与过滤类防御在查询量增加时有效性下降,表明其易受自适应攻击者影响。
- 经知识蒸馏后,提取的GAN模型可成功迁移至新领域,证明了模型提取在现实世界中的威胁面。
- 基于输出扰动的防御,尤其是高斯噪声与JPEG压缩,通过破坏生成样本的统计一致性,显著降低攻击成功率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。