[论文解读] LOGAN: Membership Inference Attacks Against Generative Models
本文首次针对使用生成对抗网络(GANs)的生成模型提出成员推理攻击,证明攻击者可判断特定数据点是否曾被用于训练。这些攻击在白盒和黑盒设置下均有效,依赖于通过在合成样本上训练的 GAN 检测过拟合现象,即使在辅助知识极少的情况下也能实现高准确率,并揭示现有防御措施通常会降低模型质量或稳定性。
Generative models estimate the underlying distribution of a dataset to generate realistic samples according to that distribution. In this paper, we present the first membership inference attacks against generative models: given a data point, the adversary determines whether or not it was used to train the model. Our attacks leverage Generative Adversarial Networks (GANs), which combine a discriminative and a generative model, to detect overfitting and recognize inputs that were part of training datasets, using the discriminator's capacity to learn statistical differences in distributions. We present attacks based on both white-box and black-box access to the target model, against several state-of-the-art generative models, over datasets of complex representations of faces (LFW), objects (CIFAR-10), and medical images (Diabetic Retinopathy). We also discuss the sensitivity of the attacks to different training parameters, and their robustness against mitigation strategies, finding that defenses are either ineffective or lead to significantly worse performances of the generative models in terms of training stability and/or sample quality.
研究动机与目标
- 探究在无置信度分数可供攻击的情况下,针对生成模型的成员推理攻击是否可行。
- 评估在白盒和黑盒访问目标生成模型的情况下,成员推理攻击的有效性。
- 评估训练参数、正则化和差分隐私对攻击成功率的影响。
- 考察生成模型中模型质量与隐私泄露之间的权衡。
- 评估在实际中发动此类攻击的成本与可行性,包括计算和经济开销。
提出的方法
- 在目标生成模型生成的样本上训练 GAN,以创建一个模仿其行为的本地副本。
- 使用攻击者 GAN 的判别器将真实训练数据与目标模型生成的合成样本进行分类。
- 在白盒攻击中,提取并使用目标模型的判别器参数来训练攻击者 GAN。
- 在黑盒攻击中,通过查询目标模型收集合成样本,并从头开始训练攻击者 GAN。
- 应用正则化技术(如权重归一化和 Dropout)以评估其对攻击抵抗能力的影响。
- 利用辅助知识(例如训练数据集中少数真实样本)以提升黑盒攻击性能。
实验结果
研究问题
- RQ1尽管与判别模型不同,生成模型缺乏置信度分数,是否仍可对生成模型发动成员推理攻击?
- RQ2白盒和黑盒成员推理攻击在多种数据集上的最先进生成模型中效果如何?
- RQ3正则化和差分隐私机制在多大程度上可缓解成员推理攻击,其对模型性能的代价如何?
- RQ4在实际中发动此类攻击的计算与经济成本是多少?
- RQ5模型泛化能力与对成员推理攻击的抵抗能力之间存在何种关联?
主要发现
- 白盒攻击实现了高成员推理准确率,证明可通过基于 GAN 的分析检测生成模型中的过拟合现象。
- 黑盒攻击表现强劲,准确率显著优于随机猜测,尤其在结合真实训练样本的辅助知识时更为明显。
- 在 CIFAR-10 上,BEGAN 在白盒成员推理中的准确率仅比随机猜测高出 9%,表明其因泛化能力更强而具有较强抵抗性。
- 差分隐私和正则化等防御措施虽降低了攻击成功率,但引入了训练不稳定性并损害了生成样本质量。
- 攻击的计算成本极低:黑盒攻击仅需约 13 至 42 分钟,且在云 API 上的经济成本不足 1,000 美元。
- 本研究证实,泛化能力更强的模型(如 BEGAN)在本质上对成员推理攻击更具韧性,揭示了泛化能力与隐私保护之间的关联。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。