Skip to main content
QUICK REVIEW

[论文解读] This Person (Probably) Exists. Identity Membership Attacks Against GAN Generated Faces

Ryan Webster, Julien Rabin|arXiv (Cornell University)|Jul 13, 2021
Face recognition and analysis参考文献 31被引用 15
一句话总结

本文提出了一种针对生成对抗网络(GAN)生成人脸的新型黑箱身份成员攻击,可检测生成的人脸是否与训练集中任意图像共享同一身份,即使该图像并非完全相同。该攻击利用人脸识别网络将生成样本与训练身份进行比较,揭示了即使在无训练数据或模型架构访问权限的情况下,GAN 仍可能无意中泄露身份信息,尤其在低多样性或有偏见的数据集中,攻击成功率极高。

ABSTRACT

Recently, generative adversarial networks (GANs) have achieved stunning realism, fooling even human observers. Indeed, the popular tongue-in-cheek website {\small \url{ http://thispersondoesnotexist.com}}, taunts users with GAN generated images that seem too real to believe. On the other hand, GANs do leak information about their training data, as evidenced by membership attacks recently demonstrated in the literature. In this work, we challenge the assumption that GAN faces really are novel creations, by constructing a successful membership attack of a new kind. Unlike previous works, our attack can accurately discern samples sharing the same identity as training samples without being the same samples. We demonstrate the interest of our attack across several popular face datasets and GAN training procedures. Notably, we show that even in the presence of significant dataset diversity, an over represented person can pose a privacy concern.

研究动机与目标

  • 挑战一种普遍观点,即 GAN 生成的人脸完全新颖且具有隐私性,通过证明即使未直接复制训练样本,仍可从生成样本中推断出训练数据中的身份。
  • 调查 GAN 是否以某种方式对特定身份产生过拟合,从而使得即使生成图像并非训练样本的复制品,也能实施成员推理攻击。
  • 评估数据集多样性、偏差以及训练时长对攻击成功率的影响,特别是在身份变化有限的真实场景中。
  • 开发一种实用的黑箱攻击方法,无需访问训练数据、模型架构或额外训练,仅依赖预训练的人脸识别网络。
  • 通过识别数据集多样性、早期停止和降低模型偏差等缓解因素,为训练更安全的 GAN 提供实证指导。

提出的方法

  • 攻击使用预训练的人脸识别网络,从生成图像和训练图像中提取身份嵌入。
  • 对于每张生成图像,该方法基于身份嵌入相似度计算其在训练集中的最近邻,以判断生成人脸是否与任一训练身份匹配。
  • 该攻击完全为黑箱:不需访问生成器的权重、架构或训练数据,仅需对生成器和人脸识别模型进行推理。
  • 通过精确率、召回率和 F1 分数评估攻击成功率,跨多种 GAN 架构和数据集比较生成人脸与训练身份的关系。
  • 系统性地改变数据集大小、身份多样性及训练迭代次数,以分析其对攻击性能的影响。
  • 使用 Fréchet Inception Distance(FID)作为图像质量的代理指标,评估持续训练是否提升 FID 或仅增加隐私泄露。

实验结果

研究问题

  • RQ1黑箱成员攻击能否检测到 GAN 生成的人脸是否与任何训练图像共享同一身份,即使该图像并非完全相同?
  • RQ2数据集多样性(以不同身份数量衡量)如何影响 GAN 上身份成员攻击的成功率?
  • RQ3数据集偏差(例如某些个体被过度代表)在多大程度上增加了 GAN 生成人脸中的身份泄露风险?
  • RQ4在 FID 收敛点之后继续训练 GAN 是否会在不提升图像质量的前提下增加身份成员攻击的风险?
  • RQ5能否将早期停止用作实际缓解策略,以减少 GAN 中的身份泄露?

主要发现

  • 即使在无确切训练样本的情况下,身份成员攻击仍能取得较高的 F1 分数(例如超过 0.8),表明 GAN 可通过细微特征泛化泄露身份信息。
  • 在仅包含 220 个身份的训练集中,攻击仍保持高精确率和 F1 分数,表明尽管图像层面存在差异,仍对特定身份存在强烈过拟合。
  • 即使在包含 2020 个身份的数据集中,攻击仍保持显著成功率(F1 > 0.7),表明若存在偏差,仅靠数据集多样性不足以防止身份泄露。
  • LSGAN 在低多样性水平下比 StyleGAN 更易受攻击,可能由于模型容量较小且更早发生过拟合。
  • 在 FID 收敛点之后继续训练(例如 StyleGAN 约 17,000 次迭代后),攻击精确率上升但 FID 未改善,表明存在隐私与质量之间的权衡。
  • 当 FID 达到平台期时采用早期停止,可显著降低攻击成功率,表明其作为隐私保护型 GAN 训练的有效实证缓解策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。