[论文解读] Data Forensics in Diffusion Models: A Systematic Analysis of Membership Privacy
本文首次系统分析了扩散模型上的成员推理攻击(MIAs),提出了一套新颖且高度有效的攻击方法,利用模型独特的架构特性(如固定且公开的编码机制与迭代生成过程)以及易于获取的中间输出。在现实的灰箱与黑箱设置下,攻击性能接近完美(AUCROC > 0.9),揭示了真实世界部署中严重的隐私风险。
In recent years, diffusion models have achieved tremendous success in the field of image generation, becoming the stateof-the-art technology for AI-based image processing applications. Despite the numerous benefits brought by recent advances in diffusion models, there are also concerns about their potential misuse, specifically in terms of privacy breaches and intellectual property infringement. In particular, some of their unique characteristics open up new attack surfaces when considering the real-world deployment of such models. With a thorough investigation of the attack vectors, we develop a systematic analysis of membership inference attacks on diffusion models and propose novel attack methods tailored to each attack scenario specifically relevant to diffusion models. Our approach exploits easily obtainable quantities and is highly effective, achieving near-perfect attack performance (>0.9 AUCROC) in realistic scenarios. Our extensive experiments demonstrate the effectiveness of our method, highlighting the importance of considering privacy and intellectual property risks when using diffusion models in image generation tasks.
研究动机与目标
- 系统研究扩散模型特有的成员推理攻击(MIA)风险,这些模型在商业及面向公众的图像生成系统中日益广泛应用。
- 识别并分析由扩散模型的架构特性和部署特定特性(如固定编码与迭代生成)引发的独特攻击向量。
- 基于易于获取的模型输出,开发针对真实世界部署场景(白盒、灰盒与黑盒设置)量身定制的新颖且实用的MIA方法。
- 在多样化的数据分布、模型架构与训练配置下评估这些攻击的有效性,凸显隐私泄露的严重性。
提出的方法
- 攻击利用扩散模型在迭代去噪过程中生成的中间潜在表征,这些表征在标准推理流程中公开可访问。
- 通过学习或基于启发式的函数计算成员得分,比较样本在目标模型生成过程下的似然性,利用模型固定的公开编码机制。
- 该方法设计用于在三种攻击场景下均具实用性与高效性:白盒(完全访问模型)、灰盒(有限访问中间输出)与黑盒(仅访问最终图像输出)。
- 关键改进包括截断与校准技术,以提升在现实、噪声环境下的攻击性能,尤其在灰盒场景中表现显著。
- 使用真实世界预训练模型(Stable Diffusion v1.4 与 v1.5)和标准基准(COCO-2017 与 LAION-2B)进行评估,指标包括 AUCROC、F1-score 与 1% FPR 下的 TPR。
- 理论与实证分析证实,攻击的高性能源于模型固定的公开编码机制以及多步扩散过程中存在的信息泄露。

实验结果
研究问题
- RQ1扩散模型中存在哪些在其他生成模型中不存在的独特攻击向量,特别是由于其固定编码与迭代生成过程?
- RQ2当仅能访问中间潜在状态(而非最终图像)时,成员推理攻击的效率如何,这在典型API部署中尤为常见?
- RQ3在仅能获取最终生成图像的黑盒设置下,成员推理攻击能否实现高性能?其表现与灰盒和白盒设置相比如何?
- RQ4影响扩散模型上成员推理攻击成功率的关键因素有哪些?例如数据分布、模型架构与训练配置?
- RQ5现有防御机制(如差分隐私或模型混淆)如何影响这些攻击的有效性?其权衡关系是什么?
主要发现
- 所提出的成员推理攻击在 stable-diffusion-v1.4 上达到 AUCROC 0.73,在 stable-diffusion-v1.5 上达到 0.74,显著优于基线性能。
- 在 1% 的假阳性率(FPR)下,v1.4 的真正阳性率(TPR)达到 24.21%,v1.5 达到 25.66%,表明即使在严格误差约束下,仍具备强大的成员检测能力。
- 在仅能访问中间扩散步骤的灰盒设置中,攻击依然高度有效,证明信息泄露贯穿整个生成过程。
- 截断与校准技术的使用显著提升了在现实非理想环境下的攻击性能,增强了鲁棒性与实用性。
- 扩散模型中固定的公开编码机制使攻击者能够精确模仿,而其他模型中编码需近似估计,因此扩散模型在这一方面尤为易受攻击。
- 尽管差分隐私具有潜在防御潜力,但其会严重降低模型效用,目前尚不适用于扩散模型所用的复杂高分辨率数据集。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。