[论文解读] A Probabilistic Fluctuation based Membership Inference Attack for Diffusion Models
该论文提出PFAMI,一种针对扩散模型的新颖成员推理攻击方法,通过分析数据记录周围的概率波动来检测成员身份,利用记忆化特征而非过拟合。PFAMI通过利用生成模型中记忆化特征的局部概率变化,相比最佳基线实现了27.9%更高的攻击成功率。
Membership Inference Attack (MIA) identifies whether a record exists in a machine learning model's training set by querying the model. MIAs on the classic classification models have been well-studied, and recent works have started to explore how to transplant MIA onto generative models. Our investigation indicates that existing MIAs designed for generative models mainly depend on the overfitting in target models. However, overfitting can be avoided by employing various regularization techniques, whereas existing MIAs demonstrate poor performance in practice. Unlike overfitting, memorization is essential for deep learning models to attain optimal performance, making it a more prevalent phenomenon. Memorization in generative models leads to an increasing trend in the probability distribution of generating records around the member record. Therefore, we propose a Probabilistic Fluctuation Assessing Membership Inference Attack (PFAMI), a black-box MIA that infers memberships by detecting these trends via analyzing the overall probabilistic fluctuations around given records. We conduct extensive experiments across multiple generative models and datasets, which demonstrate PFAMI can improve the attack success rate (ASR) by about 27.9% when compared with the best baseline.
研究动机与目标
- 为解决现有成员推理攻击(MIAs)依赖过拟合的局限性,该局限性可通过正则化缓解,从而降低其在真实场景中的有效性。
- 探索记忆化作为生成模型中成员推理更持久且可泛化的信号,特别是在无过拟合设置下。
- 设计一种实用的MIA框架,可在无需大规模合成数据或白盒访问的情况下,估计局部概率波动。
- 开发一种有效的推理函数,聚合多方向、多距离的概率波动,以区分成员与非成员记录。
- 在多种生成模型和数据集上展示所提方法的鲁棒性与优越性,尤其在扩散模型中表现突出。
提出的方法
- 提出一种基于变分推理的概率估计方法,可高效近似给定记录的生成概率,而无需依赖大规模合成数据。
- 引入一种概率波动度量∆p̂θ,用于量化目标记录周围局部邻域内相邻样本间生成概率的变化。
- 设计一种邻居记录采样策略,在不同距离和方向上生成具有代表性的邻居,以捕捉高维空间中的多方向概率波动。
- 采用基于神经网络的推理函数,聚合并学习来自多个邻居的概率波动模式,从而增强对成员与非成员的判别能力。
- 将所有组件整合为统一框架PFAMI,该框架在黑盒设置下运行,适用于扩散模型和VAEs等概率生成模型。
- 将估计的波动度量用作判别信号:由于记忆化,成员表现出正向、峰状的波动,而非成员则呈现接近零且稳定的波动。
实验结果
研究问题
- RQ1在无过拟合的生成模型中,数据记录周围的概率波动能否作为成员推理的可靠信号?
- RQ2如何在不依赖大规模合成数据或白盒访问的情况下,有效估计和测量局部概率波动?
- RQ3所提出的基于波动的度量在扩散模型的成员推理攻击中,相较于传统基于概率的度量,性能提升程度如何?
- RQ4所提框架中的各组件——概率估计、邻居采样和神经推理——对整体攻击性能的贡献程度如何?
- RQ5所提方法能否在不同生成模型(如扩散模型、VAEs)和数据集上实现泛化?
主要发现
- PFAMI在多个扩散模型和数据集上相比最佳现有基线,将攻击成功率(ASR)提升了约27.9%。
- 在Celeba-64上训练的DDPM模型上,该方法实现了0.947的ASR和0.986的AUC,显著优于基线。
- 消融实验确认,每个组件——变分概率估计、邻居采样和神经推理——均对性能有显著贡献,完整模型达到最高ASR。
- 概率波动度量∆p̂θ能有效区分成员与非成员:成员因记忆化表现出一致的正向波动,而非成员则呈现接近零且稳定的波动。
- 可视化结果表明,尽管成员与非成员的近似概率值存在重叠,但波动度量能清晰分离两者,尤其在扩散模型中表现明显。
- 即使通过正则化缓解了过拟合,该方法仍保持有效性,表明其在无过拟合实际场景中具有鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。