[论文解读] MACE: A Flexible Framework for Membership Privacy Estimation in Generative Models
MACE 首次为生成模型在个体和群体层面提供了估计成员隐私风险的正式框架,通过基于样本的统计差异估计器,比较训练样本与保留样本之间的差异。该框架支持灵活且现实的威胁建模,并具备理论保证,即使在数据访问受限的情况下依然有效,且表明少数群体子群可能面临显著高于整体平均水平的个体隐私风险。
Generative machine learning models are being increasingly viewed as a way to share sensitive data between institutions. While there has been work on developing differentially private generative modeling approaches, these approaches generally lead to sub-par sample quality, limiting their use in real world applications. Another line of work has focused on developing generative models which lead to higher quality samples but currently lack any formal privacy guarantees. In this work, we propose the first formal framework for membership privacy estimation in generative models. We formulate the membership privacy risk as a statistical divergence between training samples and hold-out samples, and propose sample-based methods to estimate this divergence. Compared to previous works, our framework makes more realistic and flexible assumptions. First, we offer a generalizable metric as an alternative to the accuracy metric especially for imbalanced datasets. Second, we loosen the assumption of having full access to the underlying distribution from previous studies , and propose sample-based estimations with theoretical guarantees. Third, along with the population-level membership privacy risk estimation via the optimal membership advantage, we offer the individual-level estimation via the individual privacy risk. Fourth, our framework allows adversaries to access the trained model via a customized query, while prior works require specific attributes.
研究动机与目标
- 解决高质量生成模型缺乏差分隐私保证时,缺乏正式隐私证书的问题。
- 在现实假设下实现成员隐私风险估计,包括通过随机抽样而非完整分布访问方式获取数据的限制。
- 估计群体层面的最优成员优势以及个体层面的隐私风险,尤其关注数据不平衡或少数群体子群。
- 通过允许攻击者向训练好的模型发出自定义查询,支持灵活的威胁建模,而非局限于特定查询类型。
- 为隐私风险度量提供一致的、基于样本的估计器,并具备理论保证,这些度量不仅限于准确率,例如基于 AUC 的 AM 度量。
提出的方法
- 将成员隐私风险形式化为训练样本与保留样本之间的统计差异,从而通过经验样本进行估计。
- 提出一种基于贝叶斯最优分类器的样本估计器,用于估计最优成员优势,并具备理论一致性保证。
- 引入一种个体隐私风险估计器,可量化每个样本的风险,从而支持子群层面的分析。
- 支持任意查询类型(例如判别器得分),以建模现实中的攻击者行为,而非受限于特定查询结构。
- 采用广义度量(如基于 AUC 的 AM 度量),以更好地反映在数据不平衡情况下的隐私风险,而不仅依赖准确率。
- 借鉴统计学习理论中的技术,在数据访问受限(包括从数据分布中随机抽样)的条件下,推导出一致的估计器。
实验结果
研究问题
- RQ1我们能否在不需完整访问底层数据分布的前提下,估计生成模型中最大成员隐私风险(即最优攻击者)?
- RQ2我们如何估计个体层面的成员隐私风险,以检测少数群体或异常值子群的脆弱性?
- RQ3我们能否开发一种灵活的、基于样本的框架,支持多种查询类型和度量方式,包括非准确率度量(如 AM)?
- RQ4在数据访问受限的真实场景中,启发式攻击者与最优攻击者的性能相比如何?
- RQ5该框架能否扩展以支持高维查询或模型组件(如生成器和判别器的中间层)?
主要发现
- 基于贝叶斯分类器的最优成员优势估计器,即使在数据访问受限的情况下,也能提供一致且理论可靠的隐私风险上限。
- 使用判别器得分的启发式攻击者在准确率和 AM 度量下均表现出与最优攻击者相当的性能,验证了其实际相关性。
- 在皮肤癌 MNIST 数据集中,受损或异常图像的个体隐私风险显著高于未受损图像,表明子群存在脆弱性。
- 平均而言,少数群体子群面临的个体隐私风险高于整体人群,而这一风险仅通过群体层面度量是无法察觉的。
- 该框架使数据和模型所有者能够评估发布完整模型、模型组件或合成数据的相对隐私风险,从而支持更明智的共享决策。
- 该框架具有通用性,可应用于生成模型和判别模型,附录中已通过实例验证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。