[论文解读] How to Combine Membership-Inference Attacks on Multiple Updated Models
本文提出了一种新颖的黑盒成员推理攻击方法,通过结合原始模型和更新后模型上独立运行的成员推理攻击所获得的置信度分数,显著提升了攻击准确率。通过利用模型更新和分布偏移,所提出的 ScoreDiff 和 / 组合函数在仅使用单一影子模型的情况下,优于以往方法(包括专为机器遗忘设计的方法),在小更新集和剧烈分布偏移下表现出更高的 AUC 和精确率。
A large body of research has shown that machine learning models are vulnerable to membership inference (MI) attacks that violate the privacy of the participants in the training data. Most MI research focuses on the case of a single standalone model, while production machine-learning platforms often update models over time, on data that often shifts in distribution, giving the attacker more information. This paper proposes new attacks that take advantage of one or more model updates to improve MI. A key part of our approach is to leverage rich information from standalone MI attacks mounted separately against the original and updated models, and to combine this information in specific ways to improve attack effectiveness. We propose a set of combination functions and tuning methods for each, and present both analytical and quantitative justification for various options. Our results on four public datasets show that our attacks are effective at using update information to give the adversary a significant advantage over attacks on standalone models, but also compared to a prior MI attack that takes advantage of model updates in a related machine-unlearning setting. We perform the first measurements of the impact of distribution shift on MI attacks with model updates, and show that a more drastic distribution shift results in significantly higher MI risk than a gradual shift. Our code is available at https://www.github.com/stanleykywu/model-updates.
研究动机与目标
- 为解决成员推理(MI)研究中仅关注独立模型的空白,尽管现实世界中的机器学习系统通常会随时间更新模型。
- 研究模型更新与分布偏移对成员推理风险的影响,特别是在模型基于新数据重新训练的生产环境中。
- 开发并评估新的组合函数,利用原始模型与更新后模型的独立成员推理置信度分数,以提升攻击效果。
- 将所提出的攻击与现有成员推理攻击及基于机器遗忘的攻击进行比较,证明在现实威胁模型下具有更优性能。
- 衡量分布偏移对成员推理风险的影响,表明剧烈偏移会使隐私泄露程度超过渐进式偏移。
提出的方法
- 该方法使用最先进的攻击方法(如 LiRA)在原始模型和更新后模型上分别计算独立的成员推理置信度分数。
- 提出组合函数——ScoreDiff 和 /——将原始模型与更新后模型的置信度分数合并为统一的、更具判别力的检验统计量。
- 攻击使用单一影子模型来设定组合函数的阈值,避免了复杂集成学习的需要。
- 该方法专为黑盒场景设计,仅需模型输出(如类别概率),无需访问训练数据或模型参数。
- 该方法在理论和实证上均得到验证,涵盖四个公开数据集,在不同更新规模和分布偏移条件下均表现稳健。
- 作者对 Chen et al. [9] 的 SortedDiff 攻击进行了适配与对比,表明其特征在学习到的攻击模型中影响力高出 7.5 倍。
实验结果
研究问题
- RQ1如何通过结合原始模型与更新后模型的信息来改进成员推理攻击?
- RQ2分布偏移对更新后模型中的成员推理风险有何影响?
- RQ3在结合多个模型版本的置信度分数时,单一影子模型是否足以实现高攻击性能?
- RQ4所提出的组合函数(ScoreDiff 和 /)与现有攻击(如机器遗忘文献中的攻击)相比如何?
- RQ5更新集的大小是否会影响模型更新场景下成员推理攻击的有效性?
主要发现
- 所提出的 ScoreDiff 和 / 攻击在仅使用单一影子模型的情况下,持续优于先前方法,包括 Chen et al. [9] 的 SortedDiff。
- 与基线方法相比,攻击的 AUC 显著更高,尤其在小更新集和剧烈分布偏移下性能提升最为明显。
- 在学习到的攻击模型中,所提出的检验统计量的平均权重是 SortedDiff 特征的 7.5 倍,表明其具有更强的判别能力。
- 剧烈的分布偏移会显著增加 MI 风险,因为模型必须对新数据过拟合,从而增强记忆化程度并提升攻击成功率。
- 在小更新集和高分布偏移下,使用 SGD-New 更新的模型比 SGD-Full 更新的模型更易受攻击,但随着更新集规模增大,这一趋势会发生反转。
- 本研究首次对模型更新场景下分布偏移对成员推理攻击的影响进行了实证测量,揭示了偏移严重程度与攻击有效性之间存在强烈相关性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。