Skip to main content
QUICK REVIEW

[论文解读] On the Importance of Difficulty Calibration in Membership Inference Attacks

Lauren Watson, Chuan Guo|arXiv (Cornell University)|Nov 15, 2021
Adversarial Robustness in Machine Learning被引用 13
一句话总结

本文提出难度校准作为一种后处理技术,通过将样本的成员身份得分与在同一数据分布上训练的参考模型的得分进行比较,以降低成员推理攻击中的假阳性率。该方法在不损失准确率的前提下,显著提升了攻击的精确率和AUC——最高提升0.10 AUC,使攻击在真实场景中更具可靠性,尤其在非成员远多于成员的情况下。

ABSTRACT

The vulnerability of machine learning models to membership inference attacks has received much attention in recent years. However, existing attacks mostly remain impractical due to having high false positive rates, where non-member samples are often erroneously predicted as members. This type of error makes the predicted membership signal unreliable, especially since most samples are non-members in real world applications. In this work, we argue that membership inference attacks can benefit drastically from \\emph{difficulty calibration}, where an attack's predicted membership score is adjusted to the difficulty of correctly classifying the target sample. We show that difficulty calibration can significantly reduce the false positive rate of a variety of existing attacks without a loss in accuracy.

研究动机与目标

  • 为解决现有成员推理攻击中高假阳性率(FPR)的问题,该问题在真实场景中(大多数样本为非成员)会损害攻击的可靠性。
  • 证明成员与非成员在成员身份得分分布上的重叠是导致基于得分的攻击出现高FPR的关键原因。
  • 提出难度校准作为一种通用技术,通过测量样本得分相对于在同一数据分布上训练的参考模型的得分,提升成员推理的可靠性。
  • 表明校准后的攻击在真阳性率与假阳性率之间实现了更优的权衡,尤其在成员与非成员比例较低时表现更优。
  • 在多种成员身份评分函数(置信度、损失、梯度范数)和基准数据集上评估难度校准的有效性。

提出的方法

  • 难度校准通过将目标模型的得分与在同一数据分布上训练的参考模型的得分进行比较,对样本的成员身份得分进行调整,从而有效衡量目标模型在该样本上相较于典型模型的难度提升程度。
  • 该方法采用“遗忘式校准”训练参考模型,通过遗忘特定数据点来实现,从而实现高效且准确的基线难度估计。
  • 对于每个样本,校准后的成员身份得分计算为:目标模型得分减去参考模型得分的平均值,从而增强成员与非成员得分分布之间的分离度。
  • 该方法适用于多种评分函数:置信度、负损失和梯度范数,展现出广泛的适用性。
  • 通过ROC曲线和精确率-召回率曲线评估该方法,使用AUC量化真阳性与假阳性之间的权衡。
  • 当具备白盒访问权限时,该方法计算效率高,因为它利用神经网络中的灾难性遗忘现象,避免从头重新训练参考模型。

实验结果

研究问题

  • RQ1难度校准是否能显著降低成员推理攻击的假阳性率,同时不降低攻击准确率?
  • RQ2在成员与非成员比例较低的真实数据分布下,校准攻击与未校准攻击的性能相比如何?
  • RQ3难度校准在多大程度上改善了成员推理攻击中精确率与召回率之间的权衡?
  • RQ4参考模型的数量及其训练数据集大小如何影响校准攻击的性能?
  • RQ5校准攻击在面对差分隐私模型时是否仍有效,尤其是在隐私参数ε较大的情况下?

主要发现

  • 难度校准在保持或提升攻击准确率的同时,显著降低了成员推理攻击的假阳性率,使攻击在真实场景中更具可靠性。
  • 校准后的损失得分攻击在CIFAR-10和ImageNet等标准基准上,相比未校准攻击,AUC最高提升0.10。
  • 即使在成员与非成员比例极低(如1:100)的情况下,校准攻击也能在低召回率下保持高精确率(如>0.9),而未校准攻击则难以实现高精确率。
  • 增加参考模型数量及其训练数据集大小可同时提升AUC与准确率,当参考模型数量从1增加到10时,AUC最高提升0.05,准确率最高提升0.03。
  • 校准攻击在面对差分隐私模型(ε=1000)时仍具有效性,能实现非平凡的精确率与召回率,而未校准攻击在相同条件下性能显著下降。
  • 对ε=1000的差分隐私设置下成功推断样本的手动检查未发现明显模式,表明漏洞并非仅限于极端异常值,而可能源于细微的记忆化效应。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。