[论文解读] User-Level Membership Inference Attack against Metric Embedding Learning
本文提出了一种针对度量嵌入模型的用户级成员推理攻击,利用潜在空间中的聚类紧密度来判断目标用户是否有任何图像被用于训练——而无需访问确切的训练样本。该方法通过使用到聚类中心的平均距离和平均成对距离作为特征,在未访问确切训练样本的情况下,实现了最先进(SOTA)的准确率(在Market-1501上高达91.73%),甚至在现实约束条件下也优于现有攻击方法。
Membership inference (MI) determines if a sample was part of a victim model training set. Recent development of MI attacks focus on record-level membership inference which limits their application in many real-world scenarios. For example, in the person re-identification task, the attacker (or investigator) is interested in determining if a user's images have been used during training or not. However, the exact training images might not be accessible to the attacker. In this paper, we develop a user-level MI attack where the goal is to find if any sample from the target user has been used during training even when no exact training sample is available to the attacker. We focus on metric embedding learning due to its dominance in person re-identification, where user-level MI attack is more sensible. We conduct an extensive evaluation on several datasets and show that our approach achieves high accuracy on user-level MI task.
研究动机与目标
- 为解决记录级成员推理攻击的实际局限性,后者需要访问确切的训练样本——这在实际应用场景(如行人重识别)中并不现实。
- 开发一种用户级成员推理攻击,以判断目标用户是否有任何图像被用于训练,即使没有确切的训练样本可用。
- 克服将基于置信度的成员推理攻击应用于度量嵌入学习的挑战,因为后者输出中缺乏置信度分数。
- 设计一种方法,利用潜在空间的结构特性,特别是聚类紧密度,以实现在度量嵌入模型中的有效成员推理。
提出的方法
- 该攻击使用两个关键特征:目标用户非训练图像到聚类中心(C_u)的平均距离,以及这些图像之间成对距离的平均值(P_u),均在潜在空间中计算。
- 该方法假设:若某用户的数据被用于训练,则其图像在嵌入空间中会形成更紧密的聚类,该假设已在多个数据集上得到经验验证。
- 该攻击利用这些紧密度特征构建二分类器,以预测目标用户是否有任何图像属于训练集。
- 该方法对训练期间未知的数据增强具有鲁棒性,因为它不依赖于模型置信度或特定增强模式。
- 当适配至用户级设置时,其性能优于现有记录级攻击(如EncoderMI),尤其是在攻击者不了解训练增强方式的情况下。
- 该方法在Market-1501和PRID-201上进行了评估,即使仅提供目标用户的非训练图像,也表现出高准确率。
实验结果
研究问题
- RQ1在无法获取确切训练样本的情况下,是否能有效在度量嵌入模型中应用用户级成员推理攻击?
- RQ2在缺乏传统分类攻击中所用置信度分数的度量嵌入学习中,如何实现成员推理?
- RQ3目标用户在潜在空间中的聚类紧密度是否与训练集成员身份相关联?该关联能否被用于推理?
- RQ4在攻击者知识水平不同的情况下,所提出的用户级攻击性能与适配后的记录级攻击(如EncoderMI)相比如何?
- RQ5对训练图像的部分访问如何影响用户级成员推理的准确率?
主要发现
- 当仅提供目标用户非训练图像时,所提出的用户级成员推理攻击在Market-1501上达到66.87%的准确率,在PRID-201上达到74.27%。
- 当攻击者可访问75%的训练图像时,攻击准确率在Market-1501上提升至90.00%,在PRID-201上为78.40%。
- 当完全访问训练图像(100%)时,攻击在Market-1501上达到91.73%的准确率,在PRID-201上为78.07%,且Market-1501的精确度达到100.0%。
- 消融研究显示,同时使用两种紧密度特征(C_u和P_u)可获得最高准确率(Market-1501上为66.87%),尽管单独使用任一特征也表现良好。
- 即使EncoderMI完全掌握训练增强信息,本方法仍表现更优,证明了聚类紧密度方法的优越性。
- 在攻击者对数据增强知识有限的现实条件下,该方法依然有效,而基于置信度的攻击在度量嵌入设置中则会失效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。