Skip to main content
QUICK REVIEW

[论文解读] Canary in a Coalmine: Better Membership Inference with Ensembled Adversarial Queries

Yuxin Wen, Arpit Bansal|arXiv (Cornell University)|Oct 19, 2022
Adversarial Robustness in Machine Learning被引用 6
一句话总结

本文提出 Canary 攻击,一种新颖的黑盒成员推理方法,通过使用经过优化的集成对抗查询,以最大程度区分训练时包含与不包含目标数据点的模型。与依赖简单数据增强的现有方法不同,该方法通过对抗性地构建具有区分性的查询,在低假阳性率场景下表现出色,尤其在法律执行中至关重要的低误报率条件下,超越了多种数据集、模型架构甚至差分隐私保护下的先前方法,达到当前最优性能。

ABSTRACT

As industrial applications are increasingly automated by machine learning models, enforcing personal data ownership and intellectual property rights requires tracing training data back to their rightful owners. Membership inference algorithms approach this problem by using statistical techniques to discern whether a target sample was included in a model's training set. However, existing methods only utilize the unaltered target sample or simple augmentations of the target to compute statistics. Such a sparse sampling of the model's behavior carries little information, leading to poor inference capabilities. In this work, we use adversarial tools to directly optimize for queries that are discriminative and diverse. Our improvements achieve significantly more accurate membership inference than existing methods, especially in offline scenarios and in the low false-positive regime which is critical in legal settings. Code is available at https://github.com/YuxinWenRick/canary-in-a-coalmine.

研究动机与目标

  • 为解决在现实法律与监管场景中模型权重通常不可访问的背景下,有效实施成员推理的迫切需求。
  • 克服现有成员推理攻击仅依赖原始数据点或基础增强方法的局限性,这些方法导致模型行为采样稀疏且信息量不足。
  • 开发一种方法,生成高度具有区分性的、经对抗性优化的查询,能够可靠检测目标样本是否存在于模型的训练集中。
  • 评估这些对抗性查询在不同数据集、模型架构以及差分隐私等隐私防御机制下的鲁棒性与可迁移性。
  • 为数据所有者和监管机构提供一种实用工具,以验证是否符合数据所有权权利,例如 GDPR 中的“被遗忘权”。

提出的方法

  • 该方法构建对抗性查询——经过扰动的输入——专门针对最大化在包含与不包含目标数据点的模型之间输出差异而优化。
  • 采用基于梯度的优化过程生成最具区分性的查询向量,重点优化预-softmax logits 和 Carlini-Wagner (CW) 损失目标函数以实现最佳性能。
  • 通过训练此类对抗性查询的集成模型,提升在不同模型架构和数据集上的鲁棒性与泛化能力。
  • 利用可迁移性,通过在影子模型上训练查询并将之迁移到目标模型,即使无法访问目标模型的权重也能实现有效攻击。
  • 优化目标聚焦于模型的置信度和输出 logits,其中预-softmax logits 在在线和离线设置下均表现出最强的性能提升。
  • 通过应用范数裁剪和噪声注入,在差分隐私条件下评估该方法的性能退化与可迁移性。

实验结果

研究问题

  • RQ1与标准数据增强相比,经对抗性优化的查询是否能在黑盒设置下显著提升成员推理性能?
  • RQ2在目标模型采用差分隐私训练的情况下,集成对抗性查询在检测成员身份方面的有效性如何?
  • RQ3在不同模型架构和数据集上,哪种优化目标(如预-softmax logits、CW 损失)能提供最鲁棒且最准确的成员推理?
  • RQ4在无白盒访问权限的情况下,于影子模型上训练的对抗性查询在未见目标模型上的可迁移性如何?
  • RQ5所提方法能否在低假阳性率下实现高真正例率——这在法律应用中至关重要,而先前方法在此方面表现不佳?

主要发现

  • 在离线设置下,Canary 攻击在 1% 假阳性率下的真正例率(TPR@1% FPR)达到 21.98%,显著优于基线方法 LiRA 的 9.85%。
  • 在离线设置下,表现最佳的优化目标——直接最大化预-softmax logits——实现 TPR@1% FPR 为 12.60%,较次优方法提升 2.75%。
  • 在差分隐私设置下(ε=100),Canary 攻击将 TPR@1% FPR 从 LiRA 的 1.18% 提升至 1.81%,表明其对隐私保护防御具有更强的鲁棒性。
  • 该方法在三个数据集(CIFAR-10、SVHN、CelebA)、四种模型架构(ResNet-18、WideResNet、DenseNet、VGG)以及在线和离线成员推理场景中均持续提升性能。
  • 即使在强差分隐私保护下(ε=100),目标模型的测试准确率从 88% 降至 44%,Canary 攻击仍显著优于基线方法,表明其具备强大鲁棒性。
  • 尽管未显式抑制非目标类别置信度,使用预-softmax logits 作为优化目标仍带来最大性能提升,表明其在捕捉与成员身份相关信号方面具有高度有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。