Skip to main content
QUICK REVIEW

[论文解读] Amplifying Membership Exposure via Data Poisoning

Yufei Chen, Chao Shen|arXiv (Cornell University)|Nov 1, 2022
Adversarial Robustness in Machine Learning被引用 8
一句话总结

本文提出了一种新颖的数据投毒攻击方法,通过微妙地操纵训练数据,显著放大机器学习模型中的成员推理暴露风险。该研究引入了一种通用的脏标签攻击,以及一种隐蔽的基于优化的干净标签攻击,可在保持模型准确率的同时,显著提高针对特定类别的成员推理攻击精度。

ABSTRACT

As in-the-wild data are increasingly involved in the training stage, machine learning applications become more susceptible to data poisoning attacks. Such attacks typically lead to test-time accuracy degradation or controlled misprediction. In this paper, we investigate the third type of exploitation of data poisoning - increasing the risks of privacy leakage of benign training samples. To this end, we demonstrate a set of data poisoning attacks to amplify the membership exposure of the targeted class. We first propose a generic dirty-label attack for supervised classification algorithms. We then propose an optimization-based clean-label attack in the transfer learning scenario, whereby the poisoning samples are correctly labeled and look "natural" to evade human moderation. We extensively evaluate our attacks on computer vision benchmarks. Our results show that the proposed attacks can substantially increase the membership inference precision with minimum overall test-time model performance degradation. To mitigate the potential negative impacts of our attacks, we also investigate feasible countermeasures.

研究动机与目标

  • 研究数据投毒与隐私泄露的交叉影响,特别是投毒如何放大成员推理攻击。
  • 开发实用且隐蔽的数据投毒技术,能够在不被检测的情况下增加训练数据中的隐私暴露风险。
  • 在多种模型架构和数据集上,于不同训练设置下评估这些攻击的有效性。
  • 评估现有防御措施(如早停、正则化和DP-SGD)对所提攻击的鲁棒性。
  • 强调开放世界数据收集在通过干净标签投毒实现隐私保护攻击方面的现实威胁。

提出的方法

  • 提出一种通用的脏标签数据投毒攻击,通过修改恶意样本的标签,以提高目标类别上的成员推理精度。
  • 在迁移学习设置中开发一种基于优化的干净标签投毒攻击,使投毒样本在视觉上难以察觉,但保持正确标签。
  • 采用双层优化框架,生成能够最大化成员推理成功率同时最小化测试准确率下降的投毒样本。
  • 通过特征级优化生成外观自然的图像,对人类审核员而言看似无害,但能增强模型对目标类别成员身份的记忆。
  • 在多个计算机视觉基准数据集(CIFAR-10、ImageNet)上,使用多种架构(InceptionV3、MobileNetV2等)和训练配置应用攻击。
  • 使用标准指标评估攻击效果:成员推理AUC和FPR=1%时的真正率(TPR),同时监控测试准确率。

实验结果

研究问题

  • RQ1数据投毒是否能够超越传统模型准确率下降或误分类的范畴,进一步放大成员推理攻击?
  • RQ2在不降低模型性能的前提下,干净标签投毒攻击在提升成员推理精度方面的有效性如何?
  • RQ3标准防御措施(如早停、权重正则化和DP-SGD)在多大程度上能缓解所提出的投毒攻击?
  • RQ4在不同模型架构和数据集上,攻击性能如何随投毒预算的变化而变化?
  • RQ5干净标签投毒攻击是否能在规避人类审核的同时,仍显著增加隐私泄露风险?

主要发现

  • 所提出的脏标签投毒攻击在InceptionV3上将成员推理AUC从0.598提升至0.621,在VGG16上从0.561提升至0.571,且测试准确率下降极小。
  • 干净标签攻击在VGG16上将成员推理TPR@FPR=1%从1.12%提升至1.29%,在ResNet50上从0.88%提升至1.08%,同时保持测试准确率高于80%。
  • 即使在DP-SGD等强防御机制下,干净标签攻击仍使Xception的成员推理AUC提升至0.541,VGG16提升至0.538,表明这些防御措施效果有限。
  • 攻击在多种架构(InceptionV3、MobileNetV2、Xception、VGG16、ResNet50)和数据集(CIFAR-10、ImageNet)上均保持有效,显示出广泛适用性。
  • 干净标签攻击在迁移学习设置中尤为有效,因其无需控制标注过程,且对人类观察者而言外观自然。
  • 攻击在仅造成测试性能轻微下降的情况下实现了显著的隐私放大,凸显了模型效用与数据隐私之间的强烈权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。