Skip to main content
QUICK REVIEW

[论文解读] Hidden Poison: Machine Unlearning Enables Camouflaged Poisoning Attacks

Jimmy Z. Di, Jack F. Douglas|arXiv (Cornell University)|Dec 21, 2022
Adversarial Robustness in Machine Learning被引用 7
一句话总结

本文提出了一种隐蔽的数据中毒攻击,攻击者在训练集中注入隐蔽的毒化数据点和伪装数据点,以逃避检测。模型训练完成后,通过撤销学习请求移除伪装点,从而触发目标错误分类——该方法在CIFAR-10、Imagenette和Imagewoof上通过基于梯度匹配的中毒攻击得到了有效验证。

ABSTRACT

We introduce camouflaged data poisoning attacks, a new attack vector that arises in the context of machine unlearning and other settings when model retraining may be induced. An adversary first adds a few carefully crafted points to the training dataset such that the impact on the model's predictions is minimal. The adversary subsequently triggers a request to remove a subset of the introduced points at which point the attack is unleashed and the model's predictions are negatively affected. In particular, we consider clean-label targeted attacks (in which the goal is to cause the model to misclassify a specific test point) on datasets including CIFAR-10, Imagenette, and Imagewoof. This attack is realized by constructing camouflage datapoints that mask the effect of a poisoned dataset.

研究动机与目标

  • 揭示在支持数据撤销学习的动态机器学习流水线中一种新的攻击向量。
  • 证明攻击者可将毒化点隐藏在伪装点中,从而在训练期间逃避检测。
  • 表明本应提升隐私的撤销学习请求,可能被利用以激活隐藏的毒化效应。
  • 评估该攻击在数据增强、随机删除以及模型可迁移性条件下的鲁棒性。
  • 探索此类攻击在精确撤销学习与近似撤销学习设置下的可行性与影响。

提出的方法

  • 该攻击分为两个阶段:首先在模型训练前将毒化点和伪装点添加到训练数据中。
  • 利用梯度匹配技术生成伪装点,以抵消毒化点的影响,确保模型行为与干净训练时保持相似。
  • 在包含干净数据、毒化点和伪装点的增强数据集上训练模型,使模型在目标点上保持高准确率。
  • 训练完成后,触发撤销学习请求以移除伪装集合,仅保留毒化点和干净数据。
  • 由此产生的模型因毒化点的残留效应而表现出目标错误分类,此时毒化点已不再被伪装。
  • 该方法利用在新样本上的模型梯度查询,在毒化点/伪装点生成阶段需要对目标模型具备灰盒访问权限。

实验结果

研究问题

  • RQ1能否在训练集中隐藏数据中毒,使得模型在训练期间表现正常,但在撤销学习后性能下降?
  • RQ2当受害模型与生成毒化点和伪装点所用的模型不同时,该攻击的有效性如何?
  • RQ3在数据增强和随机删除毒化点/伪装点样本的情况下,该攻击是否仍有效?
  • RQ4能否通过在多个目标图像上应用梯度匹配,将该攻击扩展到多目标场景?
  • RQ5在近似撤销学习设置下(即模型未从头重新训练),该攻击是否依然有效?

主要发现

  • 隐蔽毒化攻击在执行撤销学习后,成功在CIFAR-10、Imagenette和Imagewoof上引发目标错误分类。
  • 该攻击在数据增强以及生成的毒化点和伪装点样本被随机删除的情况下仍保持鲁棒性。
  • 当受害模型与生成毒化点和伪装点所用的模型不同时,该攻击表现出强大的可迁移性。
  • 消融实验表明,攻击的成功依赖于毒化点与伪装点集合大小的平衡,最优性能出现在特定的 $b_p$ 和 $b_c$ 值处。
  • 即使撤销学习是通过从头重新训练实现的,该攻击依然有效,表明若最终模型与重新训练模型在统计上不可区分,则该攻击在近似撤销学习下也应有效。
  • 该攻击并非黑盒攻击,因其需要从受害模型获取梯度查询,表明未来需进一步研究黑盒变体。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。