Skip to main content
QUICK REVIEW

[论文解读] Indiscriminate Data Poisoning Attacks on Neural Networks

Yiwei Lu, Gautam Kamath|arXiv (Cornell University)|Apr 19, 2022
Adversarial Robustness in Machine Learning被引用 6
一句话总结

本文提出了一种新颖且高效的深度神经网络数据投毒攻击方法,采用二阶优化的全梯度下降-上升法(TGDA),可一次性生成数千个投毒样本。与以往的串行方法相比,该方法在攻击效果和速度上均有显著提升,同时对防御机制表现出强鲁棒性,且生成的投毒数据在视觉上与真实数据完全无法区分。

ABSTRACT

Data poisoning attacks, in which a malicious adversary aims to influence a model by injecting "poisoned" data into the training process, have attracted significant recent attention. In this work, we take a closer look at existing poisoning attacks and connect them with old and new algorithms for solving sequential Stackelberg games. By choosing an appropriate loss function for the attacker and optimizing with algorithms that exploit second-order information, we design poisoning attacks that are effective on neural networks. We present efficient implementations that exploit modern auto-differentiation packages and allow simultaneous and coordinated generation of tens of thousands of poisoned points, in contrast to existing methods that generate poisoned points one by one. We further perform extensive experiments that empirically explore the effect of data poisoning attacks on deep neural networks.

研究动机与目标

  • 解决非凸深度神经网络中无差别数据投毒攻击缺乏系统性分析的问题。
  • 克服现有串行投毒方法在大规模模型与数据集上计算不可行的问题。
  • 设计一种可扩展、高效的攻击架构,实现在单次前向传播中同时生成数万个投毒数据点。
  • 评估所提攻击对各类数据清洗与防御机制的鲁棒性。
  • 为现代神经网络建立无差别数据投毒的新基准。

提出的方法

  • 将数据投毒攻击建模为非零和Stackelberg博弈,攻击者作为领导者,通过生成投毒数据以最小化防御者的测试准确率。
  • 采用全梯度下降-上升法(TGDA)利用二阶信息优化攻击者目标函数,实现对数千个投毒样本的高效联合优化。
  • 将攻击者参数化为独立的神经网络,支持端到端训练,并在单次前向传播中同时生成投毒数据点。
  • 在无法获取防御者模型完整信息时,使用代理模型模拟防御者的训练过程。
  • 在干净标签设置下应用攻击,确保投毒样本在视觉上与真实数据无法区分。
  • 采用统一架构,支持零和与非零和形式,提升攻击设计的灵活性。

实验结果

研究问题

  • RQ1像TGDA这样的二阶优化技术能否显著提升深度神经网络数据投毒攻击的效率与有效性?
  • RQ2与串行方法相比,所提出的投毒样本并行生成方式在攻击速度与成功率方面表现如何?
  • RQ3TGDA攻击对常见数据清洗防御机制(如基于损失的过滤、影响函数移除、基于梯度的异常检测)的鲁棒性如何?
  • RQ4当攻击者对防御者模型了解有限、依赖代理模型时,该攻击的有效性如何?
  • RQ5所提方法能否生成在不被数据审核者察觉的同时仍能降低模型性能的干净标签投毒数据?

主要发现

  • 与现有最先进投毒方法相比,TGDA攻击的训练速度至少快一个数量级,可在单次前向传播中生成数万个投毒样本。
  • 在CIFAR-10数据集上,对ResNet-18模型,当投毒预算ε=5%时,TGDA可将测试准确率降低高达40%,显著优于现有方法。
  • 该攻击对基于损失的防御机制(如移除损失最高的前3%训练样本)具有鲁棒性,性能与显式约束样本可检测性的pGAN相当。
  • 该攻击对基于影响函数的防御机制具有鲁棒性,但被Sever防御显著削弱,该防御通过移除梯度矩阵中奇异值较高的样本实现。
  • MaxUp数据增强防御对TGDA攻击无效,因为攻击者可预见到模型将被重新训练,这一点与对抗样本场景不同。
  • TGDA生成的投毒样本在视觉上与干净数据完全无法区分,证实了该攻击作为干净标签投毒方法的成功。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。