Skip to main content
QUICK REVIEW

[论文解读] DP-InstaHide: Provably Defusing Poisoning and Backdoor Attacks with Differentially Private Data Augmentations

Eitan Borgnia, Jonas Geiping|arXiv (Cornell University)|Mar 2, 2021
Privacy-Preserving Technologies in Data参考文献 36被引用 17
一句话总结

该论文提出DP-InstaHide,一种新颖的防御方法,结合mixup数据增强与拉普拉斯噪声,可证明地增强差分隐私性,并提升对数据投毒攻击和后门攻击的鲁棒性。通过利用k-way mixup,该方法相比标准差分私密训练,实现了至少k倍更强的隐私保障,同时保持了高模型准确率,并在实证上优于现有防御方法。

ABSTRACT

Data poisoning and backdoor attacks manipulate training data to induce security breaches in a victim model. These attacks can be provably deflected using differentially private (DP) training methods, although this comes with a sharp decrease in model performance. The InstaHide method has recently been proposed as an alternative to DP training that leverages supposed privacy properties of the mixup augmentation, although without rigorous guarantees. In this work, we show that strong data augmentations, such as mixup and random additive noise, nullify poison attacks while enduring only a small accuracy trade-off. To explain these finding, we propose a training method, DP-InstaHide, which combines the mixup regularizer with additive noise. A rigorous analysis of DP-InstaHide shows that mixup does indeed have privacy advantages, and that training with k-way mixup provably yields at least k times stronger DP guarantees than a naive DP mechanism. Because mixup (as opposed to noise) is beneficial to model performance, DP-InstaHide provides a mechanism for achieving stronger empirical performance against poisoning attacks than other known DP methods.

研究动机与目标

  • 解决在未经清理的网络爬取数据上训练的机器学习系统中日益严重的数据投毒与后门攻击威胁。
  • 为此前缺乏正式隐私依据的数据增强技术(如mixup)提供严格的差分隐私保障。
  • 通过结合mixup与加性噪声,改进防御训练中的鲁棒性-准确率权衡,优于标准差分私密方法。
  • 证明强数据增强本身具有隐私优势,从而实现性能退化最小的可证明防御。

提出的方法

  • 该方法引入k-way mixup,其中每个训练样本是数据集中k个随机数据点的凸组合,使数据集中于单位超立方体的中心区域。
  • 向混合样本添加拉普拉斯噪声以确保差分隐私,噪声尺度根据目标隐私预算进行调整。
  • 理论分析证明,与标准DP机制相比,k-way mixup可使隐私保障提升k倍,即ε值减少k倍。
  • 该方法被扩展至其他增强方式(如CutMix和MaxUp),通过添加噪声以提升鲁棒性。
  • 利用差分隐私的可组合性,考虑多个训练步骤和数据点的影响。
  • 实证评估采用在CIFAR-10上训练的ResNet-18模型,通过梯度匹配攻击测试在自适应威胁模型下的防御有效性。

实验结果

研究问题

  • RQ1像mixup这样的强数据增强是否能对数据投毒攻击提供可证明的差分隐私保障?
  • RQ2将mixup与加性噪声结合是否比仅使用噪声提供更强的隐私保护?增强幅度如何?
  • RQ3与标准差分私密训练相比,k-way mixup机制在隐私-准确率权衡方面有何改进?
  • RQ4mixup的隐私优势是否可推广至其他增强方法(如CutMix和MaxUp)?
  • RQ5基于定理2推导出的理论隐私边界是否能准确预测在自适应投毒攻击下的实际防御性能?

主要发现

  • k-way mixup使差分隐私保障至少提升k倍,即相比标准DP训练,隐私预算ε减少k倍。
  • 理论分析证实,仅mixup本身即具备隐私优势;当与拉普拉斯噪声结合时,防御可实现更强隐私保障,且准确率损失极小。
  • 实证结果表明,使用拉普拉斯噪声(尺度16/255)的MaxUp在CIFAR-10上可完全抵御自适应梯度匹配投毒攻击。
  • 基于定理2推导的理论隐私边界能准确预测实际防御性能,验证了模型的可靠性。
  • 该方法在鲁棒性与准确率方面均优于标准DP训练,展现出适用于实际部署的有利权衡。
  • mixup的隐私优势不仅限于原始InstaHide方法,后者因缺乏正式保障而后来被攻破,而本方法则提供了形式化证明。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。