Skip to main content
QUICK REVIEW

[论文解读] Gradient Masking and the Underestimated Robustness Threats of Differential Privacy in Deep Learning

Franziska Boenisch, Philip Sperl|arXiv (Cornell University)|May 17, 2021
Adversarial Robustness in Machine Learning参考文献 28被引用 8
一句话总结

本文研究了深度学习中差分隐私(DP)与对抗鲁棒性之间的权衡,表明使用DP-SGD训练会降低模型对对抗攻击的鲁棒性。研究发现,DP模型比非私有模型更易受攻击,且某些DP超参数的选择会导致梯度屏蔽,造成一种虚假的安全感,尽管模型实际更脆弱。

ABSTRACT

An important problem in deep learning is the privacy and security of neural networks (NNs). Both aspects have long been considered separately. To date, it is still poorly understood how privacy enhancing training affects the robustness of NNs. This paper experimentally evaluates the impact of training with Differential Privacy (DP), a standard method for privacy preservation, on model vulnerability against a broad range of adversarial attacks. The results suggest that private models are less robust than their non-private counterparts, and that adversarial examples transfer better among DP models than between non-private and private ones. Furthermore, detailed analyses of DP and non-DP models suggest significant differences between their gradients. Additionally, this work is the first to observe that an unfavorable choice of parameters in DP training can lead to gradient masking, and, thereby, results in a wrong sense of security.

研究动机与目标

  • 评估差分隐私(DP)训练对各类对抗攻击下模型鲁棒性的影响。
  • 探究对抗样本在私有模型与非私有模型之间转移的有效性是否存在差异。
  • 分析DP模型与非DP模型之间梯度的差异,以解释鲁棒性差异的原因。
  • 识别并验证DP-SGD在何种条件下会导致梯度屏蔽,从而误导鲁棒性评估。
  • 提供实证证据表明,尽管具备隐私保障,DP训练仍可能损害模型安全性。

提出的方法

  • 作者使用不同噪声水平和梯度裁剪范数的DP-SGD训练多个深度神经网络模型。
  • 采用涵盖基于梯度、无梯度及基于优化方法的全面对抗攻击套件来评估鲁棒性。
  • 通过测量私有模型与非私有模型之间对抗样本的可转移性,评估跨模型攻击的成功率。
  • 分析并比较DP模型与非DP模型的梯度,以识别影响鲁棒性的结构差异。
  • 应用既定的梯度屏蔽判定标准,验证特定DP超参数配置下是否存在梯度屏蔽现象。
  • 开展消融研究,以分离噪声尺度与裁剪范数对模型脆弱性及梯度行为的影响。

实验结果

研究问题

  • RQ1与非私有模型相比,使用DP-SGD训练是否降低了深度神经网络的对抗鲁棒性?
  • RQ2私有模型与非私有模型之间的对抗样本可转移性有何差异?
  • RQ3模型梯度在解释DP模型脆弱性增加方面起到何种作用?
  • RQ4在何种DP-SGD超参数设置下会发生梯度屏蔽?其如何误导鲁棒性评估?
  • RQ5DP模型中的梯度屏蔽能否解释先前研究中报告的、看似积极的鲁棒性结果?

主要发现

  • 在高噪声水平和大裁剪范数下,DP模型对对抗攻击的鲁棒性显著低于非私有模型。
  • 对抗样本从非私有模型向私有模型的转移比反向更有效,表明私有模型更容易受到迁移攻击。
  • DP模型之间的可转移性高于私有模型与非私有模型之间,表明DP模型共享更多可转移的对抗性特征。
  • DP训练导致梯度幅值更大,且零梯度比例更高,这可能解释了其脆弱性增加的原因。
  • DP-SGD中特定的噪声尺度与裁剪范数组合会故意引发梯度屏蔽,造成鲁棒性增强的虚假感知。
  • 研究证实,在特定超参数设置下,DP模型中存在梯度屏蔽现象,验证了其作为鲁棒性评估中混淆因素的作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。