Skip to main content
QUICK REVIEW

[论文解读] Deep Leakage from Gradients

Ligeng Zhu, Zhijian Liu|arXiv (Cornell University)|Jun 21, 2019
Adversarial Robustness in Machine Learning参考文献 36被引用 20
一句话总结

本文提出深度梯度泄露(Deep Leakage from Gradients, DLG),一种基于优化的攻击方法,能够从分布式机器学习中共享的梯度中精确重构出私有训练数据——包括图像和文本。该方法通过迭代优化虚拟输入和标签,使其与真实梯度匹配,仅需几步即可实现像素级和词元级的精确恢复,暴露了梯度共享系统中关键的隐私漏洞。

ABSTRACT

Exchanging gradients is a widely used method in modern multi-node machine learning system (e.g., distributed training, collaborative learning). For a long time, people believed that gradients are safe to share: i.e., the training data will not be leaked by gradient exchange. However, we show that it is possible to obtain the private training data from the publicly shared gradients. We name this leakage as Deep Leakage from Gradient and empirically validate the effectiveness on both computer vision and natural language processing tasks. Experimental results show that our attack is much stronger than previous approaches: the recovery is pixel-wise accurate for images and token-wise matching for texts. We want to raise people's awareness to rethink the gradient's safety. Finally, we discuss several possible strategies to prevent such deep leakage. The most effective defense method is gradient pruning.

研究动机与目标

  • 探究分布式机器学习中共享梯度是否可能泄露私有训练数据。
  • 开发一种无需依赖生成模型或先验数据知识的方法,从梯度中重构出精确的训练样本(输入和标签)。
  • 评估基于梯度的数据重构在视觉和语言任务中的可行性和有效性。
  • 识别并分析可防止此类深度泄露的防御策略,同时保持模型实用性。

提出的方法

  • 该攻击采用一种优化框架,将输入数据和标签视为可学习变量,并随机初始化。
  • 对虚拟数据执行前向和反向传播以计算梯度,然后最小化这些梯度与模型真实梯度之间的L2距离。
  • 通过交替更新虚拟输入和标签以匹配真实梯度,使优化过程收敛至原始训练样本。
  • 该方法迭代应用,直至重构出的输入和标签与原始数据无法区分。
  • 该方法无需任何生成模型、类别标签或先验数据分布假设。
  • 通过添加高斯噪声或拉普拉斯噪声的梯度扰动、低精度表示(fp16、bfloat16、int8)以及梯度稀疏化(剪枝)来评估防御效果。

实验结果

研究问题

  • RQ1在分布式机器学习系统中,能否从公开共享的梯度中重构出私有训练数据?
  • RQ2是否仅利用梯度信息即可恢复出精确的输入样本(而非仅合成近似值)?
  • RQ3常见的防御措施如梯度噪声、量化和稀疏化在缓解此攻击方面的有效性如何?
  • RQ4在存在基于梯度的数据泄露时,模型准确率与防御有效性的权衡关系是什么?

主要发现

  • DLG在图像分类任务中实现了像素级准确的训练数据恢复,在掩码语言建模任务中实现了词元级的精确匹配。
  • 该攻击仅需数百次优化步骤即可完成完整数据重构,展现出极高的效率和有效性。
  • 当噪声尺度大于10^-2时(高斯或拉普拉斯噪声),梯度扰动可有效防止攻击,而较低尺度则无效。
  • 半精度格式(fp16、bfloat16)无法防御DLG攻击,因为即使精度降低,攻击仍具有效性。
  • 当剪枝稀疏度达到20%或以上时,梯度稀疏化可成功防止数据泄露,且稀疏度越高(如99%)越有效,但会降低模型准确率。
  • 整数量化(int8)可有效防御攻击,但会导致显著的准确率下降(在CIFAR-100上降至53.7%),表明存在强烈的权衡关系。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。