Skip to main content
QUICK REVIEW

[论文解读] Do Gradient Inversion Attacks Make Federated Learning Unsafe?

Ali Hatamizadeh, Hongxu Yin|arXiv (Cornell University)|Feb 14, 2022
Privacy-Preserving Technologies in Data被引用 4
一句话总结

本文研究了联邦学习(FL)在医学影像领域中梯度反演攻击的实际风险,表明当批量归一化(BN)统计量在训练过程中更新时(这在现实世界的FL中很常见),此类攻击大多无效。本文提出了一种新型基线攻击,适用于这些现实条件,并提出了可量化的数据泄露度量方法,显示标准隐私保护技术(如差分隐私)能有效缓解风险,且不会造成严重的准确率损失。

ABSTRACT

Federated learning (FL) allows the collaborative training of AI models without needing to share raw data. This capability makes it especially interesting for healthcare applications where patient and data privacy is of utmost concern. However, recent works on the inversion of deep neural networks from model gradients raised concerns about the security of FL in preventing the leakage of training data. In this work, we show that these attacks presented in the literature are impractical in FL use-cases where the clients' training involves updating the Batch Normalization (BN) statistics and provide a new baseline attack that works for such scenarios. Furthermore, we present new ways to measure and visualize potential data leakage in FL. Our work is a step towards establishing reproducible methods of measuring data leakage in FL and could help determine the optimal tradeoffs between privacy-preserving techniques, such as differential privacy, and model accuracy based on quantifiable metrics. Code is available at https://nvidia.github.io/NVFlare/research/quantifying-data-leakage.

研究动机与目标

  • 评估梯度反演攻击在联邦学习中的现实可行性,特别是在数据隐私至关重要的医疗应用中。
  • 研究常见联邦学习实践(尤其是训练过程中更新批量归一化(BN)统计量)是否使现有梯度反演攻击失效。
  • 开发可复现、可量化的数据泄露测量与可视化方法,用于联邦学习系统。
  • 评估差分隐私(DP)和FedBN等隐私保护技术在缓解梯度反演风险方面的有效性。
  • 通过可测量的权衡关系,为联邦学习部署中隐私与模型准确率的平衡建立基础。

提出的方法

  • 作者设计了一种新型梯度反演攻击,能够考虑客户端训练期间BN统计量的更新,使其适用于现实的联邦学习场景。
  • 他们提出了一种新颖的可视化与度量框架,使用SSIM、IIP和相对变化度量(RDLV)来量化从重建梯度中泄露的数据。
  • 通过在模型更新中应用校准的高斯噪声机制,评估差分隐私(DP)的影响,并与DP-SGD进行比较。
  • 实验在使用ResNet-18的医学图像分类任务上进行,客户端以“训练模式”训练,以更新BN统计量。
  • 该框架在现实条件下评估了服务器端和客户端的梯度反演,包括大批次大小和多个本地训练轮次。
  • 作者通过深度特征嵌入分析重建质量,并在不同攻击与防御配置下比较结果。

实验结果

研究问题

  • RQ1在客户端训练期间更新批量归一化统计量的现实联邦学习环境中,梯度反演攻击在多大程度上能够成功?
  • RQ2在实际联邦学习部署中,如何对模型梯度中的数据泄露进行定量测量与可视化?
  • RQ3差分隐私和FedBN在现实联邦学习场景中缓解梯度反演攻击的有效性如何?
  • RQ4常见的联邦学习实践(如大批次大小和多个本地训练迭代)是否本质上降低了梯度反演的风险?
  • RQ5像SSIM、IIP和RDLV这样的定性与定量度量是否能可靠地检测或排除重建图像中的数据泄露?

主要发现

  • 在客户端训练期间更新批量归一化统计量的现实联邦学习环境中,梯度反演攻击失败,使先前的攻击方法失效。
  • 所提出的基线攻击仅在BN统计量未更新时能成功恢复训练数据,表明BN更新行为是攻击可行性的关键因素。
  • 使用校准高斯噪声的差分隐私显著减少了数据泄露,但更高的噪声水平会导致模型准确率的可测量下降。
  • DP-SGD提供的保护优于简单DP,但以更高的模型性能代价为代价,表明隐私与效用之间存在权衡。
  • SSIM值高但IIP得分低的重建图像不包含可识别或语义上有意义的信息,表明尽管相似度度量高,实际数据泄露有限。
  • 本研究发现,当前的度量方法(如SSIM)可能具有误导性;基于深度特征的相似度度量能更可靠地评估数据泄露风险。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。