[论文解读] Bounding Training Data Reconstruction in Private (Deep) Learning
该论文为不同差分隐私机器学习中的训练数据重建攻击提供了新颖的语义隐私保障。研究证明,Rényi差分隐私(RDP)和Fisher信息泄漏(FIL)核算均能对攻击者重建的均方误差(MSE)提供强有力的下界,表明即使在高实用性下,私有模型——尤其是FIL下的模型——也能保护大多数训练样本,且MSE下界比仅使用RDP时紧得多,数量级上更优。
Differential privacy is widely accepted as the de facto method for preventing data leakage in ML, and conventional wisdom suggests that it offers strong protection against privacy attacks. However, existing semantic guarantees for DP focus on membership inference, which may overestimate the adversary's capabilities and is not applicable when membership status itself is non-sensitive. In this paper, we derive the first semantic guarantees for DP mechanisms against training data reconstruction attacks under a formal threat model. We show that two distinct privacy accounting methods -- Renyi differential privacy and Fisher information leakage -- both offer strong semantic protection against data reconstruction attacks.
研究动机与目标
- 填补语义隐私保障在数据重建攻击(DRAs)中的空白,因为DRAs比成员推断攻击更具威力。
- 提供可解释的、定量的隐私保障,以限制攻击者从私有模型中重建训练数据的能力。
- 表明现有的隐私核算方法(如RDP和FIL)即使在成员身份不敏感的情况下,也能对DRAs提供有意义的保护。
- 通过实证验证,FIL提供的隐私边界比RDP更紧、更现实,尤其对单个训练样本而言。
- 将Fisher信息泄漏(FIL)核算扩展至私有SGD,并证明其在估计每样本隐私泄漏方面的实用性。
提出的方法
- 推导出在$(2,\epsilon)$-Rényi差分隐私下,攻击者重建的期望均方误差(MSE)的下界,表明其随$\Theta(1/(e^{\epsilon}-1})$变化。
- 首次将Fisher信息泄漏(FIL)应用于私有学习,利用Fisher信息矩阵(FIM)来估计每样本的隐私泄漏。
- 提出一种可微分FIL(dFIL)核算器,通过随机坐标采样和子采样边界近似FIM,从而可扩展至深度学习模型。
- 利用Cramér-Rao下界将FIM的逆与无偏估计器的最小可实现MSE联系起来,从而实现隐私保障。
- 在MNIST和CIFAR-10上,通过在超参数空间进行网格搜索,使用RDP和dFIL边界评估隐私-效用权衡。
- 通过将dFIL估计与CIFAR-10单个图像的实际重建脆弱性进行相关性分析,对边界进行实证验证。
实验结果
研究问题
- RQ1Rényi差分隐私能否为数据重建攻击提供有意义的语义保障?
- RQ2与RDP相比,Fisher信息泄漏(FIL)能否为私有学习模型提供更紧致且更易解释的隐私边界?
- RQ3dFIL估计的每样本隐私泄漏与实际数据重建攻击脆弱性之间有何相关性?
- RQ4现有私有学习算法在高$\epsilon$下,对单个训练样本的信息泄漏程度如何,即使在高隐私预算下?
- RQ5dFIL核算能否在私有SGD等深度学习模型中支持稳健的隐私-效用权衡?
主要发现
- 基于RDP的MSE下界随$\Theta(1/(e^{\epsilon}-1})$变化,表明当$\epsilon$较小时,重建误差保持较高,因此隐私得到良好保护。
- 基于dFIL的MSE下界在相似模型准确率下比RDP边界高多个数量级,表明隐私保障显著更强。
- 在MNIST上,模型在达到97%测试准确率之前不会越过dFIL隐私阈值,表明在高实用性下仍具有强大保护。
- 在CIFAR-10上,dFIL边界在64%测试准确率时仍保持非可忽略($\texttt{MSE} \geq 0.1$),而RDP边界更早越过阈值。
- 即使在高模型准确率下,训练集中的dFIL中位数仍保持较高,表明大多数样本仍能抵御重建攻击。
- 高dFIL值的样本通常为难分类图像,而低dFIL样本为典型且易识别图像,证实了dFIL与重建脆弱性之间的相关性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。