[论文解读] Measuring Data Leakage in Machine-Learning Models with Fisher Information
本文提出Fisher信息损失(FIL)作为一种相关性感知、样本特定的度量方法,用于量化机器学习模型中的数据泄露问题,利用Cramér-Rao不等式来限制攻击者推断能力。结果表明,FIL能准确捕捉对属性反演攻击的脆弱性,并通过迭代重加权(IRFIL)实现公平隐私保护,在不降低模型效用的前提下实现个体间泄露的均衡化。
Machine-learning models contain information about the data they were trained on. This information leaks either through the model itself or through predictions made by the model. Consequently, when the training data contains sensitive attributes, assessing the amount of information leakage is paramount. We propose a method to quantify this leakage using the Fisher information of the model about the data. Unlike the worst-case a priori guarantees of differential privacy, Fisher information loss measures leakage with respect to specific examples, attributes, or sub-populations within the dataset. We motivate Fisher information loss through the Cramér-Rao bound and delineate the implied threat model. We provide efficient methods to compute Fisher information loss for output-perturbed generalized linear models. Finally, we empirically validate Fisher information loss as a useful measure of information leakage.
研究动机与目标
- 为解决差分隐私等最坏情况隐私保证的局限性,后者未考虑个体或子群体的脆弱性。
- 开发一种灵活的、样本特定的信息泄露度量方法,能够考虑数据相关性及攻击者能力的差异。
- 通过均衡子群体间泄露程度,实现隐私公平性,尤其解决对推理攻击的非均衡脆弱性问题。
- 验证FIL作为对属性反演攻击和成员推断攻击敏感度的可靠代理指标。
- 设计并评估一种迭代重加权算法(IRFIL),以在训练过程中平衡各训练样本的Fisher信息损失。
提出的方法
- Fisher信息损失(FIL)定义为Cramér-Rao下界对估计量方差的负对数,用于量化模型可能泄露的关于特定数据点的最大信息量。
- 该方法在输出扰动的广义线性模型且具有高斯噪声的假设下,推导出FIL的可计算闭式表达式,从而实现高效计算。
- 采用白盒与黑盒属性反演攻击框架,评估FIL与实际攻击成功率的相关性。
- 提出Fisher信息损失的迭代重加权(IRFIL),通过在训练过程中调整样本权重,实现个体间泄露的均衡化。
- 利用Cramér-Rao不等式证明,有限的FIL可限制攻击者对原始数据属性的估计能力。
- 在四个数据集(IWPC、UCI Adult及另外两个)上进行实验,采用带L2正则化的线性回归与噪声扰动,验证FIL对攻击敏感度的响应能力。
实验结果
研究问题
- RQ1Fisher信息损失能否作为精确的、样本级别的数据泄露度量,准确反映现实世界中推理攻击的成功率?
- RQ2在处理相关训练数据和子群体脆弱性方面,FIL与差分隐私相比表现如何?
- RQ3IRFIL能否在不降低模型效用的前提下,有效均衡个体间的隐私泄露?
- RQ4FIL在不同数据子集上是否与实际属性反演攻击的准确率存在强相关性?
- RQ5噪声方差和正则化参数的选择如何影响FIL度量下的模型性能与隐私之间的权衡?
主要发现
- Fisher信息损失能准确预测对属性反演攻击的脆弱性,FIL值越高,样本的攻击成功率也越高。
- IRFIL在仅10次迭代后即成功均衡了初始FIL值分桶中各十等分的个体对属性反演攻击的脆弱性,显著降低了准确率差异。
- 白盒攻击的准确率与FIL值高度一致,而黑盒攻击的准确率则与均方误差(MSE)相关性更强,表明FIL对推理风险具有特异性。
- 当σ = 10⁻³且λ = 10⁻²时,白盒与黑盒攻击均被有效缓解,同时MSE退化程度较低。
- 与差分隐私不同,FIL在数据相关性下不会退化,使其在真实相关数据集中更具鲁棒性。
- IRFIL收敛迅速且鲁棒,无需超参数调优,表明其在隐私感知训练中具有实际部署可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。