[论文解读] Certified Data Removal from Machine Learning Models
本文提出了一种机器学习模型的认证删除机制,通过结合牛顿步更新与噪声掩码,实现类似差分隐私的保障,确保从模型中删除的数据与从未训练过的数据在统计上不可区分。该方法在保持高准确率的同时,实现了线性模型中亚秒级的高效删除,优于完整微调和差分隐私基线方法。
Good data stewardship requires removal of data at the request of the data's owner. This raises the question if and how a trained machine-learning model, which implicitly stores information about its training data, should be affected by such a removal request. Is it possible to "remove" data from a machine-learning model? We study this problem by defining certified removal: a very strong theoretical guarantee that a model from which data is removed cannot be distinguished from a model that never observed the data to begin with. We develop a certified-removal mechanism for linear classifiers and empirically study learning settings in which this mechanism is practical.
研究动机与目标
- 为解决受训机器学习模型中数据删除问题,提出满足强理论保障的不可区分性要求。
- 开发一种实用的认证删除机制,避免完整微调的同时确保隐私。
- 证明在具有L2正则化、可微分凸损失的线性模型中,认证删除是可行的。
- 在真实场景中评估删除效率、模型准确率与隐私保障之间的权衡。
- 通过结合私有特征提取与高效线性模型更新,探索在深度学习中实现认证删除的可行性。
提出的方法
- 提出基于牛顿步的认证删除机制,以逆转被删除数据点对模型参数的影响。
- 利用逆海塞矩阵对模型权重施加残差校正,使被删除数据的影响随数据集规模的增大呈二次方减少。
- 采用来自 Chaudhuri 等人(2011)的训练损失随机扰动,对残差误差进行掩码,确保与从未训练过该数据的模型不可区分。
- 将 ε-认证删除定义为删除后模型与从未包含该数据的模型之间的最大差异度量,以抵抗成员推断攻击。
- 在深度学习中采用两阶段方法:首先训练一个差分隐私特征提取器,然后对微调后的线性头应用认证删除机制。
- 将每次更新对 ε 的期望贡献设为 ε_CR ≈ ε_DP / 10,以在多次删除后仍保持整体 (ε, δ)-认证删除保障。
实验结果
研究问题
- RQ1能否从已训练的机器学习模型中删除数据,使得删除后的模型在理论上与从未见过该数据的模型不可区分?
- RQ2是否可能以低计算成本实现认证删除,避免完整微调?
- RQ3与完整微调或差分隐私训练相比,认证删除机制在模型准确率和删除效率方面表现如何?
- RQ4能否通过结合私有特征提取与高效线性模型更新,将认证删除扩展至深度神经网络?
- RQ5在认证删除中,隐私保障(ε)、模型效用与计算成本之间的权衡如何?
主要发现
- 在 LSUN 数据集上,该认证删除机制在 ε ≈ 0.1 时达到 71.2% 的测试准确率,而完全差分隐私的 CNN 仅达 22.7%。
- 在私有特征提取器之上对线性模型执行删除仅耗时 0.27 秒,远快于完整微调所需的 1.5 小时以上。
- 牛顿更新产生的残差误差随训练集规模的增大呈二次方减少,表明随着数据集增大,删除准确性提高。
- 由于噪声掩码施加的最大差异度量约束,成员推断攻击无法在被删除数据上成功。
- 该方法支持最多 10 次删除,总失败概率不超过 9/10δ,同时保持 (ε, δ)-认证删除保障。
- 理论分析表明,该机制提供强保障:被删除模型在统计上与从未训练过该数据的模型不可区分。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。