[论文解读] Machine Unlearning of Features and Labels
该论文提出了首个利用影响函数实现特征和标签机器遗忘的方法,通过闭式参数更新实现,可在凸模型中实现认证遗忘,并在深度神经网络等非凸设置中实现显著加速——比微调快几个数量级,同时保持模型准确性。
Removing information from a machine learning model is a non-trivial task that requires to partially revert the training process. This task is unavoidable when sensitive data, such as credit card numbers or passwords, accidentally enter the model and need to be removed afterwards. Recently, different concepts for machine unlearning have been proposed to address this problem. While these approaches are effective in removing individual data points, they do not scale to scenarios where larger groups of features and labels need to be reverted. In this paper, we propose the first method for unlearning features and labels. Our approach builds on the concept of influence functions and realizes unlearning through closed-form updates of model parameters. It enables to adapt the influence of training data on a learning model retrospectively, thereby correcting data leaks and privacy issues. For learning models with strongly convex loss functions, our method provides certified unlearning with theoretical guarantees. For models with non-convex losses, we empirically show that unlearning features and labels is effective and significantly faster than other strategies.
研究动机与目标
- 为解决现有遗忘方法仅能移除孤立数据点,而无法处理跨多个实例分布的特征或标签的局限性。
- 实现对训练数据中分布于特征和标签中的敏感信息的高效、可扩展的遗忘。
- 为损失函数具有强凸性的模型提供遗忘的理论保证。
- 为现实世界模型中数据泄露的修正提供一种实用且快速的替代方案,优于微调或分片方法。
提出的方法
- 该方法利用影响函数估计训练数据对模型参数的影响,并将其重新表述为闭式更新以实现遗忘。
- 对于凸模型,推导出一阶和二阶梯度更新,实现具有理论保证的认证遗忘。
- 在学习过程中引入噪声,以推导出模型差异的上界,从而在差分隐私下实现可证明的遗忘。
- 对于深度神经网络等非凸模型,应用一阶更新,虽无理论保证但具有强大的经验性能。
- 该方法无需访问原始训练数据,仅依赖模型参数和影响估计即可实现遗忘。
- 支持在特征和标签层面进行遗忘,可修正跨越多个数据点的泄露问题。
实验结果
研究问题
- RQ1机器遗忘能否超越单个数据点,扩展到跨多个训练实例分布的特征和标签?
- RQ2影响函数能否被重新利用,以实现特征和标签的闭式、高效遗忘?
- RQ3所提出的方法能否为具有强凸损失函数的模型提供认证遗忘保证?
- RQ4在深度神经网络等非凸模型中,该方法与微调和分片方法相比,在速度和准确性方面表现如何?
- RQ5该方法能否在现实应用中有效缓解标签投毒和意外记忆问题?
主要发现
- 所提方法通过闭式参数更新实现特征和标签的遗忘,与微调相比运行时间减少几个数量级。
- 对于具有强凸损失函数的模型,该方法基于差分隐私和影响函数边界,提供具有理论保证的认证遗忘。
- 在具有非凸损失的深度神经网络中,一阶更新在准确性上与微调和分片方法相当,但速度显著更快。
- 该方法在不同模型规模下均保持模型准确性,运行时间几乎与参数量呈线性关系。
- 案例研究显示,该方法在逻辑回归模型中成功实现了敏感特征的遗忘,在语言模型中缓解了意外记忆,在计算机视觉中有效应对了标签投毒,且保真度损失极小。
- 即使原始训练数据不可用,该方法依然有效,仅依赖模型参数和影响估计即可实现遗忘。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。